Когда в конце 2023 года The New York Times подала в суд на OpenAI и Microsoft, издательство метило в самое уязвимое место: требовало миллиарды долларов компенсации и уничтожения базовых моделей, обученных на его архивах. Дело преподносилось как экзистенциальная битва за интеллектуальную собственность. Теперь в процесс официально вмешалось Министерство юстиции США — и нанесло сокрушительный удар по стратегии монетизации медиаиндустрии.
Разделение процесса обучения и генерации контента
В экспертном заключении (amicus brief) Минюст провел четкую границу между машинной обработкой данных и незаконным воспроизведением защищенных материалов. Заняв сторону разработчиков моделей, федеральные юристы заявили: использование защищенных авторским правом текстов для обучения систем полностью подпадает под доктрину добросовестного использования (fair use). Ведомство указало на фундаментальную ошибку в правовой логике издателей: смешение внутреннего алгоритмического обучения с готовым результатом, который получает корпоративный пользователь.
Хотя модели целиком обрабатывают исходные тексты для выявления статистических закономерностей и смысловых связей, сами оригинальные произведения не распространяются среди публики. До тех пор пока сгенерированный контент не копирует напрямую исходные данные, сам этап обучения не нарушает закон. В качестве аргумента Минюст упомянул писательницу Джоан Дидион, которая в юности вручную перепечатывала прозу Эрнеста Хемингуэя, чтобы освоить структуру предложений. По логике The New York Times, Дидион должна была понести правовую ответственность в момент публикации собственных романов. Введение штрафов за алгоритмическое обучение заблокирует инновации, стимулировать которые и призвано авторское право, предупредило ведомство.
Конфликт ведомств и масштабирование ИИ
Позиция Минюста прямо противоречит взглядам Бюро авторского права США, ранее утверждавшего, что многомиллиардную языковую модель нельзя приравнивать к автору-человеку, изучающему тексты. Однако для корпоративных заказчиков и руководителей ML-направлений заявление Минюста создает необходимую правовую определенность.
Требование оформлять ретроактивные лицензии на каждый токен при сборе данных из открытого интернета привело бы к колоссальным расходам. Это сделало бы разработку передовых LLM доступной лишь нескольким технологическим гигантам, способным расплачиваться с традиционными медиахолдингами. Защищая концепцию добросовестного использования при обучении моделей, Минюст снижает риски многомиллионных выплат по схожим искам. Дискуссия наконец смещается в конструктивное русло: спорить будут не о том, могут ли модели учиться на публичных данных, а о том, не нарушают ли чужие права их коммерческие результаты.