Юридическое поле вокруг разработки фундаментального ИИ вышло далеко за рамки споров о сходстве сгенерированного контента и добросовестном использовании (fair use). По мере того как правообладатели совершенствуют судебные стратегии, главный удар смещается непосредственно на пайплайны сбора данных — и на топ-менеджеров, которые их утверждают. В федеральном суде Северной Калифорнии крупнейшие музыкальные издатели, включая Sony Music и Warner Music, подали подробный 48-страничный иск против Anthropic, указав генерального директора Дарио Амодеи и сооснователя Бенджамина Манна в качестве персональных ответчиков.
В иске утверждается, что Anthropic систематически собирала десятки тысяч защищенных авторским правом музыкальных композиций, нот и текстов песен без лицензионных соглашений для обучения своих моделей Claude. Истцы требуют установленной законом компенсации в размере до 150 000 долларов за каждое нарушенное произведение, а также штрафы до 25 000 долларов за каждое нарушение, связанное с удалением метаданных об управлении авторскими правами.
«Доктор Амодеи прямо руководил, одобрял, контролировал и намеренно стимулировал эти нарушения со стороны господина Манна и других сотрудников Anthropic», — говорится в 48-страничном иске.
Пробивая корпоративную вуаль и нацеливаясь напрямую на руководство, музыкальные издатели создают жесткий прецедент: операционный контроль за сбором данных перестает быть абстрактной ответственностью компании и становится личным риском для фаундеров. Называя операцию «одной из крупнейших и наиболее вопиющих продолжающихся краж интеллектуальной собственности в истории», истцы дают понять: подписание топ-менеджерами непроверенных датасетов будет расцениваться как умышленное правонарушение, а не как обезличенный рабочий процесс.
Уязвимость торрентов и аудит пайплайнов
Эта атака опирается на уже болезненный для компании опыт. В сентябре 2025 года Anthropic пошла на рекордное мировое соглашение на сумму 1,5 миллиарда долларов с авторами и издателями из-за использования пиратских книжных репозиториев. В том конфликте ключевой риск возник из-за загрузки сырых торрентов вместо согласования проверенных корпоративных лицензий.
Sony и Warner бьют ровно в то же уязвимое место. В иске утверждается, что Anthropic выкачала не менее семи миллионов книг из теневых библиотек LibGen и PiLiMi. Правообладатели настаивают, что несанкционированное получение данных само по себе образует состав нарушения — независимо от того, выдает ли модель дословный текст при инференсе. В заявлении компанию также обвиняют в парсинге текстов песен с MusixMatch и LyricFind в нарушение условий обслуживания, обработке спорных датасетов вроде Books3 и The Pile и даже в физическом сканировании и уничтожении печатных нотных сборников.
Для разработчиков корпоративного ИИ вывод однозначен: юридическое противостояние больше не привязано к выводам модели на этапе генерации. Ответственность наступает в момент, когда нелицензированные файлы попадают во внутренние хранилища, превращая сам ETL-пайплайн в экзистенциальный риск для бизнеса.
Синтетические данные и обратная связь моделей
Иск также наносит прямой удар по стандартной отраслевой практике изоляции готовых моделей от некачественных исходных данных. Хотя Anthropic публично заявляла, что массивы LibGen и PiLiMi были исключены из релизных чекпоинтов Claude, истцы считают это разделение юридической фикцией.
В иске утверждается, что Anthropic использовала спорные исходники для обучения промежуточных моделей, которые затем генерировали синтетические датасеты для дообучения коммерческих версий. Если суды признают, что синтетические данные наследуют юридические пороки исходной выборки, корпоративные стратегии очистки через синтетику рухнут, оставив топ-менеджеров один на один с катастрофическими штрафами.