Гонка за обучение передовых языковых моделей неизбежно уперлась в дефицит качественных данных в открытом интернете, что вынудило отделы корпоративных закупок вернуться в физический мир. По мере того как публично индексируемый веб-контент замусоривается рекурсивным синтетическим мусором, лаборатории готовы переплачивать за чистый человеческий текст, созданный до 2022 года и сохранившийся на бумаге. Чтобы оцифровывать физические тома с максимальной пропускной способностью, разработчики используют деструктивные методы: срезают корешки книг и пропускают отдельные страницы через высокоскоростные OCR-сканеры, превращая уникальные издания в промышленные отходы.

Согласно расследованию, опубликованному на платформе Anna's Blog волонтером под ником «u», ведущие ИИ-компании регулярно скупают огромные партии букинистических и вышедших из тиража книг через подставные юридические лица. Показательным примером стала засекреченная инициатива Anthropic «Project Panama», стартовавшая в начале 2024 года и всплывшая в ходе судебного разбирательства о нарушении авторских прав на 1,5 миллиарда долларов. В рамках этого проекта Anthropic выделила десятки миллионов долларов на скупку миллионов физических книг, срезала с них переплеты для обучения модели Claude и утилизировала остатки.

Экономика монополизации данных

Деструктивное сканирование обусловлено вовсе не техническими ограничениями, а экономическим и стратегическим расчетом. Обрезка книжных переплетов на гильотине обходится в разы дешевле и происходит значительно быстрее, чем бережная оцифровка на бесконтактных планетарных сканерах. Что еще важнее, физическое уничтожение книг гарантирует, что конкуренты не получат доступ к тем же исходникам, а также ликвидирует вещественные доказательства, способные осложнить аудит авторских прав в случае судебных исков.

«После того как ИИ-корпорации массово сканируют и уничтожают физические книги, они становятся единственными в мире обладателями цифровых копий. Знания окончательно монополизируются на закрытых серверах».

Как подчеркивает волонтер «u» из Anna's Archive, подобная практика полностью противоречит декларируемой миссии демократизации данных. Коммерческие лаборатории позиционируют базовые модели как инструмент всеобщей доступности человеческих знаний, однако механизм их сбора фактически приватизирует историческое печатное наследие внутри закрытых весов нейросетей, не возвращая распознанные тексты в общественное достояние.

Контрстратегия теневых библиотек

Сокращение физических запасов литературы совпало с моментом, когда индустрия практически исчерпала пригодные цифровые корпуса. Неоцифрованные фонды независимых книжных магазинов, частных коллекций и вторичного рынка остаются последним резервуаром подлинной человеческой мысли высокой плотности.

В ответ на это теневые библиотеки, такие как Anna's Archive, запустили экстренную кампанию по сохранению наследия. Проект координирует сеть волонтеров для поиска, бережной бесконтактной оцифровки и загрузки редких архивов, малотиражных журналов и букинистических изданий до того, как корпоративные скупщики опустошат вторичный рынок. Предлагая пожизненный доступ и вознаграждения, активисты стремятся создать открытый общественный корпус данных, пока ИИ-гиганты не пустили на макулатуру остатки аналоговой культуры.

Искусственный интеллектБольшие языковые моделиAnthropicРегулирование ИИОпенсорс ИИ