Экономика обучения больших языковых моделей давно сместилась от битвы гигантских вычислительных кластеров к банальному дефициту качественных текстовых корпусов. Публичный интернет вычерпан до дна, и теперь разработчики вынуждены скупать закрытые архивы, корпоративную почту и специализированные базы знаний за миллионы долларов. Это кардинально переопределяет рентабельность дообучения моделей и заставляет бизнес пересчитывать экономику инфраструктуры.

Платный доступ к пользовательским дискуссиям

Форумы десятилетиями аккумулировали живые диалоги людей, поэтому разработчики моделей рассматривают их как идеальный источник текстов. Первым заметным сигналом смены правил игры стал Reddit. В апреле 2023 года платформа объявила об отмене бесплатного доступа к своему API, чтобы защитить контент от бесконтрольного использования создателями LLM. Самый популярный клиент для iOS под названием Apollo закрылся, поскольку его разработчик признался, что API обошёлся бы примерно в 20 миллионов долларов в год.

Доступ к дискуссиям на Reddit обошёлся Google примерно в 60 миллионов долларов в год, показав реальную цену пользовательских текстов для разработчиков моделей.

При подготовке к IPO руководство Reddit раскрыло, что суммарный объём подобных соглашений превысил 200 миллионов долларов. Рынок окончательно перешёл к прямым коммерческим закупкам текстовых массивов.

Контракты с издательствами и архивами

Весной 2024 года OpenAI начала систематически подписывать лицензионные контракты со СМИ и держателями архивов. Компания оформила соглашение с News Corp на сумму свыше 250 миллионов долларов сроком на пять лет. Вслед за этим последовали контракты с медиахолдингом Dotdash Meredith на сумму не менее 16 миллионов долларов, с Axel Springer примерно на 13 миллионов долларов в год сроком до трёх лет, а также с Financial Times на 5–10 миллионов долларов ежегодно.

Аналогичные процессы затронули научную литературу и визуальный контент. Издательство Wiley оформило две сделки с неназванными партнёрами на 21 и 23 миллиона долларов соответственно, а британская Informa получила стартовый платёж в 10 миллионов долларов от Microsoft.

Исчерпание открытого интернета и банкротные аукционы

Причину масштабных трат объясняет демография обучающих выборок. Как следует из отчёта исследователей из Epoch AI за 2024 год, созданный человеком общедоступный контент начнёт резко исчерпываться уже к 2026 году. Этот дефицит качественного сырья заставляет корпорации искать данные в самых нетипичных местах, включая закрытые корпоративные архивы.

На наш взгляд, покупка чужих переписок и баз знаний неизбежно упрётся в жёсткие юридические риски, комплаенс и вопросы защиты конфиденциальности. Продажа корпоративных архивов способна перевернуть всю экономику дообучения моделей, превратив юридические отделы в главных регуляторов рынка ИИ. Корпорациям придется выбирать между судебными исками за утечку данных и миллиардными инвестициями в закрытые датасеты.

Большие языковые моделиИнвестиции в ИИДообучение моделейOpenAI