Экономика обучения больших языковых моделей давно сместилась от битвы гигантских вычислительных кластеров к банальному дефициту качественных текстовых корпусов. Публичный интернет вычерпан до дна, и теперь разработчики вынуждены скупать закрытые архивы, корпоративную почту и специализированные базы знаний за миллионы долларов. Это кардинально переопределяет рентабельность дообучения моделей и заставляет бизнес пересчитывать экономику инфраструктуры.
Платный доступ к пользовательским дискуссиям
Форумы десятилетиями аккумулировали живые диалоги людей, поэтому разработчики моделей рассматривают их как идеальный источник текстов. Первым заметным сигналом смены правил игры стал Reddit. В апреле 2023 года платформа объявила об отмене бесплатного доступа к своему API, чтобы защитить контент от бесконтрольного использования создателями LLM. Самый популярный клиент для iOS под названием Apollo закрылся, поскольку его разработчик признался, что API обошёлся бы примерно в 20 миллионов долларов в год.
Доступ к дискуссиям на Reddit обошёлся Google примерно в 60 миллионов долларов в год, показав реальную цену пользовательских текстов для разработчиков моделей.
При подготовке к IPO руководство Reddit раскрыло, что суммарный объём подобных соглашений превысил 200 миллионов долларов. Рынок окончательно перешёл к прямым коммерческим закупкам текстовых массивов.
Контракты с издательствами и архивами
Весной 2024 года OpenAI начала систематически подписывать лицензионные контракты со СМИ и держателями архивов. Компания оформила соглашение с News Corp на сумму свыше 250 миллионов долларов сроком на пять лет. Вслед за этим последовали контракты с медиахолдингом Dotdash Meredith на сумму не менее 16 миллионов долларов, с Axel Springer примерно на 13 миллионов долларов в год сроком до трёх лет, а также с Financial Times на 5–10 миллионов долларов ежегодно.
Аналогичные процессы затронули научную литературу и визуальный контент. Издательство Wiley оформило две сделки с неназванными партнёрами на 21 и 23 миллиона долларов соответственно, а британская Informa получила стартовый платёж в 10 миллионов долларов от Microsoft.
Исчерпание открытого интернета и банкротные аукционы
Причину масштабных трат объясняет демография обучающих выборок. Как следует из отчёта исследователей из Epoch AI за 2024 год, созданный человеком общедоступный контент начнёт резко исчерпываться уже к 2026 году. Этот дефицит качественного сырья заставляет корпорации искать данные в самых нетипичных местах, включая закрытые корпоративные архивы.
На наш взгляд, покупка чужих переписок и баз знаний неизбежно упрётся в жёсткие юридические риски, комплаенс и вопросы защиты конфиденциальности. Продажа корпоративных архивов способна перевернуть всю экономику дообучения моделей, превратив юридические отделы в главных регуляторов рынка ИИ. Корпорациям придется выбирать между судебными исками за утечку данных и миллиардными инвестициями в закрытые датасеты.