Несколько лет развитие генеративного ИИ напоминало турнирную таблицу: лаборатории выпускали очередного титана, соревновались бенчмарками и увлеченно мерились синтетическими баллами. Однако возможность обучить колоссальную модель больше не гарантирует, что бизнес побежит внедрять её во все контуры подряд.
Корпоративные клиенты начали жестко считать окупаемость каждого API-вызова. Если мизерный прирост качества флагмана не конвертируется в измеримый финансовый эффект в продукте, переплачивать за избыточную мощь CFO и CTO больше не станут.
Интеллект как единственная метрика
Когда 30 ноября 2022 года OpenAI запустила ChatGPT, технология мгновенно стала массовым продуктом, хотя сами большие языковые модели существовали и раньше. Гонка стартовала: 14 марта 2023 года дебютировала GPT-4 с поддержкой изображений и текста, совершив заметный скачок в тестах. В симуляции американского экзамена на адвоката (bar exam) GPT-4 попала примерно в верхние 10% результатов, тогда как GPT-3.5 оставалась около нижних 10%.
В симуляции американского bar exam GPT-4 оказалась примерно в верхних 10% результатов, тогда как GPT-3.5 находилась около нижних 10%.
С этого момента именно GPT-4 стала ориентиром для рынка, но вскоре бизнес осознал: абстрактный интеллект в вакууме не решает прикладных задач. Anthropic включилась в борьбу через размер рабочего окна: модель Claude предложила контекст в 100 тысяч токенов, упростив разбор длинных документов. А в декабре Google показала линейку Gemini 1.0 сразу в версиях Ultra, Pro и Nano, фактически разделив вычисления по сценариям нагрузки.
Дробление классов и борьба за задержку
В 2024 году идея универсального гиганта окончательно уступила место прагматизму архитектурных пайплайнов. В феврале 2024 года Google представила Gemini 1.5 Pro с архитектурой Mixture-of-Experts (MoE) — система активирует под конкретные данные нужные группы экспертов, а не прогоняет запрос через всю сеть. В закрытом превью Gemini 1.5 Pro справлялась с контекстом до миллиона токенов.
Следом в марте Anthropic сегментировала семейство Claude 3 на Opus, Sonnet и Haiku, предложив рынку четкую градацию интеллекта, задержки (latency) и цены. В мае OpenAI выкатила мультимодальную GPT-4o, которая стоила через API примерно вдвое дешевле GPT-4 Turbo при сопоставимом текстовом качестве. Параллельно Google выпустила Gemini 1.5 Flash с прицелом на минимальную себестоимость и миллисекундный отклик.
Погоня за абстрактным лидерством в бенчмарках сменилась трезвым расчетом unit-экономики инференса. Для бизнеса время дорогих универсальных монолитов закрыто: в продакшене побеждают специализированные каскады моделей, где флагманам оставлены лишь редкие нестандартные задачи.