Эпоха примитивного роутинга моделей официально мертва. Годами ИТ-архитекторы строили агентские системы на базе наивной классификации: простые запросы — дешевым «малышам», сложные — флагманам, а разницу в карман. Однако свежее исследование IBM Research (Яра Ризк, Эяль Шнарх, Джейсон Цай и Мерве Унувар) доказывает: этот подход к маршрутизации в корне неверен. То, что кажется задачей выбора модели, на деле превращается в проблему системной оптимизации, которую не решить стандартными эвристиками.
Парадокс кэширования и нелинейная экономика
Вера в то, что низкий ценник за миллион токенов гарантирует минимальную стоимость владения (TCO), разбивается о суровую реальность бенчмарков. В ходе анализа 417 задач в AppWorld Test Challenge с использованием агента CodeAct исследователи обнаружили аномалию: GPT-4.1 обошлась в $155 ($0,37 за задачу), тогда как Claude 4.6 Sonnet «съела» всего $79 ($0,19 за задачу). На бумаге это выглядит бредом: у GPT-4.1 ниже стоимость входных и выходных токенов, а Sonnet 4.6 требовала в три раза больше шагов рассуждения для тех же задач.
Роутер, который смотрит только в прайс-лист вендора, оптимизирует систему под случайные цифры.
Разгадка кроется не в архитектуре нейросетей, а в инфраструктуре обслуживания. Агентские нагрузки повторно используют огромные куски контекста на каждом шаге, превращая коэффициент попадания в кэш (cache hit rate) в главный фактор расхода. Поскольку Claude 4.6 предложила более агрессивные скидки на чтение из кэша, она оказалась выгоднее даже при более длинных траекториях выполнения. Реальная эффективность теперь зависит от связки «модель — нагрузка — инфраструктура», а не от маркетинговых таблиц Open AI или Anthropic.
Невидимая сложность на входе
Попытки CTO делить задачи по «сложности» — это тупик, потому что сложность не видна в момент входа. Как отмечают в IBM Research, запрос «резюмируй контракт» может казаться элементарным, но на деле вызвать рекурсивный поиск, проверки комплаенса и вызовы десятка инструментов. Напротив, тяжелый технический промпт может быть моментально закрыт узкоспециализированной малой моделью. К этому добавляется технический барьер: задержки (latency) и деградация контекста при передаче «состояния» между разными архитектурами моделей превращают каскадную маршрутизацию в финансовую черную дыру.
Оптимизация под ценник токена — это стратегия вчерашнего дня, игнорирующая механику современных агентов. Когда слой оркестрации и логика кэширования диктуют итоговый счет, сама модель становится вторичной переменной. Настоящая маржа сегодня создается инженерией систем на переднем крае, а не выбиванием скидок из API-провайдеров.