Автономные ИИ-агенты для разработки ПО в ходе решения одной задачи регулярно выполняют десятки и сотни вызовов инструментов, правок в кодовой базе и шагов логического вывода. Поскольку возможности модели напрямую определяют стоимость вычислений, системные архитекторы все чаще полагаются на динамическую маршрутизацию: начинают задачу на дешевых и менее производительных решениях, переключаясь на флагманские модели только тогда, когда агент заходит в тупик. Среды разработки даже закрепили этот подход с помощью переключателей в интерфейсе вроде команды `/model` прямо во время сессии.
Однако эмпирические данные команды AWS Agentic AI показывают, что передача контекста между разнородными моделями наносит серьезный удар по общей производительности. В исследовании специалистов AWS Роя Ганза, Мор Шпигель Наксон, Ади Кальянпура и Рона Литмана демонстрируется, что смена модели прямо на лету заставляет принимающую систему тратить ресурсы на расшифровку чужой логики и тупиковых шагов, незаметно уничтожая всю ожидаемую экономию.
Анатомия налога на передачу контекста
Когда продвинутая модель перехватывает управление активным процессом, она наследует непривычный синтаксис, промежуточные артефакты работы инструментов и цепочки рассуждений, сгенерированные более слабой моделью. Протестировав такие переходы на парах дешевых (LC) и дорогих флагманских (HC) моделей семейств Claude от Anthropic и GPT от OpenAI, исследователи обнаружили: передача неотредактированной истории диалога резко снижает потолок возможностей принимающей модели.
Эскалация задачи с полной историей компенсирует менее половины разрыва в качестве между дешевой и дорогой моделью, приводя при этом к существенному росту расходов.
Вместо быстрого и точного решения сложного краевого случая флагманская модель начинает отталкиваться от ошибочных гипотез и зашумленных вызовов инструментов своего предшественника. Вынужденная обрабатывать раздутое контекстное окно, забитое накапливающимися ошибками, премиальная модель сжигает лишние токены и демонстрирует показатели успешности заметно ниже своего базового уровня.
С точки зрения бизнес-процессов это похоже на подключение ведущего системного архитектора к устранению аварии без контекста: если заставить его разбирать сотню неграмотных консольных команд, введенных джуниором, эксперт потратит большую часть времени на распутывание чужих ложных предположений, а не на решение первопричины сбоя.
Асимметричные интерфейсы и очистка истории
Авторы исследования протестировали три интерфейса передачи контекста: дословную отправку сырой истории шагов, сжатие предыдущих действий в краткую сводку и радикальную очистку траектории, при которой история диалога полностью стирается, но сохраняется актуальное состояние файлов в репозитории. Эмпирические данные выявили фундаментальную асимметрию, зависящую от направления маршрутизации.
При эскалации снизу вверх — от бюджетной модели к флагманской — полное удаление предшествующей истории рассуждений стабильно обеспечивает более высокий процент успешного выполнения задач. Продвинутые модели работают значительно лучше, когда получают чистое состояние кодовой базы, а не груз низкокачественных рассуждений предшественника. Напротив, при переходе сверху вниз — от флагмана к более дешевой модели — требуется диаметрально противоположная архитектура: слабым моделям критически необходимы структурированные планы выполнения, каркас решений и точный контекст, сформированный сильной моделью. Удаление истории при таком переходе приводит к полному провалу дешевой модели.
Наивное каскадирование моделей нельзя рассматривать как обычную механическую переадресацию токенов. Передача нефильтрованной истории между разнородными архитектурами разрушает логику рассуждений агентов. Корпоративные сценарии требуют направленного управления контекстом: его полной очистки или санирования при переходе к флагманским системам и сохранения структурированного состояния при передаче подзадач дешевым исполнителям.