Исследователи из Google предложили архитектуру SKILL.state, способную сократить расход токенов в длинных агентских сессиях вплоть до 98%. Классические агенты на базе парадигмы ReAct страдают врожденным архитектурным дефектом: на каждом шаге модель заново перечитывает весь лог предыдущих действий. В итоге размер входного промпта растет линейно, совокупные затраты на инференс увеличиваются квадратично, а нейросеть начинает банально галлюцинировать, теряя логику в раздутом контекстном окне.
Инженерное решение Google прагматично: вместо бесконечной простыни диалога агенту передают компактное изменяемое состояние выполнения — execution state. Модель генерирует команду для внешней среды и короткий диф-патч с правками относительно прошлого шага. Среда исполняет команду, а на следующий вход нейросети поступают только обновленный стейт, базовый системный промпт и свежий ответ среды. Контекст фиксируется в объеме, а суммарный счет за токены растет строго линейно, а не по экспоненте.
На бенчмарке управления складом подход срезал 93,8% токенов на дистанции в 100 шагов и 98% — на 200 шагах. В практических тестах вроде InterCode CTF точность выросла до 54,2% против базовых 40–45%: модель перестала спотыкаться о собственные отброшенные гипотезы, захламлявшие память. Главный плюс для корпоративного контура — метод не требует дообучения весов и работает поверх любых коммерческих API простой сменой логики промптинга в рантайме.