Инженерные команды регулярно используют контекстное окно как бездонную свалку для оперативной памяти, наивно полагая, что передача агенту списка всех прошлых ошибок, пограничных случаев и правил рабочего процесса будет стабильно повышать качество работы. На практике же грубое заталкивание инструкций в промпт лишь раздувает расходы на токены при инференсе и вносит критический шум в рассуждения моделей большинства классов.
Калибровка памяти под класс модели
Свежее эмпирическое исследование IBM Research разрушает миф о том, что увеличение объема агентной памяти автоматически повышает точность. Оценив восемь языковых моделей на базе различных архитектур памяти, исследователи Ватче Исахагян, Гаодань Фан, Джаярам Радхакришнан и их соавторы доказали: польза памяти строго ограничена базовой мощностью модели, а не чистым объемом контекста.
«Память агента — это не функция, которую просто включают. Это дозировка, которую необходимо калибровать под конкретную модель».
Команда IBM Research наглядно показала, что модели разного уровня справляются с плотностью инструкций принципиально по-разному. Флагманские системы с колоссальным запасом параметров способны усваивать исчерпывающую историю операций без потери логики выполнения: DeepSeek-V3.2 (модель MoE на 671 млрд параметров) прибавила 9,5 процентных пункта к успешности выполнения задач при передаче полного массива ранее сформированных правил. Однако перенос такого метода в лоб в корпоративную практику — кратчайший путь к истощению бюджета.
Выборочное извлечение против полной инъекции промпта
Для средних и компактных архитектур сброс всей базы памяти прямо в контекстное окно вызывает резкую деградацию рассуждений наряду с неконтролируемым ростом затрат на инференс. Во фреймворках рефлексии вроде ALTK-Evolve и архитектурах Agent Workflow Memory, которые извлекают эвристики выполнения из прошлых запусков без дообучения весов, фильтрация промптов становится вопросом выживания системы в продакшене. В тестах IBM Research на модели gpt-oss-120b (MoE на 117 млрд параметров) загрузка полного набора инструкций дала скромный прирост качества при раздувании расхода токенов сразу на 50%.
Напротив, связка компактного базового набора с динамическим поиском релевантных инструкций под конкретный запрос позволила gpt-oss-120b прибавить 16,1 процентного пункта к успешности задач с накладными расходами по токенам всего в 5%. В то же время перенасыщенные модели моментально упираются в потолок возможностей и не показывают никакого прироста производительности от добавления инструкций независимо от способа их передачи.
Аудит агентных пайплайнов в продакшене требует относиться к памяти как к калибруемому гиперпараметру, а не как к статичной свалке промптов. Корпоративным архитекторам пора отказаться от слепой набивки контекста в пользу динамического извлечения данных под задачу — это снизит совокупную стоимость владения инференсом и защитит логику рассуждений агентов от замусоривания контекста.