Автономные агенты, выполняющие многочасовые рабочие сценарии, регулярно упираются в знакомый барьер: исчерпание контекстного окна. Стандартные обходные пути — будь то грубое сжатие текста или поиск через RAG с потерями данных — неизбежно отбрасывают низкоуровневые результаты работы инструментов задолго до того, как они понадобятся для последующих шагов рассуждения. Как отмечают Инь Линь из Alibaba Group, Элейн Анг из Колумбийского университета и их соавторы в препринте на arXiv, фундаментальная проблема кроется в отношении к контексту как к статичному дампу промпта, а не как к активной программной среде выполнения.
Предложенная авторами архитектура Scroll заменяет статичную историю диалога средой выполнения с сохранением состояния. В ее основе лежит журнал событий с возможностью только добавления (append-only Event Log), сохраняющий точную историю операций, в связке с изолированным постоянным ядром Python. Вместо сериализации тяжелых массивов JSON или ответов инструментов напрямую в рабочий контекст, Scroll присваивает эти результаты типизированным переменным. Модель управляет состоянием через выполнение кода, проецируя в активный промпт только явно отрисованные результаты. Когда емкость контекста сокращается, неактуальные блоки выгружаются в индекс со специальными компактными указателями, обеспечивая агенту детерминированный произвольный доступ к исходным логам операций без раздувания промпта.
Тестирование архитектуры на базе модели Qwen3.8-Max показало практическое преимущество перед наивными методами объединения памяти. Scroll показал результат 94,8% на бенчмарке LongMemEval S и 73,1% на BEAM10M, опередив лучший опубликованный базовый метод управления памятью на 5,1 процентного пункта. На бенчмарке для длинных горизонтов планирования LOCA256K система достигла 86,7%, что на 37,4 процентного пункта выше предыдущих решений. Для корпоративных команд, запускающих автономные многоэтапные пайплайны, переход от сериализации промптов к программному управлению состоянием выглядит наиболее реалистичным способом сохранить точность рассуждений без сжигания бюджета на токены.