По мере того как горизонт задач в AI-взаимодействии расширяется, индустрия упирается в функциональный тупик: вера в бесконечное контекстное окно (Context Window) себя не оправдывает. В сложных доменах, таких как совместная разработка ПО, простое наращивание «памяти» или использование традиционной рекурсивной суммаризации приводит к деградации логики. Даже такие тяжеловесы, как Cursor в своем Composer 2.5 или Grandcode (базирующийся на Qwen 3.5-397B), все еще пытаются выезжать на сжатии контекста, но эта стратегия порочна. На практике провайдеры вроде Cursor прямо советуют пользователям отключать компактность во время активных сессий — качество падает на глазах. Проблема фундаментальна: заставлять модель одновременно выполнять код и заниматься саморефлексией (суммаризацией) — значит перегружать архитектуру взаимоисключающими задачами.

Провал «бутылочного горлышка» суммаризации

Данные показывают: даже дообучение через RL не помогает стратегиям суммаризации догнать модели с полным контекстом. В бенчмарке Combination Lock, где требуется серия точных ходов, модели на базе суммаризации обучались, но стабильно проигрывали тем, кто видел историю целиком. Этот разрыв становится критическим там, где мало качественных обучающих данных. Как отмечают исследователи Линь и Томлин, создать адекватный симулятор человека для обучения практически невозможно. Без него нельзя сгенерировать траектории, которые научили бы модель сжимать историю, не теряя нюансов. Чтобы агент мог эффективно ассистировать в разработке на протяжении сотен шагов, ему нужен не сжимающийся архив, а активное внутреннее состояние.

ABBEL и механика Belief Grading

Решением может стать ABBEL — фреймворк, заменяющий безликие краткие содержания на «состояния убеждений» (belief states). Вместо того чтобы просто кромсать текст, модель изолирует и обновляет свои внутренние пресуппозиции на основе новых действий и наблюдений.

«Мы решаем проблему с помощью ABBEL: фреймворка, который изолирует и контролирует информационное содержание суммаризаций в форме убеждений на естественном языке».

Для поддержания актуальности этих убеждений на длинных дистанциях введена методология belief grading. Это вспомогательная задача, где модель получает награду в зависимости от того, насколько хорошо ее «убеждение» позволяет восстановить (реконструировать) факты из истории. Обращаясь с моделью одновременно как с кодером и декодером собственного прошлого, ABBEL гарантирует, что в будущее передается только полезная информация, а не просто укороченный лог.

Финал эпохи пассивного хранения

Цифры подтверждают: функция оценки на основе реконструкции резко подтягивает качество суммаризирующих моделей. Будущее длинных AI-сессий лежит не в гигантских буферах памяти, а в жестком контроле над тем, как агенты интерпретируют и хранят свой опыт. Переход от пассивного сжатия к активному управлению убеждениями — это водораздел в создании автономных систем. Хотя ABBEL значительно сокращает отставание от моделей с полным контекстом, он не устраняет его полностью, а субъективность «полезной» информации остается вызовом. Для техлидов вывод очевиден: не стоит ждать, что бесконечное контекстную окно решит проблему логического дрейфа. Следующее поколение надежных кодинг-ассистентов потребует архитектур, ориентированных на реконструкцию смыслов, а не на механическую компрессию текста.

Большие языковые моделиИИ-агентыМашинное обучениеИИ-инструменты