Раздувание контекстного окна в стандартных авторегрессионных моделях стало дефолтным пластырем индустрии для починки нестабильных многоэтапных агентных пайплайнов. Однако свежее исследование Кембриджского университета доказывает: архитектурная рекуррентность справляется с этой задачей значительно точнее. Исследователи в области компьютерных наук Андрей Кристиан Попеску, Хаиц Саэс де Окарис Борде и Пьетро Лио продемонстрировали, что циклические языковые модели (Looped LLMs) существенно превосходят классические архитектуры на сложных бенчмарках взаимодействия с внешними инструментами, включая API-Bank, BFCL и NESTful.

Вместо сжигания вычислительных мощностей на раздутый KV-кэш, циклические архитектуры итеративно пропускают скрытые представления через один и тот же набор весов перед генерацией выходных токенов. Такое рекурсивное уточнение позволяет модели надежно фиксировать взаимосвязи между инструментами в сложных композиционных цепочках API-вызовов без линейного роста затрат на вычисления. В ходе тестов нативные циклические модели Ouro-1.4B SFT и Ouro-2.6B SFT уверенно обошли традиционные базовые решения, включая Qwen3-1.7B SFT, Qwen3-4B SFT и Llama-3.2-3B SFT. Добавление рекуррентности в стандартные чекпоинты Llama-3.2-1B и OLMo-2-1B обеспечило сопоставимый скачок точности вычислений — причем без увеличения общего числа параметров.

Для технических лидеров, борющихся с хрупкостью многоагентных пайплайнов, практический вывод очевиден: галлюцинации агентов при оркестрации инструментов вызваны поверхностностью внутренних представлений, а не длиной промпта. Внедрение адаптивного рекуррентного инференса, запускающего циклы итераций только при обработке сложных графов зависимостей, гарантирует стабильное выполнение задач без раздувания корпоративных счетов за вычислительные ресурсы.

Искусственный интеллектБольшие языковые моделиИИ-агентыСнижение затрат