Замена программной обвязки (harness) вокруг неизменной базовой языковой модели кардинально улучшает результаты ИИ-агентов для написания кода без обновления весов нейросети. В препринте исследования Сидни Льюис протестировала архитектуру Yuj на бенчмарках SWE-bench Verified, SWE-bench Pro и FeatureBench. При жестком ограничении контекстного окна в 20 480 токенов и тайм-ауте 480 секунд на 169 задачах SWE-bench Verified подключение замороженной модели к активной среде с обратной связью повысило долю решенных задач (fail-to-pass) с 28% до 49%, а число полностью закрытых тикетов выросло с 43 до 72.

Этот скачок эффективности обусловлен не рекордным числом параметров, а грамотной организацией рантайма. Стандартные конфигурации агентов передают историю диалога хронологически, пока контекстное окно не переполнится, вызывая сбой. Оптимизированная обвязка автоматически сжимает устаревшие результаты работы инструментов и принудительно прерывает зацикливания — например, повторяющиеся неудачные команды в терминале или многократное чтение файлов без внесения правок. Та же детерминированная архитектура обеспечила стабильный прирост метрик на трех других моделях без дополнительной настройки под каждую из них.

Главное

Оптимизация управления контекстом и инструментальным слоем дает более высокий ROI, чем миграция на тяжелые флагманские модели. На тестах Qwen3.6 оптимизированная обвязка тратила меньше токенов на шаг рассуждений, сохранив базовую точность на SWE-bench и показав лучший результат на FeatureBench. Корпоративным командам разработки и составителям бенчмарков стоит оценивать связку пайплайна агента и контекстной обвязки как единую систему, а не ориентироваться исключительно на веса модели.

ИИ-агентыБольшие языковые моделиСнижение затратПроизводительностьАвтоматизация