Бенчмарки в сфере программной инженерии все сильнее полагаются на среды выполнения для перевода базовых возможностей языковых моделей в функциональных агентов. Поскольку эти среды обычно тестируются как монолитные системы, причины различий в их производительности оставались не до конца ясными.

Чтобы разобраться в точных механизмах работы таких систем, исследователи Ран-Зе Фан, Цзихао Чжан, Симин Ма, Ебовен Ху, Шоуцзю Ван, Кайцян Сонг, Фэй Лю, Хамед Замани и Сяоян Ван провели систематический анализ среды кодирования. Команда зафиксировала базовый цикл выполнения, чтобы оценить 176 сопоставимых настроек для четырех моделей на SWE-Bench Verified и Terminal-Bench 2.1. Их подход изолирует пять стратегий управления контекстом, четыре бюджета контекстного окна, а также целевые отключения алгоритмов планирования и интерфейсов взаимодействия.

Управление контекстом и компромиссы инструментов

Эмпирический анализ показывает, что управление контекстом становится тем ценнее, чем жестче ограничен бюджет контекстного окна, причем основная польза заключается в предотвращении сбоев из-за переполнения контекста, а не в кардинальном изменении подходов к решению задач. Оценки на уровне траекторий показывают, что управление контекстом удлиняет траектории выполнения без существенного изменения поведения агента.

Применение правил сокращения перед суммаризацией с помощью LLM обеспечивает наивысшую общую эффективность среди стратегий управления контекстом, в то время как попытки сделать отброшенный контент восстановимым добавляют сложность, которую модели используют крайне редко, и не дают прироста точности.

При проектировании интерфейсов инструментов исследователи заметили четкие различия в зависимости от возможностей моделей. Предустановленные инструменты повышают производительность для моделей с худшим владением bash, в то время как модели с поддержкой bash могут эффективно работать с интерфейсом только для bash и добиваться существенно меньших затрат, особенно в задачах, ориентированных на командную строку, поскольку пространство действий меняет детализацию написания кода.

Истинная роль каркасов планирования

Механизмы планирования меняют точки остановки траекторий, приводя к различным результатам в зависимости от мощности модели. Для более слабых моделей явное планирование служит опорой для точности. Для более сильных моделей планирование превращается в инструмент экономии средств при минимальном изменении точности.

Этот эмпирический анализ демонстрирует, что эффективность AI-агентов определяется согласованностью модульных компонентов, а не грубым масштабированием моделей. Создание высокопроизводительных автономных систем требует подбора сокращения контекста, интерфейсов действий и триггеров планирования под конкретные возможности моделей и бюджеты токенов. Хотя исследование охватывает 176 настроек на SWE-Bench Verified и Terminal-Bench 2.1, остаются вопросы о том, как взаимодействие этих компонентов переносится на более широкие производственные рабочие процессы и пользовательские экосистемы инструментов.

ИИ-агентыБольшие языковые моделиПроизводительность