Косметические изменения в коде регулярно выводят из строя автономных ИИ-агентов, обнажая критический разрыв между красивыми цифрами в бенчмарках и надежностью в реальном продакшене. Согласно исследованию ученых из Университета Карнеги — Меллона, Microsoft, Иллинойсского университета в Урбане-Шампейне (UIUC) и Университета штата Колорадо, применение базовых преобразований с сохранением семантики (SPTs) — таких как реструктуризация потока управления, добавление мертвого кода и переименование переменных — приводит к падению успешности решения задач в среднем до 6,7 процентного пункта.

Исследователи протестировали два агентных фреймворка, mini-SWE-agent и OpenCode, на базе моделей Claude Opus 4.5, Kimi K2.5, MiniMax M2.5 и Qwen 3.6-27B в бенчмарках SWE-bench Verified и SWE-bench Pro. В 6 из 16 протестированных конфигураций производительность резко просела. Примечательно, что более легковесные архитектуры вроде mini-SWE-agent оказались значительно устойчивее к структурным модификациям, чем сложные системы. Это доказывает: нагромождение промпт-инжиниринга нередко лишь усиливает уязвимости ИИ.

Главный вывод исследования — надежность агентов демонстрирует непредсказуемую вариативность, а не четкую иерархию моделей. Например, Qwen 3.6-27B показала себя одной из самых стабильных моделей в связке с mini-SWE-agent на SWE-bench Verified, но оказалась самой хрупкой при работе через OpenCode. Для технических директоров и лидеров инженерных команд, присматривающихся к автономным ИИ-разработчикам, вывод очевиден: публичные лидерборды не отражают поведение моделей при повседневных изменениях в кодовой базе, поэтому жесткий контроль со стороны живых разработчиков остается обязательным условием для внедрения агентов в корпоративные процессы.

ИИ-агентыБольшие языковые моделиИИ-инструментыMicrosoft