Ваши хваленые AI-агенты, якобы готовые к внедрению, на деле защищены гораздо хуже, чем обещают лабораторные отчеты. Свежий бенчмарк GuardianAgentBench (GABench), подготовленный исследователями из Vectara и Университета штата Айова, показывает неутешительную картину: даже топовые конфигурации больших языковых моделей не могут преодолеть планку в 74,8% точности при столкновении с состязательными атаками. Проще говоря, каждая четвертая операция в вашей системе остается открытой для удара.
Исследователи прогнали 580 сценариев в шести доменах, используя «святую троицу» индустриальных фреймворков — LangChain, LlamaIndex и Vectara. Результат везде один: критический разрыв между способностями модели и её безопасностью. Как пояснил Вишал Ишвар Наик и его команда, система ломается в двух режимах:
Сильные модели склонны к параличу: они «недовызывают» нужные инструменты, боясь ошибиться. Слабые модели, напротив, палят из всех пушек — выбирают не те инструменты и запускают их там, где это не нужно.
Ситуация усугубляется с ростом сложности. По данным отчета, производительность деградирует монотонно: чем больше набор доступных инструментов и чем длиннее цепочка логических шагов, тем выше вероятность, что агент рассыплется под давлением или прямой атакой. Наивно полагать, что обычный системный промпт станет надежной стеной для корпоративных данных.
Анализ GABench наглядно демонстрирует, что единственным спасением является внедрение специфических слоев защиты (guardrails) на уровне исполнения инструментов.
Такая «структурная интервенция» позволила восстановить почти 20% проваленных тестов при мизерном уровне ложноположительных срабатываний (всего 0,5%).
Для технических директоров и руководителей разработки вывод очевиден: выпуск автономных агентов «в дикую природу» без жесткого контроля на уровне API — это неоправданный операционный риск. Не стоит рассчитывать на мифический интеллект модели в вопросах самоцензуры и контроля доступа. Пока вы не выстроите независимый слой проверки исполнения, ваши агенты остаются дорогой и непредсказуемой уязвимостью в архитектуре компании.