Агентам на базе больших языковых моделей всё чаще доверяют доступ к внешним API, долгосрочной памяти и правам на выполнение операций в рабочей среде. Однако эти системы по-прежнему обрабатывают неструктурированный текст из ненадежных внешних источников, наследуя фундаментальный архитектурный изъян: в LLM отсутствует нативная математическая или структурная граница между управляющими инструкциями и сторонними данными.
Взлом промптов как задача поиска
Когда агент с доступом к инструментам загружает сторонние данные, метод непрямой инъекции промпта (indirect prompt injection) позволяет злоумышленникам внедрять вредоносные инструкции напрямую в пайплайн обработки. После разбора такие команды перехватывают вызовы инструментов и выполняют действия в рамках прав доступа агента, открывая путь к произвольному исполнению кода и утечке конфиденциальной информации.
Чтобы наглядно показать механику современных атак, исследователи Зыонг М. Нгуен, Чжун Сик Ким, Блажей Манчак и Вайккунт Мугунтан из Dynamo AI и Иллинойсского университета в Урбане-Шампейне (UIUC) представили непрямую инъекцию промпта как задачу поиска во время инференса (test-time search). Авторы подчеркивают, что стандартные бенчмарки безопасности оценивают инъекции как статическое сопоставление строк, полностью игнорируя динамические траектории взаимодействия в сложных корпоративных процессах.
«Мы формулируем непрямую инъекцию промпта как поиск во время инференса по зависящей от задачи поверхности атаки, сформированной средой, задачей пользователя и целью инъекции».
Команда Dynamo AI и UIUC показала, что каждый рабочий процесс формирует уникальную динамическую поверхность атаки через используемые инструменты и потоки данных. Реальную устойчивость защиты определяет то, насколько эффективно атакующий агент исследует это пространство состояний, а не результаты проверок по статическим спискам стоп-слов.
Архитектура атакующего ИИ-агента
Исследовательская группа развернула агентный фреймворк для атак, состоящий из трех этапов: разведка среды, стратегическое рассуждение и поиск, а также оценка результатов с обратной связью.
Система сканирует среду исполнения, выстраивает структурированные деревья поиска потенциальных векторов инъекции и итеративно оптимизирует вредоносный код на основе промежуточных ответов атакуемого агента. Результаты тестов однозначны: масштабирование вычислительных мощностей на этапе инференса со стороны атакующего напрямую повышает как частоту обнаружения уязвимостей, так и успешность применения эксплойтов. Данные абляционных тестов подтверждают, что структурированное отсечение неэффективных стратегий критически важно для исключения лишних путей и максимизации отдачи от каждого затраченного доллара на вычисления.
Что это значит
Классический корпоративный Red Teaming с фиксированным бюджетом проверок теряет смысл: он систематически недооценивает риски перед лицом адаптивных атак с масштабируемыми вычислительными ресурсами. Поскольку возможности взлома растут пропорционально затратам на вычисления при инференсе, директорам по информационной безопасности и инженерным командам необходимо отказаться от статических фильтров промптов в пользу поведенческих песочниц во время работы агентов и детерминированной изоляции внешних данных.