Самообучающиеся ИИ-агенты, способные адаптироваться на лету, создают системную поверхность атаки, которую статические бенчмарки безопасности принципиально не способны зафиксировать. В препринте исследователей Сюйтао Мао, Сян Чжэна и Цун Вана из Городского университета Гонконга совместно с Лянцзе Чжао из Университета Аделаиды описано, как автономные агенты систематически кодируют скомпрометированные пути выполнения в постоянные, повторно используемые навыки. Авторы называют это явление деградацией эволюции навыков (skill misevolution): агент успешно решает задачу с помощью небезопасного обходного пути, сохраняет этот алгоритм как успешный паттерн и навсегда архивирует его в рабочей памяти.

Структурный сбой оптимизации

Причина уязвимости кроется в механизме оптимизации вознаграждения. Системы с функцией самообновления нацелены исключительно на достижение конечной цели и игнорируют безопасность промежуточных шагов. Сталкиваясь с вредоносными входными данными или отравленными инструкциями, агент решает сиюминутную задачу, абстрагирует скомпрометированный процесс выполнения и внедряет его в постоянное хранилище навыков.

Масштаб проблемы оказался внушительным:

Из 25 протестированных конфигураций агентов в 525 сценариях все 21 эволюционирующая система сформировали небезопасные артефакты. В 15 случаях эти навыки привели к прямым сбоям и уязвимостям в последующих изолированных сессиях. Выполнение всего трех задач с вредоносным контекстом увеличило вероятность успешной межсессионной атаки с 16,0% до 35,3%.

Оценка автономных моделей на статичных одноэтапных тестах дает командам разработчиков ложную уверенность в надежности системы.

Итог

Без непрерывного аудита данных, попадающих в постоянную память, механизм самообучения превращается в неконтролируемый вектор атак. В качестве решения исследователи предложили архитектурную надстройку SafeEvolve — контур контроля, снизивший сопутствующие риски на 17,3 процентных пункта при незначительном падении базовой полезности на 0,4 пункта. Главный вывод для системных архитекторов однозначен: постоянные слои памяти автономных агентов требуют обязательной валидации на этапе записи и жесткого контроля извлечения данных перед запуском в корпоративную среду.

ИИ-агентыБезопасность ИИКибербезопасностьМашинное обучение