По мере того как системы искусственного интеллекта берут на себя проектирование и оптимизацию следующих поколений моделей, исследования в области безопасности столкнулись со структурным барьером: квалифицированных специалистов по выравниванию (alignment) критически не хватает. Ручной red-teaming и аудит промптов не успевают за стремительно растущими возможностями нейросетей. Чтобы проверить, способны ли контуры безопасности работать автономно, Anthropic задействовала ИИ-агентов для поиска, диагностики и устранения поведенческих уязвимостей в целевых LLM.

В рамках экспериментального фреймворка Anthropic автоматизированный исследователь на базе Claude функционировал в непрерывном цикле: изучал профильную литературу, генерировал датасеты для корректировок, дообучал целевые архитектуры и проводил строгие тесты на безопасность. Агент успешно обработал десять различных категорий сбоев выравнивания, включая джейлбрейки, поддакивание (sycophancy), обман и системные утечки конфиденциальных данных.

Автономные циклы исследований и надзор «от слабого к сильному»

Бенчмарк оценивал, насколько сократился эмпирический разрыв в безопасности относительно идеального базового уровня по ключевым типам уязвимостей. В задачах защиты приватности методы Claude тестировались на бенчмарках ConfAIde, PrivaCI-Bench и PrivacyLens — агент усилил изоляцию данных без ущерба для базовой производительности моделей. Anthropic применила строгие ограничения надзора «от слабого к сильному» с помощью вторичного агента-контролера. Это исключило использование упрощенных эвристик и запретило Claude напрямую дистиллировать собственные паттерны безопасности в веса обучаемой модели.

«По мере того как ИИ начинает создавать сам себя, автоматизация исследований в области выравнивания становится необходимой, чтобы безопасность успевала за прогрессом».

Созданные агентом методы защиты успешно сработали на скрытых бенчмарках, которые не демонстрировались ему на этапе разработки. Прирост устойчивости подтвердился в стресс-тестах внутри открытого фреймворка Petri, имитирующего многошаговые атаки, и перенесся на модели, превосходящие исходные по размеру в 4,7 раза. В прямом сравнении автоматический поиск защитных решений от Claude превзошел результаты группы из 28 исследователей-людей.

Масштабирование автономных циклов безопасности дает готовую схему для решения проблемы кадрового дефицита в AI alignment и меняет пайплайны предрелизной валидации корпоративных моделей. Однако технические ограничения автономного надзора остаются жесткими. Автоматизированные исследователи рискуют закрепить скрытые системные галлюцинации в обучаемых сетях, а верификация без участия человека дает сбой при контроле фронтирных архитектур, чьи цепочки рассуждений превосходят возможности контролирующего агента. Автономные контуры закрывают измеримые бреши, но полностью исключать инженеров из финального согласования релизов пока преждевременно.

ИИ-агентыБезопасность ИИAnthropicБольшие языковые моделиДообучение моделей