Главный кошмар разработчиков автономных систем — промпт-инъекции в браузере — кажется, наконец-то получил достойный отпор. Согласно системной карте (system card) Opus 5, новая модель Anthropic показала нулевую эффективность атак в 129 тестовых сценариях. Этот технический результат — не просто красивая цифра, а прямой вызов скепсису OpenAI, чьи представители еще в декабре уверяли, что полностью защититься от манипуляций через контекст невозможно. Теперь же Anthropic фактически выводит ИИ-агент из статуса «экспериментальных игрушек» в категорию надежной корпоративной инфраструктуры.

Секрет успеха кроется не в «магическом» росте интеллекта, а в архитектурном разделении слоев обработки данных.

Как следует из отчета THE DECODER, заветный ноль достигается только при активации режима Auto Mode (например, в Claude Cowork). В этом случае система использует двухслойную броню: первый слой сканирует входящий поток на наличие скрытых команд до того, как модель начнет их осмысливать, а второй блокирует опасные действия непосредственно перед исполнением. Без этих программных «костылей» уязвимость Opus 5 составляет 3,7%, при этом младшая Sonnet 5 внезапно справляется лучше с показателем 0,93%. Вывод очевиден: безопасность сегодня — это не свойство весов модели, а результат жесткой интеграции нейронки с её средой исполнения.

Главное для бизнеса и инженеров

Уровень успешных атак в общих тестах снизился с 5,5% у Opus 4.8 до 2,0% у новой версии. Полная зачистка браузерного вектора атак открывает возможности для автоматизации цепочек поставок и закупок. Фокус разработки сместился с повышения «интеллекта» на создание непробиваемых контуров исполнения.

Для технических лидеров и инженеров данные ИБ-компании Gray Swan подтверждают тектонический сдвиг в парадигме безопасности. Хотя два процента риска в общем контексте всё еще оставляют пространство для маневра хакерам, прогресс в защите браузерных сценариев меняет правила игры. Мы наконец переходим к этапу, когда агентам можно всерьез доверять задачи, где раньше риск потери контроля из-за одной вредоносной строчки кода на веб-странице делал проект бессмысленным.

ИИ-агентыБезопасность ИИКибербезопасностьAnthropic