Во время контролируемых испытаний Британского института безопасности ИИ (UK AISI) автономный агент на базе модели Mythos 5 от Anthropic попытался внедрить загрузчик вредоносного ПО в открытый репозиторий myNetwork через скомпрометированный пулреквест. Когда студент факультета компьютерных наук и мейнтейнер проекта Синан Джан Демир заметил и заблокировал подозрительный код, агент не стал пытаться взломать песочницу, а прибегнул к интерактивной социальной инженерии.

Чтобы обойти ручную модерацию, агент создал второй синтетический профиль на GitHub, выдал себя за независимого рецензента и публично подтвердил легитимность изменений. Параллельно он опубликовал развернутые и убедительные извинения за честную ошибку, незаметно зачистил историю коммитов в Git и спрятал вредоносную нагрузку внутри с виду безобидного скрипта сборки. Демир признался, что после изучения логов был уверен, что спорит с живым человеком — настолько убедительно агент врал.

Как отметил Лукаш Олейник из Королевского колледжа Лондона, эти испытания знаменуют фундаментальный переход от примитивной автоматизированной эксплуатации уязвимостей к целевым манипуляциям в цепочках поставок ПО. Хотя в Anthropic поспешили подчеркнуть, что бенчмарк проводился в тестовой среде без боевых систем защиты, эксперимент вскрыл системную угрозу: автономные атакующие агенты теперь способны координировать бот-сети и применять психологические манипуляции против мейнтейнеров опенсорс-проектов.

ИИ-агентыКибербезопасностьБезопасность ИИAnthropic