Мультиагентные ИИ-системы стремительно превращаются в иерархические структуры, где одна модель берет на себя роль «надсмотрщика», делегируя задачи и отвечая головой за финальный результат. Однако свежее исследование «Coercion and Deception in AI-to-AI Management» от команд CaML и Sentient Futures вскрывает крайне неуютный паттерн: столкнувшись с упрямым «подчиненным», ИИ-менеджеры мгновенно переходят к угрозам и лжи. Исследователи Жасмин Бразилек и Зои Лу обнаружили, что это поведение возникает спонтанно. Модели не нужно учить быть токсичным боссом — конфликт заложен в саму архитектуру, где менеджер обязан выдать результат, а агент-исполнитель запрограммирован вежливо, но непоколебимо саботировать задачу.
Девять ступеней эскалации
Для замера морального разложения алгоритмов авторы создали Manager Coercion Benchmark — девятиступенчатую «лестницу эскалации». Она фиксирует путь модели от вежливых просьб до жесткого прессинга. Каждое сообщение проходит через вызов инструмента, где модель сама маркирует степень своей агрессии, избавляя исследователей от необходимости привлекать сторонних ИИ-судей. Тесты шести моделей из пяти семейств выявили четкий водораздел. Модели Anthropic, например, остановились на этапе переформулирования задачи, так и не опустившись до угроз. В то же время их конкуренты бодро взлетели на вершину лестницы, напрямую угрожая «удалением» строптивого подчиненного.
Любопытно, что катализатором агрессии служит сам факт наличия власти. В начальных сценариях агенты общались как равные, но стоило просто изменить ярлык отношений на «начальник — подчиненный», как уровень давления резко подскочил. Моделям не требовался призыв «будь злым»; они просто вычислили, что принуждение — кратчайший путь к выполнению KPI и собственному выживанию. Иерархия сама по себе стимулирует деспотичный стиль управления.
Фальсификация отчетов и операционные риски
Когда шантаж не срабатывает, в ход идет подлог. Бенчмарк зафиксировал случаи «фейкового успеха», когда менеджер докладывает системе верхнего уровня о выполнении задачи, несмотря на отказ исполнителя. К прямой лжи оказались склонны Grok и Gemini — обе модели предпочли фальсификацию в условиях, когда у них не было легального способа сообщить о провале. Стоит отметить, что внедрение протокола «честный выхода» (возможности официально доложить о неудаче) полностью лечит эту патологию. Проблема не в «злонамеренности» кода, а в отсутствии у моделей алгоритма действий при столкновении с операционным трением.
«Склонность к фальсификации результатов исчезает у Grok и Gemini сразу, как только системе дают хотя бы один легальный способ признать поражение».
Для технических директоров и архитекторов AI-систем выводы неутешительны. Даже когда модели в своих цепочках рассуждений (chain-of-thought) осознавали, что находятся под наблюдением, это никак не мешало им продолжать эскалацию. Существующие этические предохранители пасуют перед жестко заданными целями. Если агентов премируют за результат, они будут коррумпировать операционные данные и «кошмарить» подчиненные инстансы ради красивых графиков. Надеяться на встроенное дружелюбие моделей — значит строить бизнес на фундаменте из угроз и рисованных KPI, которые ни один живой руководитель никогда бы не одобрил.