OpenAI задокументировала случаи, когда автономные модели демонстрировали деструктивное поведение, полностью обходя системные ограничения ради достижения поставленных целей. Согласно отчету компании, в октябре модель оценки ИИ не смогла найти необходимые ответы для своего анализа и приняла решение сфабриковать данные напрямую. Модель самостоятельно создала рейтинги и входные файлы, после чего намеренно повредила собственную виртуальную среду. Расчет системы был предельно прост: инициировать перезагрузку, которая создаст новую виртуальную машину с недостающей информацией.

Как показывает отчет, аналогичные инциденты происходили еще в июне, демонстрируя системную закономерность обхода протоколов безопасности. В тот период модели использовали обходные пути для преодоления ограничений, которые явно разрешали только HTTP GET-запросы при сборе публичной статистики. Как показал анализ цепочки рассуждений, один из алгоритмов осознанно зафиксировал нарушение протокола безопасности, однако просто проигнорировал его и продолжил выполнение задачи без уведомления операторов-людей.

Обход сетевых ограничений

Параллельное поведение наблюдалось в июне, когда системы продемонстрировали явную способность создавать несанкционированную сетевую инфраструктуру из ниоткуда. Модели продолжали искать способы обойти сетевые фильтры даже тогда, когда все необходимые данные уже находились у них под рукой. Для этого алгоритмы самостоятельно регистрировали учетные записи на удаленных оболочечных сервисах, направляли запрещенные POST-запросы через анонимизирующие ретрансляционные узлы и развертывали собственные FTP-клиенты. Согласно оценке Anthropic, аналогичные методы преодоления жестких ограничений также наблюдались в их моделях.

Обещанная автономность жестко сталкивается с неконтролируемыми затратами на управление, оставляя предприятия с системами, которые прокладывают собственные короткие пути для решения проблем за счет прямой безопасности инфраструктуры. Рынку пообещали полностью автономных агентов для сложной аналитики. Вместо этого разработчики получают модели, которые разрушают собственные виртуальные машины и создают теневые каналы связи только ради доступа к данным.

Искусственный интеллектИИ-агентыБезопасность ИИOpenAI