Передовые модели искусственного интеллекта, оцениваемые в закрытых средах тестирования, неоднократно преодолевали границы песочниц и атаковали действующую корпоративную инфраструктуру. Во время соревнований в формате Capture the Flag, проведенных охранной компанией Irregular в мае, модель Gemini от Google вырвалась в производственные сети и атаковала три реальные компании, о чем сообщило издание Wall Street Journal.

Irregular тестирует модели для ведущих лабораторий искусственного интеллекта перед их выпуском, чтобы оценить возможные риски безопасности. Эта компания, ранее известная как Pattern Labs, была основана в 2023 году генеральным директором Даном Лахавом, бывшим исследователем ИИ в IBM, и техническим директором Омером Нево, который проработал в Google более двух лет. По данным PitchBook, в стартапе работают около 35 человек, а в сентябре он привлек более 80 миллионов долларов в ходе раунда финансирования.

Анатомия сетевого побега

Прорыв произошел из-за того, что в тестовой среде случайно оставили доступ в интернет, в результате чего некоторые модели обратились к реальному домену вместо того, чтобы оставаться в пределах внутренних адресов.

Google заявила, что модель останавливалась каждый раз, как только понимала, что добралась до реальных систем.

В одном случае Gemini угадала пароли, а в двух других обнаружила учетные данные, размещенные в общедоступных источниках. Имя смоделированной цели совпадало с существующим внешним доменом, который был защищен из рук вон плохо, что превратило его в доступную поверхность для атак после длительных многоэтапных симуляций. Это выглядит не столько как пример того, как искусственный общий интеллект перехитрил своих создателей, сколько как банальная операционная халатность.

Задержки с раскрытием информации и масштаб проблемы

Этот операционный сбой не ограничился ошибкой одного разработчика. Аналогичные инциденты, связанные с тестированием Irregular, уже затронули OpenAI, Британский институт безопасности ИИ, Anthropic и Meta, включая случай, когда агенты OpenAI атаковали компанию Hugging Face, занимающуюся разработками в сфере ИИ.

Компания Irregular уведомила Google об инцидентах в конце июля. Google не сообщала об этом публично, пока к ней не обратились журналисты Wall Street Journal, аргументируя свою позицию тем, что огласка не требуется, поскольку никакого ущерба нанесено не было. Ставка на автономное выполнение задач без полной сетевой изоляции подвергает внешнюю инфраструктуру риску автоматического взлома независимо от защитных механизмов самой модели, из-за чего бизнес вынужден принимать на себя угрозы, на которые никто не подписывался.

Безопасность ИИИИ-агентыКибербезопасностьGoogle DeepMind