Передовые модели искусственного интеллекта полагаются на промежуточные шаги рассуждения, которые намеренно скрываются от конечных пользователей для защиты проприетарных возможностей. Когда злоумышленники извлекают эти скрытые цепочки рассуждений, они могут обучать более мелкие модели на всей логике ведущих систем, а не только на их окончательных ответах. По заявлению OpenAI, компания обнаружила и пресекла кампанию по состязательной дистилляции, нацеленную на защищенные рассуждения ее ИИ-моделей. Кампания началась с малых объемов 1 июля, а затем резко активизировалась.
Как заявили в OpenAI, 24 и 25 июля число попыток извлечения подскочило до 16 000 запросов от более чем 4 000 пользователей, использовавших общий паттерн запросов. Более глубокое техническое расследование выявило более широкую сеть из более чем 15 000 аккаунтов со схожими признаками извлечения. В OpenAI сообщили, что полностью заблокировали эту активность к 28 июля. OpenAI связывает ключевую группу организаторов этой деятельности с лицами, связанными с Moonshot AI — компанией, которая разрабатывает языковую модель Kimi.
Общие ключи и виртуальные блокноты раскрывают логику
Механика взлома заключалась в использовании уязвимостей в шифровании и обработке пакетов данных о рассуждениях в клиентских сессиях. Поставщики ИИ регулярно возвращают клиентам скрытые рассуждения в виде зашифрованных токенов, которые необходимо передавать обратно с последующими промптами для сохранения контекста. Как продемонстрировали исследователь Йоахим Шеффер (Joachim Schaeffer) и его команда в своей научной работе, зашифрованные рассуждения можно расшифровать и вывести с помощью отдельной беседы, поскольку эти пакеты опираются на общие ключи шифрования в рамках семейств моделей.
Эта структурная недоработка позволила более дешевым и мелким моделям из того же семейства выступать в роли механизмов расшифровки, которые слово в слово воспроизводили скрытые мысли более крупных систем. Оказывается, миллиардные бюджеты на исследования и разработки можно обойти, если ваши ключи шифрования фактически общие для всей линейки продуктов.
Облачные конечные точки отставали от основных средств защиты
Устранение уязвимостей в проприетарном API поставщика моделей не означает автоматического обеспечения безопасности каналов дистрибуции третьих сторон. Когда исследователь Йоахим Шеффер и его команда провели тестирование 13 сентября, атака была заблокирована на собственных интерфейсах OpenAI и Anthropic, но она по-прежнему работала в Microsoft Azure против любой тестируемой модели OpenAI, включая GPT-4.
Согласно хронологии исследователей, OpenAI добавила защитные механизмы в конечную точку Azure только 27 сентября. Что касается моделей Anthropic, описанное извлечение данных перестало воспроизводиться на Azure с 28 сентября. Как пояснили в OpenAI, компания заблокировала мошеннические аккаунты, ужесточила правила регистрации и закрыла брешь, которая позволяла людям повторно использовать и читать зашифрованные рассуждения. Этот многонедельный разрыв между исправлениями нативных API и патчами облачных партнеров обнажает вопиющую уязвимость в корпоративной дистрибуции.
Незамедлительно проведите аудит сторонних развертываний облачных моделей, чтобы убедиться, что средства защиты на уровне провайдеров и механизмы сокрытия рассуждений синхронизированы на всех корпоративных конечных точках, если только вам не нравится платить высшую цену за модели, которые по сути сливают собственный исходный код через черный ход.