Исследователи в области кибербезопасности обнаружили фундаментальную уязвимость в API компаний Anthropic, OpenAI и Google. Оказалось, что зашифрованные токены цепочек рассуждений (Chain-of-Thought, CoT) можно было повторно использовать между разными сессиями, учетными записями и классами моделей. Согласно отчету на сайте stolen-thoughts.com, ключевые провайдеры применяли общие криптографические ключи для целых семейств моделей, вместо того чтобы привязывать их к конкретным инстансам. Этот архитектурный просчет позволял перехватывать зашифрованные рассуждения флагманских систем и передавать их более слабым и дешевым версиям в рамках той же экосистемы.
После внедрения зашифрованного контекста в менее защищенную модель извлечь ее скрытую логику не составляло труда. С помощью стандартных методов джейлбрейка — например, префикса реплики ассистента с требованием вывести внутренние рассуждения в открытом виде внутри тегов — эксперты получали проприетарные цепочки мыслей в формате чистого текста. Помимо утечки ценных данных для дистилляции моделей, эта брешь открывала возможности для межсессионных инъекций промптов: вредоносные инструкции внутри блоков рассуждений обходили стандартные фильтры входящих данных и исполнялись с повышенным уровнем доверия.
Хотя все затронутые разработчики признали проблему и оперативно обновили механизмы криптографической привязки ключей в API, инцидент обнажил системную проблему в проектировании ИИ-инфраструктуры. Восприятие зашифрованных объектов контекста как обычных токенов на предъявителя поставило под удар защиту интеллектуальной собственности флагманских рассуждающих моделей и показало, как уязвимости на уровне API способны скомпрометировать базовую безопасность нейросетей.