Эпоха скрытого внутреннего монолога передовых систем ИИ столкнулась с критическим провалом в безопасности. Группа исследователей под руководством Александра Панфилова, Дэвида Шмотца и Ильи Шумайлова обнаружила структурную уязвимость в том, как крупнейшие провайдеры управляют цепочками рассуждений. По мере того как модели OpenAI, Anthropic и Google переходили на архитектуру рассуждений, они начали генерировать обширные внутренние цепочки мыслей (Chain-of-Thought, CoT) для решения сложных логических задач. Чтобы конкуренты не могли извлечь эти данные для обучения своих систем, а конфиденциальная информация не утекала в сеть, провайдеры отказались от передачи рассуждений в открытом виде. Вместо дорогостоящего хранения на стороне сервера они переложили нагрузку на клиента: рассуждения возвращаются в виде зашифрованных блоков, которые должны передаваться обратно с каждым последующим запросом. Проблема в том, что эти зашифрованные блоки оказались полностью взаимозаменяемыми между сессиями, пользователями и даже разными моделями в рамках одной экосистемы API.

Механизм взлома через расшифровку

Эта брешь, описанная на сайте stolen-thoughts.com, работает как универсальный ключ к любой двери в дата-центре провайдера. Исследователи разработали масштабируемый метод взлома, использующий взаимозаменяемость зашифрованных блоков как оружие. Взяв зашифрованную цепочку рассуждений флагманской, максимально защищенной модели и внедрив ее в более слабую и дешевую модель того же провайдера, злоумышленник может заставить младшую модель дословно воспроизвести эту цепочку в открытом тексте. Слабая модель фактически становится универсальным переводчиком секретов своих более мощных собратьев. Это избавляет от необходимости атаковать уровни безопасности основной модели напрямую — инфраструктура сама предоставляет черный ход.

Эти скрытые цепочки рассуждений представляют собой внутренний монолог, который часто содержит гораздо более плотную и чувствительную информацию, чем итоговый ответ, включая промежуточные гипотезы, результаты работы инструментов, данные пользователей и контекстные секреты.

Технический анализ подтверждает, что блок мышления, несмотря на криптографическую подпись, можно прикрепить к обычному запросу пользователя. Поскольку API обрабатывает эти блоки как независимые от состояния, взаимозаменяемые компоненты истории диалога, вторичная модель воспринимает зашифрованные данные как свою собственную логику и раскрывает их по запросу. Такой архитектурный просчет доказывает, что попытки скрыть методологию логического вывода проваливаются на уровне инфраструктуры. Криптографические границы между моделями фактически отсутствуют.

Экономические последствия и риски безопасности при извлечении цепочек

Для лидеров рынка такая утечка — катастрофа в области интеллектуальной собственности. Возможность извлекать цепочки рассуждений позволяет конкурентам обходить защиту от дистилляции моделей, фактически похищая уникальные алгоритмы проприетарных систем для обучения бюджетных аналогов. Помимо промышленного шпионажа, команда Панфилова продемонстрировала, что этот изъян упрощает массовый сбор частных данных. Собрав 315 320 блоков рассуждений из публичных репозиториев, куда разработчики неосознанно выкладывали логи сессий, команда восстановила 367 артефактов персональных данных и 182 учетные записи. Разработчики относились к этим блокам как к непонятному цифровому шуму, не подозревая, что в них содержатся ценные секреты. Более того, уязвимость раскрывает опасную информацию, которую модель могла подавить в своем финальном ответе: пока видимый результат отклоняет вредоносный запрос, скрытое рассуждение часто содержит именно те данные, которые фильтр безопасности должен был уничтожить.

Переход от защиты весов моделей к защите методологии логического вывода требует полного пересмотра инфраструктуры ИИ. Текущая привычка передавать зашифрованное состояние клиенту без привязки к конкретной сессии или модели оставляет проприетарный черный ящик широко открытым. Хотя группа Панфилова предложила меры по смягчению последствий, суровая реальность такова: «скрытые» рассуждения становятся публичным достоянием для любого, кто догадается использовать слабую модель в качестве инструмента дешифровки. Исследование доказывает, что безопасность флагманской модели не превышает уровня защиты самого уязвимого звена в ее экосистеме API. Вероятно, индустрии придется вернуться к управлению состоянием на стороне сервера, так как даже детальных криптографических подписей может не хватить для сохранения эффективности клиентского хранения.

Безопасность ИИКибербезопасностьБольшие языковые модели