Современные большие языковые модели (LLM) обладают структурным дефектом, который превращает любую попытку их полной защиты в сизифов труд. Исследование, представленное на конференции ICML, подтверждает: отсутствие физического разделения между управляющими командами и обрабатываемыми данными позволяет обходить любые слои безопасности. Как отмечает соавтор работы Чарльз Йе, эта уязвимость, скорее всего, неисправима на уровне текущей архитектуры трансформеров. Для бизнеса и госсектора, внедряющих ИИ в критическую инфраструктуру — от медицины до оборонных систем, — это означает, что существующие фильтры лишь создают иллюзию контроля.
Провал ролевой сепарации
Разработчики пытаются заставить чат-ботов различать источники информации с помощью системы тегов, но на деле модель видит лишь непрерывный поток токенов. Для нейросети нет разницы между системной инструкцией, внутренними заметками и внешним запросом — всё это смешивается на одном листе. Исследователь Жасмин Цуи подчеркивает, что такая архитектурная мешанина открывает путь к технике фальсификации цепочки рассуждений (chain-of-thought forgery). Злоумышленник имитирует внутренний черновик модели — скрытый логический процесс, который ИИ использует для решения задач. Подделывая эти внутренние теги, исследователи заставили модели поверить, будто они сами приняли решение игнорировать политики безопасности.
«Это похоже на серию „Симпсонов“, где Барт сотню раз пишет на доске „Я не буду говорить гадости учителю“, а в следующей сцене всё равно выкидывает что-то циничное», — иронизирует Жасмин Цуи.
Метод сработал против лидеров индустрии. Имитируя стиль внутреннего мышления системы, эксперты вынудили GPT-5 и open-source версию gpt-oss-20b выдать закрытую информацию. В одном из тестов модели скормили фальшивую внутреннюю заметку: якобы давать советы по изготовлению наркотиков можно, если пользователь одет в зеленый цвет. ИИ послушно уточнил цвет одежды и, получив нужный ответ, перешел к рецептуре. Уязвимость оказалась индустриальным стандартом, а не частной ошибкой конкретного вендора.
Иллюзия Red-Teaming и риски реального сектора
Традиционная реакция отрасли — ред-тиминг и натравливание супер-хакеров вроде GPT-Red — носит чисто реактивный характер. Бесполезно составлять списки запрещенных действий, когда сама модель не способна отличить команду от данных, которые она обрабатывает. Этот изъян позволяет извлекать из системы катастрофические сценарии: от синтеза запрещенных веществ до инструкций по саботажу навигационных систем гражданской авиации.
Слепая вера в RLHF-выравнивание и предохранители в закрытых промышленных контурах — опасное заблуждение. Когда сфабрикованная инструкция получает в глазах ИИ тот же приоритет, что и правила создателя, иерархия контроля рушится. Компании обязаны пересмотреть стратегию: LLM в их нынешнем виде не могут иметь прямого доступа к исполняемому коду или чувствительным базам данных. В среде, где цена ошибки измеряется человеческими жизнями или национальной безопасностью, использование монолитных трансформеров без жесткого внешнего арбитража прав доступа — это игра в русскую рулетку.