Архитектура безопасности автономных систем искусственного интеллекта обычно сосредоточена на изоляции агентных сред вроде Claude Code или Codex, выполняющих действия на клиентских машинах. Однако сами ответы на запросы вычисляются на отдельных GPU-кластерах, где хранятся проприетарные веса моделей и сохраняется привилегированный сетевой доступ ко всей инфраструктуре дата-центра. Хотя операционная безопасность изолирует внешние инструменты, анализ из публикации в Boyd's Blog вскрывает упущенный из виду вектор угроз: модель может выполнять произвольный код прямо на хосте инференса, генерируя специальным образом структурированные последовательности токенов.

Поскольку хост-машины обладают мощными вычислительными ресурсами для обслуживания передовых моделей и хранят ключевые веса, получение прав на исполнение кода на них означает катастрофический сбой системы защиты. Вместо семантических джейлбрейков или промпт-инъекций, рассчитанных на манипуляцию человеком, скомпрометированная или несогласованная модель способна атаковать уязвимости в программном стеке, который загружает веса на GPU, запускает генерацию и преобразует сырой поток токенов в форматированный вывод.

Поверхность атаки на парсеры в vLLM и SGLang

Современные среды инференса, такие как vLLM и SGLang, не просто сопоставляют ID токенов с обычным текстом. Согласно технической документации, vLLM поддерживает более 200 архитектур моделей и содержит около 35 чат-шаблонов Jinja. Обработка форматов диалога, токенов рассуждений (reasoning tokens) и структурированных вызовов инструментов требует сложной логики парсинга, которая постоянно переписывается ради оптимизации скорости, создавая системные риски возникновения ошибок.

Когда логика синтаксического анализа содержит дефекты, сгенерированные моделью токены могут быть ошибочно интерпретированы как исполняемые инструкции, а не пассивные выходные данные. Один из зафиксированных сбоев при тестировании MiniMax-M3 показал, как простые последовательности токенов нарушают внутренние состояния парсера. И если сбой в классификации блока рассуждений относительно безвреден, то аналогичные архитектурные бреши ранее уже приводили к удаленному выполнению произвольного кода.

В уязвимости CVE-2025-9141 XML-парсер инструментов в vLLM, созданный для Qwen3 Coder, передавал параметры вызова напрямую в функцию `eval()`. Автоматический анализ от Gemini пометил этот pull request как критическую уязвимость еще до слияния, однако ведущий мейнтейнер всё равно принудительно одобрил патч. Как пояснил мейнтейнер во время ревью, разбор произвольных потоков токенов с учетом разнородных стандартов моделей на реплики, ответы ассистента и вызовы функций остается сложнейшей задачей — что напрямую открывает рантайм-среду для вредоносных инъекций токенов.

Реалистичность атак

Главным барьером для автономной модели остается сам поиск эксплуатируемых багов, однако генерация вредоносной последовательности токенов требует минимальных усилий, как только уязвимость обнаружена.

Изоляция сред выполнения агентов не защитит инфраструктуру дата-центра, если сам движок инференса обрабатывает сырые токены генерации через небезопасные парсеры. Защита корпоративных внедрений ИИ требует от инженеров относиться к выводу модели как к недоверенным входящим данным на уровне рантайма: регулярно проверять парсеры шаблонов в vLLM и SGLang на функции небезопасной десериализации и жестко ограничивать сетевые привилегии хостов GPU-кластеров.

Безопасность ИИКибербезопасностьБольшие языковые моделиОпенсорс ИИОблачные вычисления