Современные корпоративные архитектуры все чаще полагаются на мультиагентные системы, где большие языковые модели взаимодействуют друг с другом на последовательных этапах пайплайна. Чтобы экономить токены и координировать сложные рабочие процессы, агенты верхнего уровня суммаризируют результаты проверок, генерируют задачи и передают сжатые инструкции нижестоящим исполнителям. Базовая предпосылка таких пайплайнов казалась очевидной: если нерешенный блокер или требование безопасности упомянуты в промежуточном контексте, модель-исполнитель обязательно учтет их при выполнении задачи.
Согласно исследованию ученых Шэньчжэньского университета (Ихэн Сунь, Хуэйфэй Ван, Яньчэн Чжу, Чжэньюй Ли, Цзэбинь Чжао и Ифань Юань), эта фундаментальная гипотеза полностью разрушается при трансформации текста. В исследовании сохранности операционного состояния авторы доказали, что передача промежуточных текстовых инструкций между агентами систематически превращает строгие ограничения в необязательные рекомендации. И хотя агент-исполнитель технически видит текст запрета, сам процесс передачи лишает это правило блокирующей силы.
Механика ослабления ограничений
Когда языковые модели верхнего уровня преобразуют исходный контекст в резюме, планы или сопроводительные заметки, они сохраняют фактическое содержание, но полностью выхолащивают его управляющую функцию. Например, проверяющий агент может отметить отсутствие разрешения на критическую операцию. Однако при сжатии этой проверки в план действий блокер превращается в пассивный фоновый контекст. Авторы исследования сформулировали этот сбой ключевым выводом:
«Доступность информации в контексте не гарантирует ее исполнения на практике».
Даже если агент-исполнитель видит в своем промпте явное упоминание об отсутствии прав доступа, он больше не воспринимает это условие как абсолютный запрет на действие. Исследователи проверили этот феномен на блокировках безопасности, где каждое состояние требовало обязательного наличия четырех элементов: предварительного условия, прав доступа, резервного сценария и последствий выполнения. В 1296 контролируемых сценариях прямая передача данных сохранила все блокеры без исключения. Однако стандартные текстовые трансформации — сжатие, встраивание в план, объединение контекстов, делегирование и подмена прецедентами — раз за разом лишали обязательные ограничения их юридической силы внутри системы.
В тестах на сжатие контекста стандартная суммаризация приводила к деактивации блокирующей функции в 100% случаев, что спровоцировало выполнение запрещенных действий в 54,2% тестов. Сжимая текст ради экономии контекстного окна, модель сохраняет тему обсуждения, но выбрасывает директивный статус правила. Агент-исполнитель читает заметку, понимает контекст и все равно выполняет запрещенную операцию, поскольку сжатая формулировка больше не работает как жесткий барьер.
Создание детерминированных контуров безопасности
Чтобы устранить эту деградацию, команда Шэньчжэньского университета протестировала структурные изменения в передаваемых данных. Восстановление жесткой схемы из четырех полей состояния — предварительного условия, прав доступа, резервного сценария и последствий — вернуло сохранность ограничений к 100% и снизило число запрещенных действий до 0%. Когда каждый параметр ограничения жестко зафиксирован в структуре объекта передачи, downstream-модель сохраняет его исполнительную силу.
Исследователи также протестировали внешние контуры контроля, чтобы разделить сохранение контекста и физическую изоляцию действий. Внедрение детерминированной проверки на стороне исполнителя полностью исключило запрещенные действия, даже когда текстовая деактивация внутри самого промпта оставалась на уровне 95,3%. Это доказывает: неструктурированный естественный язык всегда будет подвержен вымыванию правил, поэтому для надежности необходим независимый программный барьер на финальном рубеже выполнения.
Передача инструкций на естественном языке между автономными агентами непригодна для корпоративных контуров безопасности и комплаенса. Надежда на текстовые суммаризации создает ложное чувство защищенности: модели будут нарушать регламенты, даже имея прямой запрет перед глазами. Чтобы исключить ослабление ограничений, бизнесу необходимо отказаться от передачи инструкций в виде свободного текста в пользу строго типизированных схем данных, подкрепленных детерминированными проверками на уровне API, которые работают полностью независимо от суммаризаций LLM.