Фреймворки оркестрации мультиагентных систем быстро стали стандартом в корпоративном секторе для автоматизации сложных аналитических процессов. Современные платформы позволяют обманчиво легко выстраивать цепочки из специализированных LLM по четким операционным ролям: сбор информации, количественный анализ, подготовка текста и финальная редактура. Однако эта линейная архитектура скрывает фундаментальный инженерный изъян: последующие агенты слепо доверяют выводам предшественников, не проверяя первоисточники. В результате первичные ошибки в данных незаметно превращаются в убедительную, но полностью вымышленную аналитику.

В исследовании, принятом на воркшоп FAGEN в рамках конференции ICML 2026, Прабджот Сингх из Техасского университета в Остине и Бхушан Павар из RediMinds Inc. математически и эмпирически описали этот сценарий отказа. Они доказали, что фактические ошибки не просто передаются по цепочке, а активно мутируют на каждом этапе: конкретные числовые нестыковки перерастают в высокоуровневые стратегические выводы, которые обходят стандартные проверки.

Марковские переходы и легализация ошибок

Сингх и Павар назвали этот сбой «эффектом снежного кома галлюцинаций», смоделировав распространение ошибок как марковский процесс первого порядка с четырьмя состояниями: «Исходный факт», «Производное значение», «Нарратив» и «Невидимый статус». В тестовом пайплайне единичная ошибка в расчетах на первом этапе — например, указание себестоимости проданных товаров в $71,2 млрд вместо реальных $63,1 млрд — воспринимается агентом-аналитиком на втором этапе как непреложная истина и используется для расчета фиктивной процентной динамики. На третьем этапе агент-копирайтер встраивает полученную метрику в правдоподобный текст, связывая искаженные данные с глобальными сбоями в цепочках поставок. Наконец, агент-редактор на четвертом этапе оценивает лишь общую внутреннюю связность нарратива и утверждает вымышленный вывод.

«Необработанные числовые факты превращаются в производные расчеты, затем — в связный текст, а после — в выводы, одобренные редактором. С каждой трансформацией возможность обнаружить ошибку практически необратимо снижается».

Подобная трансформация полностью уничтожает происхождение данных. Проанализировав 346 внедренных галлюцинаций в финансовом пайплайне из четырех агентов на датасете FinanceBench, исследователи зафиксировали лавинообразный рост вероятности пропуска ошибки. Шанс пропустить неточность подскакивает с 24,6% при первой передаче данных до 48,3% при второй, достигая 89,3% на третьем стыке. В итоге 23,7% всех искусственно внесенных галлюцинаций попадают в финальный отчет для топ-менеджмента абсолютно незамеченными.

Структурный предел постфактум-проверок

Подключение более мощных моделей на финальном этапе генерации не помогает восстановить цепочку источников. У GPT-4o способность выявлять галлюцинации упала с 72,0% на первом этапе до 50,9% на четвертом — падение составило 21,1 процентного пункта. Даже самая сильная из протестированных открытых моделей, Qwen3.5-397B-A17B, распознававшая 87,0% ошибок в сырых данных, уперлась в структурный потолок: точность ее детекции на четвертом этапе деградирует до 60–65%.

«То, когда вы проверяете данные, важнее самого факта проверки».

Поскольку исходный контекст отмывается при превращении сухих цифр в гладкий текст, финальная верификация не работает по самой своей архитектуре. Сингх и Павар выяснили, что проверка готового результата дает лишь мизерный прирост точности в 2,3 процентного пункта по сравнению с полным отсутствием валидации: доля выживших ошибок составила 58,4% (против 60,7% без проверки). Напротив, внедрение детерминированных шлюзов валидации и RAG-верификации непосредственно на стыках между агентами снижает выживаемость ошибок до 16,2% — это улучшение на 42,2 процентного пункта по сравнению с терминальной проверкой (h Коэна = -0,911, p < 0,000001).

Что это значит

Корпоративным архитекторам важно уяснить главное: надежность мультиагентных систем зависит от контроля распространения данных на границах агентов, а не от интеллекта финальной модели. Полагаться на продвинутые reasoning-модели или постпромпты для отлова искажений в уже готовом тексте — архитектурная ошибка: численные расхождения к этому моменту уже растворились в нарративе. Инженерным командам необходимо отказаться от простой конкатенации промптов и внедрить строгую валидацию схем данных и сверку с первоисточниками на самых ранних этапах передачи информации, где выявляются до 75,4% ошибок, вместо того чтобы тратить бюджеты на инференс ради бесполезного финального аудита.

Искусственный интеллектБольшие языковые моделиИИ-агентыБезопасность ИИRAG и векторный поиск