Миф о том, что для решения сложной задачи нужно просто «насыпать» побольше агентов, разбивается об экономику вычислений и здравый смысл. Свежее исследование в Nature Machine Intelligence подтверждает подозрения скептиков: как только базовая модель достигает определенного порога развития, любая попытка заставить её «советоваться» с коллегами превращается в бюрократический ад, сжигающий ресурсы. Вместо синергии мы получаем избыточные расходы на координацию, которые деградируют общую производительность. Архитектурный фокус смещается с горизонтального масштабирования — бесконечных роев и оркестраций — на вертикальное инвестирование в качество одной-единственной модели.

Порог интеллектуального насыщения

Исследователи прогнали 260 конфигураций, тестируя пять архитектур и три семейства LLM на шести бенчмарках, чтобы нащупать точку, где коллаборация начинает вредить. Методология была жесткой: промпты, инструменты и вычислительный бюджет фиксировались, чтобы изолировать влияние самой структуры координации. Выяснилось, что сложность оркестрации — глубоко вторичный фактор. Ключевым предиктором успеха оказалась базовая мощность одиночного агента. Ученые выявили эмпирический порог насыщения: когда модель достаточно умна, сам акт согласования действий с другими агентами становится для неё обузой, а не подспорьем.

Этот порог с точностью 94% предсказывает эффект многоагентной координации на таких сложных тестах, как SWE-bench Verified и Terminal-Bench.

Эти данные ставят крест на «законе масштабирования через сотрудничество». Оказывается, топовые модели обладают достаточным внутренним ресурсом для рассуждений и многоступенчатого планирования без внешних проверочных циклов от «коллег». Для ИИ-архитектора это означает, что внедрение многоагентного роя должно быть не догмой, а прагматичным выбором. За порогом насыщения добавление новых звеньев лишь провоцирует «амплификацию ошибок»: усложнение коммуникации создает новые точки отказа, которых не было у одиночного агента.

Дорогая цена искусственного консенсуса

Анализ с использованием кросс-валидированной модели (R2 = 0.373) показал, что в задачах, требующих длительного взаимодействия — вроде написания софта или интерактивного планирования, — затраты на разделение труда и достижение консенсуса перевешивают профит. Вера в то, что комитет из слабых моделей может стабильно обходить одного лидера, не подтверждается цифрами. Базовый уровень одиночного агента остается самым надежным индикатором качества итогового результата.

Полученные результаты дают количественную базу для выбора архитектуры: теперь можно заранее оценить, когда многоагентная чехарда станет просто дорогостоящим оверхедом.

Выбирая оптимальную архитектуру в 87% контрольных случаев, исследование подтвердило: сильный одиночный агент (SAS) эффективнее любой MAS-альтернативы при равном бюджете на токены. Издержки на параллельный поиск и верификацию в многоагентных системах — это налог на производительность, который современным SOTA-моделям платить больше не нужно. Для R&D-департаментов это прямой сигнал: самый короткий путь к автоматизации лежит через апгрейд до актуальной версии модели, а не через строительство громоздких систем оркестрации.

Многоагентные системы всё чаще выглядят как временный костыль для обхода ограничений слабых моделей, а не как венец архитектурной мысли. Если вы работаете с фронтирными решениями, приоритет должен отдаваться одиночным рабочим процессам — это банально эффективнее. Коллективный разум пока сохраняет позиции лишь в узких нишах, где требуется параллельное исследование среды (exploration). Но для большинства агентных задач эпоха «комитетов» уходит, уступая место эпохе сверхкомпетентных одиночек.

ИИ-агентыБольшие языковые моделиПроизводительностьСнижение затрат