Связки автономных агентов совершают десятки микрорешений в секунду: направляют запросы, выбирают инструменты, фильтруют ненужный извлеченный контекст или проверяют промпты на предмет инъекций. В стандартных конфигурациях эти этапы маршрутизации опираются на те же самые тяжелые авторегрессионные LLM, которые выполняют основную работу, впустую тратя сотни миллисекунд и полный цикл генерации ради вывода одной категорической метки. На смену им приходят модели принятия решений Первой Системы (System-1): однопроходные классификаторы, созданные для обработки таких задач маршрутизации на основе сырых вероятностей классов вместо раздутой генерации текста.

Оценка LAYA и JEV в точках принятия решений агента

Чтобы проверить, способны ли эти легкие модели выдерживать инфраструктурные нагрузки без сбоев в производственной логике, исследователь Цзявэй Ли подверг их строгой парной оценке. В бенчмарке сошлись модель с открытым весом (LAYA) от Laya AI и облачная альтернатива Систем-1 (JEV) от TypeSafe AI, обе выпущенные в 2026 году. Бенчмарк, построенный на основе 18 открытых источников, охватывает 11 конкретных точек принятия решений, включая 7283 базовых случая и 6640 вариантов на устойчивость. Тестирование включало идентичные на байты входные данные, парные тесты и проверки воспроизводимости на разном железе. Полный набор данных, сырые результаты и код анализа находятся в открытом доступе в репозитории проекта на GitHub.

Из 11 протестированных точек принятия решений JEV решительно превзошла LAYA в девяти из них, показав отрыв по точности в диапазоне от +10.8 до +46.0 процентных пункта.

"JEV значительно точнее в 9 из 11 точек принятия решений (+10.8–46.0 п. п.)."

Тем не менее, ни одна из систем не доказала своей неуязвимости в производственных условиях. Обе модели полностью провалили нулевую маршрутизацию (zero-shot), не сумев превзойти случайный выбор, и показали абсолютно равные результаты в фильтрации релевантности для RAG. Хуже того, LAYA продемонстрировала хрупкую чувствительность к форматированию промптов: простая перестановка порядка предоставленных вариантов заставила модель с открытым весом изменить 30% своих вердиктов. Когда LAYA заставляли работать с большими или перегруженными наборами инструментов, ее точность падала до 31% на 50 ближайших инструментах-соседях, в то время как JEV удерживала стабильную точность на уровне 98% для элементов с уникальным правильным инструментом.

Аудит конвейера и экономическая реальность

Методологический анализ самого бенчмарка обнажил, как легко команды ошибаются в расчетах экономики развертывания. Ли выделил три крупных аналитических сбоя и один конструктивный изъян, которые сильно исказили первоначальные показатели производительности и заявленные затраты. Самым вопиющим упущением стало то, что игнорирование накладных расходов на предварительный скрининг изначально раздуло скромную реальную экономию затрат в 4.3% до вводящей в заблуждение красивой цифры в 23.9%.

Похожие аналитические просчеты исказили восприятие надежности моделей. Первоначальные отчеты представляли точность сырого шлюза как качество сквозного конвейера на уровне 58% против 98%, в то время как настройка порогов на внутренних данных маскировала упорный уровень ошибок в 17% на отложенных наборах. Между тем, предполагаемый канальный эффект на ложные срабатывания инъекций полностью испарился, как только исследователи провели тесты на контенте, созданном для конкретных каналов.

Замена тяжелых авторегрессионных LLM на классификаторы Первой Системы несет в себе жесткие и не приукрашенные компромиссы на уровне оркестрации агентов. Хотя облачные архитектуры вроде JEV справляются с большими наборами инструментов-кандидатов с профессиональной уверенностью, модели с открытым весом вроде LAYA остаются опасно уязвимыми при столкновении с банальным перемешиванием вариантов. Что еще важнее, когда реальная сквозная экономия сдувается с двузначных фантазий до жалких 4.3% с учетом накладных расходов на предварительный скрининг, инженерным лидерам следует провести аудит надежности маршрутизации на отложенных распределениях, прежде чем ставить производственную инфраструктуру на однопроходную классификацию.

ИИ-агентыБольшие языковые моделиАвтоматизацияСнижение затрат