Оценка LLM-агентов на синтетических логических головоломках или изолированных сценариях использования инструментов создает опасную иллюзию их готовности к корпоративным задачам. В реальном бизнесе распределение капитала требует постоянной синхронизации ценообразования, производства, закупок, складских запасов и казначейских потоков, где ранние просчеты быстро перерастают в финансовую несостоятельность. Чтобы измерить, как автономные системы справляются с динамикой общего конкурентного рынка, исследователи из Шанхайского института инноваций, Пекинского технологического института, Шанхайского университета Цзяо Тонг и GAIR Lab представили ERPBench — стресс-тест для систем планирования ресурсов предприятия (ERP) с инструментарием исполнения решений.

Накопительный эффект и структура рынка

ERPBench отслеживает эффективность агентов на протяжении шести раундов симуляции бизнеса, охватывающей пять взаимосвязанных операционных областей: динамическое ценообразование, графики закупок, производственные мощности, управление запасами и баланс казначейства. Результаты каждого цикла решений напрямую влияют на следующий: ранние ошибки вроде затоваривания складов или неоправданного демпинга мгновенно сокращают финансовую подушку компании.

На конкурентных рынках стратегические решения жестко взаимосвязаны: агрессивный демпинг или сброс складских остатков одним агентом в корне меняет доступный спрос для всех остальных участников.

Бенчмарк оценивает итоговую жизнеспособность бизнеса по финальной капитализации компании в 100 стандартизированных сценариях. Тестирование разделено на две принципиально разные рыночные среды: режим «Solo», где LLM-агент противостоит предсказуемым алгоритмическим соперникам, и жесткий режим «Arena», в котором шесть языковых моделей напрямую конкурируют друг с другом в общей рыночной экосистеме.

Нестабильность лидерства в конкурентной среде

Результаты тестирования шести передовых семейств моделей на базе 1200 траекторий и 7200 раундов операционных решений разрушают миф о том, что синтетические изолированные тесты способны прогнозировать реальную конкурентоспособность систем.

DeepSeek безоговорочно лидировал в соло-режиме со средней оценкой стоимости компании в 252,29 млн и средним рангом 1,67, однако резко терял позиции при столкновении с адаптирующимися оппонентами. Напротив, Gemini заняла первое место на «Арене», показав среднюю оценку в 263,95 млн и ранг 1,76, попутно снизив долю падений на последнее место с 22% в соло-режиме до нуля в конкурентной среде. В целом результаты одиночного режима совпали с исходами на «Арене» лишь в 21 сценарии из 100.

Статические одиночные тесты не способны выявить каскадные операционные сбои, которые неизбежно возникают при взаимодействии автономных моделей с рыночной обратной связью. Внедрение автономных агентов в корпоративные цепочки поставок и казначейские процессы без предварительного многоагентного стресс-тестирования ведет к прямому разрушению баланса компании.

Искусственный интеллектИИ-агентыБольшие языковые моделиИИ в бизнесеАвтоматизация