Эпоха оценки ИИ-агентов по их способности выполнять разовые изолированные задачи подходит к концу. MerchantBench — новый фреймворк для тестирования от исследователей из Alibaba Group, Чжэцзянского и Пекинского университетов — представил суровую проверку реальности для сектора электронной коммерции. Это симуляция операционного цикла длиной в 365 дней на уровне заказов, разработанная для проверки долгосрочной согласованности действий (Long-Term Coherence). В отличие от традиционных метрик, фиксирующих сиюминутные успехи, эта система оценивает способность агента сохранять логику и операционную дисциплину на дистанции бизнес-марафона.
Стратегический контекст
Опираясь на массив из почти 100 000 реальных записей о транзакциях в e-commerce, MerchantBench заставляет агентов жонглировать 26 различными инструментами: от поиска поставщиков и ценообразования до управления денежными потоками. В этой непрерывной среде ранние ошибки агента — не просто оплошности, а ловушки, которые жестко ограничивают будущие стратегические варианты. Речь идет не о болтливой службе поддержки, а о том, сможет ли ИИ обеспечить выживание магазина, не столкнувшись с когнитивным срывом в середине финансового года.
Современный ИИ отлично рассуждает о бизнесе, но ему не хватает операционной выносливости, чтобы реально им управлять.
Итог
Результаты отчета MerchantBench отрезвляют тех, кто ожидал немедленного захвата ритейл-операций нейросетями. Даже лучшие конфигурации больших языковых моделей (LLM) смогли достичь лишь 27,3% от средних чистых активов, заработанных участниками-людьми. Данные указывают на катастрофический разрыв в темпоральном мышлении: агенты с трудом справляются с асимметрией ритейла, где денежные обязательства возникают мгновенно, а сбои в цепочках поставок и рыночные сдвиги проявляются с задержкой. По мере накопления данных текущие модели теряют концентрацию, отклоняются от основных целей и не могут адаптировать стратегию к нарастающей сложности живого бизнеса.
Для владельцев бизнеса и технических директоров вывод очевиден:
Свободное владение языком — это метрика тщеславия. Если агент не может удерживать цель в условиях разрозненных циклов обратной связи, он остается пассивом, а не активом. До тех пор, пока агенты не освоят долгосрочную согласованность, их место в песочнице, а не у руля глобальных цепочек поставок.