Традиционные бенчмарки вроде GAIA или SWE-bench имеют один критический изъян: они относятся к вычислительным мощностям и вызовам API как к бесконечному ресурсу. В вакууме научных публикаций успех выполнения задачи — это все, а стоимость — лишь сноска на полях. Однако для любого технического директора, оплачивающего счета, агент, который решает проблему стоимостью 5 долларов, сжигая при этом токенов на 50 долларов, — это не решение, а прямая угроза бюджету. Исследователи Atlassian Цзе У, Мин Гун, Фэйсян Чэн и Циньцинь Чжао наконец-то привносят долю финансового реализма в индустрию с помощью EcoAgent-Bench. Этот фреймворк выходит за рамки чистой производительности, требуя от агентов воспринимать каждое действие как финансовое решение с реальным ценником.
Главное
Тестирование на 304 сценариях из реальной практики с жестко заданными бюджетами. Оценка способности агента выбирать дешевые модели для простых задач и экономить на внешних данных. Введение метрики экономической последовательности для отсеивания случайных результатов. Удручающие показатели текущих моделей: точность выполнения задач в рамках бюджета не превышает 24%.
Бенчмарк включает 304 задачи, основанные на реальных кейсах, каждая из которых снабжена явным бюджетом и многоуровневой системой оплаты за использование моделей и извлечение внешних данных. Теперь агенту недостаточно быть просто умным — он обязан быть эффективным. Команда Atlassian выделяет четыре ключевых экономических навыка, необходимых жизнеспособному агенту: умение отказываться от ненужной эскалации, выбор более дешевой модели при тривиальных рассуждениях, поиск внешних данных только при исчерпании локальных ресурсов и, что самое важное, понимание того, когда стоит прекратить безнадежное выполнение задачи до того, как баланс обнулится.
Чтобы отделить случайное попадание от осознанной экономической логики, бенчмарк использует показатель «согласованности» (consistency score), который штрафует агентов как за чрезмерную скупость, так и за слепую расточительность.
Результаты стали холодным душем для тех, кто верит в хайп вокруг автономных агентов. Агенты, работающие через API инструментов, продемонстрировали ничтожный уровень строгого успеха в диапазоне 3,9–24,0%, а их экономическая последовательность достигла жалкого максимума в 7,3%. В одном из показательных тестов увеличение доступного бюджета почти не повлияло на частоту эскалации задач, подняв ее с 0% до мизерных 3%. Эти модели не являются рациональными экономическими субъектами; это жесткие скрипты, которые либо сдаются слишком рано, либо сжигают корпоративную кредитку на задачах, требующих лишь малой доли затраченной мощности.
Итог
Переход от парадигмы «ИИ любой ценой» к расчету окупаемости каждого токена — это именно та встряска, в которой нуждается отрасль. Если агент не способен отличить сложную логическую проблему от копеечного поиска данных, ему не место в производственной среде. Для разработчиков целью становится не просто создание работающей модели, а проектирование системы, понимающей: в реальном мире выживает только тот, кто умеет считать деньги.