Современные AI-агенты уперлись в стену, где поверхностная оптимизация сталкивается с жесткой инженерной реальностью. Согласно исследованию Джехёка Ёна и его коллег из Института ELLIS в Тюбингене и Института Макса Планка, нынешние бенчмарки безнадежно устарели: они позволяют моделям имитировать успех, просто извлекая из памяти известные «рецепты», вместо того чтобы решать уникальные инфраструктурные задачи. Исследователи выяснили, что хотя топовые агенты и способны обойти базовый PyTorch в 8 раз, они все еще проигрывают даже примитивному перебору гиперпараметров, который дает прирост в 11,53 раза. Проблема не в нехватке знаний, а в неспособности системно предлагать и проверять разнообразные конфигурации в условиях реального времени.
Суровые условия InferenceBench
Чтобы вскрыть этот нарыв, команда представила InferenceBench — среду, в которой у моделей нет заранее прописанных сценариев. Агента бросают в роль автономного инженера: за два часа «грязного» времени он должен развернуть OpenAI-совместимый сервер вывода на NVIDIA H100 и оптимизировать его под конкретный сценарий — будь то задержка первого токена, пропускная способность при параллельных запросах или баланс всех метрик сразу.
Это не теоретический тест, а полевое испытание: качественный анализ показал, что современные модели тратят слишком много времени на бесконечные замеры и мелкую правку одних и тех же параметров, вместо того чтобы пробовать радикально иные стратегии развертывания.
Главные выводы для бизнеса
Для CTO и лидов инфраструктуры данные InferenceBench звучат как холодный душ: нынешние AI-агенты — это скорее прилежные стажеры, чем опытные системные инженеры.
Модели в 4 раза улучшают дефолтные настройки vLLM, но пасуют перед сложным поиском. Неумение системно исследовать пространство параметров ведет к нецелевому расходу ресурсов H100. Цена ошибки в продакшене — это прямой простой мощностей и впустую потраченные деньги на дорогое железо.
Этот бенчмарк фиксирует важный сдвиг к оценке реального возврата инвестиций (ROI) автономных агентов. Здесь успех измеряется не баллами в таблице, а эффективностью работы серверного парка.