Одержимость технологической индустрии рейтингами моделей для написания кода, основанными на чистых показателях успеха (pass rates), — это опасное заблуждение, маскирующее колоссальные финансовые потери. Согласно исследованию Намана Ватса и Олега Голева из Sentient Labs, именно «каркас» (harness) — базовая инфраструктура, управляющая инструментами, контекстом и логикой остановки, — определяет операционные расходы в гораздо большей степени, чем сама языковая модель (LLM).

Парадокс эффективности каркаса

При тестировании моделей Qwen 2.5 Coder и MiniMax-01 на платформе Terminal-Bench Pro команда обнаружила, что смена каркасов (таких как Goose, OpenCode и OpenHands-SDK) приводила к ошеломляющей 40-кратной разнице в потреблении токенов на одну решенную задачу.

Этот «эффект каркаса» делает современные рейтинги практически бесполезными для корпоративного планирования. Данные доказывают: пока затраты на токены колебались в огромном диапазоне, дельта реальной производительности между моделями оставалась ничтожной — от 0 до 8 процентных пунктов.

В одном вопиющем случае из отчета Terminal-Bench 2.0 модель Claude 3.5 Sonnet потребила 256,9 миллиона токенов в одном каркасе по сравнению со всего лишь 3,9 миллиона в другом. Это 65-кратный разрыв в эффективности ради сомнительного прироста точности на 5,7 балла — компромисс, который не одобрил бы ни один здравомыслящий технический директор при условии прозрачности цифр.

Налог на недосмотр и циклы простоя

Критически важно, что паттерны отказов, такие как бесконечные циклы или «пустые итерации» (когда агент имитирует деятельность, не продвигаясь вперед), часто являются свойством каркаса, а не модели. Это создает скрытый «налог на надзор», вынуждая разработчиков присматривать за неэффективными системами, которые сжигают бюджеты вхолостую. Текущие бенчмарки не стандартизируют эти надстройки, в результате чего компании фактически покупают двигатель Ferrari, но подключают его к дырявому бензобаку.

Выводы для бизнеса

Пора прекратить оценивать LLM в изоляции: вы внедряете систему, а не просто модель. Масштабирование автономных агентов на основе голых показателей успеха без аудита связки «каркас-модель» — это прямой путь к запредельным задержкам и истощению бюджета. Первоочередная задача для руководства — протестировать конкретные спецификации каркасов на соответствие вашим ограничениям по токенам и скорости, прежде чем гнаться за очередной «про-моделью» из верхушки рейтинга.

ИИ-агентыИИ в бизнесеСнижение затратПроизводительностьБольшие языковые модели