Давайте признаем: запуск автономных ИИ-агентов все больше напоминает не развертывание софта, а оплату счетов за электричество для небольшого дата-центра. Когда агент для написания кода пускается во все тяжкие в автономном режиме, единичные предсказания быстро превращаются в раздутые цепочки рассуждений, бесконечные вызовы инструментов и повторяющиеся циклы обратной связи, которые незаметно опустошают корпоративный бюджет.
Пока остальная часть индустрии зациклена на поиске более дешевых моделей, квантовании или попытках сэкономить доли цента на сырых ценах за токены, инженеры NVIDIA решили разобраться, где именно происходит реальный перерасход. Согласно их недавним техническим отчетам, новая система SoL-Pi от NVIDIA сокращает потребление токенов ИИ-агентом почти вдвое — и все это без ущерба для реальной производительности модели.
Архитектура экономии
Секрет кроется вовсе не в более умной нейросети; проблема решается на уровне несовершенных связей между моделью и средой ее выполнения. Как подробно описано в отчете по результатам оценки системы на 535 исполняемых средах, исследователи изучили 152 различных структурных направления, используя 495 задач на основе реальных пар запрос-вытягивание (issue-pull-request) с GitHub, а также 40 синтетических тестовых сценариев.
Чтобы все было честно, команда использовала EdgeBench в качестве тестового бенчмарка и полностью изолировала его от процесса автоматического поиска. Такая методологическая строгость гарантировала, что система не просто заучила тестовые сценарии или переобучилась под настройки обучения. В результате автоматический поиск выявил четыре конкретных механизма контроля, призванных безжалостно отсекать избыточную работу во время выполнения, напрямую изменяя то, как агент обрабатывает промежуточные шаги и обратную связь от инструментов.
Финансовая реальность FinOps
Работа NVIDIA демонстрирует важнейшую реальность, которую стоит учитывать техническому руководству: инженерная инфраструктура на уровне управления обеспечивает колоссальный рост маржинальности, даже не затрагивая базовые веса модели.
Для финансовых директоров и вице-президентов по инженерии, уставших смотреть на то, как бюджеты на токены взрываются во время рутинных задач рефакторинга, сигнал более чем очевиден. Погоня за все более дешевыми моделями — это путь в никуда, если архитектура вашей обвязки спроектирована так, что расходует токены впустую. Реальная экономия для бизнеса достигается за счет оптимизации уровня управления, а не за счет перехода на более слабую модель.