Попытка оптимизировать расходы на генеративный искусственный интеллект через выбор самого дешевого тарифа за миллион токенов регулярно приводит к прямо противоположному результату. Внедрение автономных агентов в реальный прод подчиняется совершенно другой математике, нежели банальный одиночный промптинг. На практике победный отчет о снижении номинального счета за API оборачивается деградацией пайплайнов и кратным ростом фактической себестоимости каждого доведенного до конца тикета.
Ловушка прайса и фиктивная оптимизация
Руководитель направления Java и Kotlin разработки в FinTech и E-commerce Сергей Прощаев описал хрестоматийный сценарий автоматизации рутины. Команда подключила агентскую систему к разбору упавших интеграционных тестов и подготовке черновиков правок. Изначально пайплайн запустили на топовой модели. Через три недели финансовый контроль справедливо заметил, что годовая проекция расходов перекрывает зарплату еще одного штатного разработчика. Логичным решением показался даунгрейд системы на более доступную модель.
Счёт упал примерно на треть, а количество задач, которые агент доводил до зелёных тестов, упало сильнее — и каждая закрытая задача стала обходиться дороже, чем была.
Как отмечает ресурс buildthisnow.com, в индустрии выбор оптимальной модели давно распался на совокупность факторов: эффективность на доллар, специфика задачи и бюджет токенов. Разброс базовых тарифов между краями бенчмарков превышает тридцать раз по входному контексту и сотню раз по генерации. Выбор нижней строчки прайс-листа создает у финдиректора приятную иллюзию экономии, но напрочь игнорирует природу многошаговых агентских сценариев.
Анатомия инженерного даунгрейда
Агент практически никогда не решает инженерную задачу за один шаг. В исследовании ProjDevBench (arXiv:2602.01655), где шесть агентов собирали проекты с нуля по двадцати задачам в восьми категориях, средний расход составил 138 итераций и 4,81 миллиона токенов на задачу. При этом доля принятых решений застыла на скромных 27,38%. Распределение потребления ресурсов имеет тяжелый хвост: зациклившийся в бесконечных ретраях агент утягивает график затрат в космос.
Механика биллинга в подобных архитектурах беспощадна: оплата начисляется за каждый шаг. Агент читает файл — уходит запрос. Запускает тесты и получает лог — отправляется новый запрос, куда повторно подтягивается весь предыдущий контекст. К десятой итерации бизнес оплачивает первый файл уже в десятый раз. Если дешевая модель тупит вдвое чаще, мнимая скидка на тариф сгорает на первых же холостых циклах.
Учет кэширования и метрика успешности
Второй пласт ошибок связан с наивным расчетом кэширования контекста. Провайдеры диктуют принципиально разные правила: у Anthropic и свежих моделей OpenAI чтение из кэша тарифицируется со скидкой до 90% от базовой входной ставки, тогда как Google на неявном кэшировании забирает порядка 75% полной стоимости. При этом дисконт касается исключительно входных токенов — генерация не дешевеет ни у кого.
Технический контроль метрик требует жесткого разделения входного потока на кэшированную и чистую части прямо на шлюзе взаимодействия с API. Провайдеры отдают данные по-разному: одни выносят закэшированные токены в отдельное поле вне общего счетчика, другие запаковывают их внутрь входного объема. Без нормализации этих структур C-level получает искаженную аналитику с задвоенным учетом или абсурдными отрицательными значениями.
Единственная рабочая метрика юнит-экономики для топ-менеджмента — это Cost per Success, куда включены как реальные расходы на холостые прогоны дешевых моделей, так и часы сеньоров, потраченные на валидацию и переписывание агентского кода.