Инженерные команды, масштабирующие автономных ИИ-агентов для написания кода, упираются в жесткие финансовые ограничения. Согласно отраслевым прогнозам, к 2028 году расходы на ИИ-кодинг могут превысить среднюю зарплату разработчика. Потребление токенов уже сейчас бьет по инженерным бюджетам: четверть технических лидеров сжигает от $200 до $500 на разработчика в месяц только на инференс моделей, а у активных команд эта цифра легко переваливает за $2 000.

Большая часть этих средств уходит впустую — на простые операции ввода-вывода, а не на реальные логические рассуждения. Стандартные рабочие процессы заставляют флагманские модели переваривать огромные кодовые базы и генерировать шаблонные юнит-тесты, сжигая миллионы премиальных токенов на примитивную рутину.

Декларативные режимы на эфемерной инфраструктуре

Spotify справился с этой неэффективностью, внедрив режимы AiKA Modes на базе своего внутреннего портала для разработчиков Portal. В архитектуре сервиса режим работает как декларативный агент в эфемерной среде выполнения — аналог AWS Lambda, адаптированный под исполнение агентных задач. Такая архитектура не требует постоянной инфраструктуры и может настраиваться как общекорпоративный инструмент или как изолированный пайплайн.

Чтобы отделить механическую рутину от дорогих флагманских рассуждений, инженеры развернули два специализированных воркера на базе Gemini 2.5 Flash с низкой температурой генерации (0.2). Режим массового чтения (bulk-reader) анализирует крупные репозитории и выдает сжатые структурированные выжимки без диалогового мусора. Режим генерации кода (code-writer) закрывает создание каркасов, заглушек для типов и типовых тестов, соблюдая стиль локального репозитория и избегая лишних комментариев.

«Режим — это декларативный агент, работающий в эфемерной среде: представьте AWS Lambda, но для агентов».

Поскольку эти временные воркеры работают на низкой температуре и отдают строгий структурированный код, флагманским моделям дальше по цепочке не приходится тратить ценные токены на парсинг markdown-разметки или вежливых фраз.

Делегирование загрузки тяжелых файлов и синтеза бойлерплейта дешевым прокси-агентам позволило Spotify сократить потребление токенов в Claude Code на 90%. Для CTO, оценивающих кривую расходов до 2028 года, вывод очевиден: необходимо закрывать разработчикам прямой неконтролируемый доступ к API и перенаправлять рутинный ввод-вывод через оркестрируемые архитектурные шлюзы до того, как счета за токены превысят фонд оплаты труда.

ИИ-агентыСнижение затратИИ в бизнесеАвтоматизацияSpotify