ИИ-агенты, развернутые в разработке ПО, корпоративных пайплайнах данных и автоматизированной поддержке клиентов, тратят колоссальный объем вычислительного времени на ожидание ответов от внешних инструментов. Поскольку стандартные агентные процессы построены на жестком последовательном цикле — запрос к модели, вызов API, ожидание ответа, генерация следующего токена — вся система буксует на каждом шаге. По данным исследования PASTE, выполнение внешних инструментов съедает от 35% до 61% общего времени работы агента, создавая узкое место, которое невозможно устранить простым пакетным увеличением вычислительных мощностей.

Предыдущие решения вроде одношагового механизма Speculative Actions адаптировали спекулятивное декодирование токенов для работы с инструментами, однако многошаговое прогнозирование неизменно приводило к потере надежности. Объединение частых подпрограмм в статичные мета-инструменты тоже провалилось: опенсорсные модели вроде Qwen3.5-27B систематически игнорируют скомпилированные цепочки действий, когда те представлены в виде перегруженных функций.

Многошаговые черновики и снимки окружения

Чтобы преодолеть эту задержку без дообучения базовых моделей, Зэюй Лю и Питер А. Бирел из Университета Южной Калифорнии совместно с Соувиком Кунду из Intel Labs создали фреймворк Speculative Macro Commit (SMC). Архитектура разделяет выполнение задач агентом на асинхронную двухуровневую иерархию: тяжелая ведущая модель принимает официальные решения по траектории, а легкая черновая модель спекулятивно и наперед выполняет цепочки действий на изолированных снимках рабочего окружения.

Среда исполнения извлекает повторяющиеся паттерны операций из обучающих логов и формирует индексированную библиотеку макросов. Как только черновая модель видит совпадение с шаблоном макроса, она запускает цепочку вызовов API внутри изолированной песочницы, не затрагивая основную рабочую среду.

Если следующий вызов инструмента от ведущей модели совпадает с первым действием из черновика, Speculative Macro Commit сразу применяет все заранее выполненные шаги и их результаты к официальной траектории агента.

Пакетное применение макросов при валидации только первого шага избавляет систему от множества синхронных запросов между дорогостоящими флагманскими моделями и медленными внешними API.

Практический выигрыш в скорости

В тестах, где в роли ведущей модели выступала Qwen3.5-27B INT4, а черновой — Qwen3.5-4B, фреймворк показал реальный прирост производительности. На датасете τ2-Bench Telecom система SMC сохранила точность последовательного подхода, сократив сквозную задержку на 10,23% по сравнению со Speculative Actions и на 18,59% относительно стандартного последовательного выполнения.

В стресс-тестах на бенчмарке со сложным взаимодействием AppWorld фреймворк сократил физическое время выполнения задач на 7,7% по сравнению со Speculative Actions и на 44,9% относительно базового последовательного подхода (хотя и с незначительным снижением общего процента успешно завершенных задач).

Speculative Macro Commit предлагает инженерным командам готовый подход к борьбе с простоями агентов: делегировать спекулятивные цепочки дешевым моделям в изолированных средах вместо перегрузки базовых моделей сложными абстракциями. Поскольку SMC фиксирует макросы целиком без промежуточных перерасчетов ведущей моделью, этот метод выступает приближенным ускорителем — а значит, корпоративным разработчикам придется находить баланс между приростом пропускной способности и допустимой погрешностью в критически важных процессах.

ИИ-агентыПроизводительностьАвтоматизацияБольшие языковые моделиОпенсорс ИИ