Обучение автономных ИИ-агентов для работы в корпоративных цифровых средах долгое время упиралось в дорогостоящее узкое место: сбор качественных датасетов, связывающих последовательности вызовов инструментов с реалистичными запросами пользователей. Традиционная генерация синтетических данных строится от обратного — сначала создаются гипотетические инструкции пользователя, а затем агенты методом прямого перебора в глубину пытаются нащупать корректные пути вызова API. Для технических руководителей, управляющих сложными экосистемами API, такой подход оборачивается колоссальными расходами на вычисления, бесконечными циклами проб и ошибок, а также нестабильными эталонными данными.
Чтобы устранить эту структурную неэффективность, исследователи Google XR Чжунъи Чжоу и Жофэй Ду представили на ACL 2026 фреймворк ToolGrad. Он реализует инверсию архитектуры: сначала синтезирует и валидирует исполняемые траектории вызовов инструментов, и только затем за один детерминированный проход генерирует с помощью LLM соответствующий пользовательский запрос. Формируя программно подтвержденную истину заранее, ToolGrad полностью исключает затраты на поисковый перебор.
Текстовые градиенты и итеративная архитектура
ToolGrad адаптирует концепцию текстовых градиентов из области итеративной оптимизации промптов и применяет ее напрямую к синтезу данных. Вместо случайной выборки по реестрам инструментов фреймворк использует обратную связь в виде текстовых градиентов для итеративной доработки, отладки и связывания сложных цепочек API-вызовов до тех пор, пока граф выполнения не будет отрабатывать без ошибок времени исполнения.
Превосходство над закрытыми моделями
Эмпирические тесты показывают, что компактные модели с открытыми весами, дообученные на синтезированных ToolGrad траекториях, не уступают передовым проприетарным LLM на сложных нестандартных задачах с ранее неизвестными API.
Для корпоративной разработки этот архитектурный сдвиг радикально снижает совокупную стоимость владения (TCO) специализированными внутренними агентами. Вместо того чтобы тратить огромные бюджеты на инференс закрытых флагманских моделей для навигации по внутренним инструментам компании, бизнес может дообучать легковесные локальные модели на выверенных синтетических данных за малую часть прежнего вычислительного бюджета.