Современные LLM-агенты застряли в режиме «ожидания ответа». Пока система строит цепочку рассуждений, обращается к базам данных или вызывает API, бизнес теряет время. Исследователи из Калифорнийского университета в Санта-Барбаре и LinkedIn подтверждают очевидное: традиционные архитектуры — это узкое место. Агент сначала мучительно долго «думает», и только потом инициирует сетевой запрос. Для реального сектора это означает медленные интерфейсы и неэффективные конвейеры автоматизации, где стоимость инференса множится на простой оборудования.

Провал внешних черновиков

Попытки исправить ситуацию через спекулятивное выполнение — когда мы пытаемся угадать вызов инструмента до того, как агент его сформулирует, — долгое время упирались в стену. По словам Цзябао Цзи и Юйцзяня Лю, использование внешних «черновых» моделей (draft models) создает критический разрыв (speculator–agent gap). Легкая модель-помощник может выдать логичный запрос, но он не совпадет с логикой основного агента. В итоге — несовпадение, сброс предсказания и впустую потраченные ресурсы без малейшего выигрыша в скорости.

Разрыв между спекулятором и агентом возникает потому, что готовые легкие модели имитируют абстрактного помощника, а не конкретного агента, развернутого в вашей системе.

На наш взгляд, это важный урок: внешние предсказатели слишком неточны для сложной бизнес-логики. Вместо того чтобы городить огород из зоопарка моделей, исследователи предложили сделать агента собственным пророком. Так появился самоспекулирующий агент — единая модель, работающая в двух режимах. В режиме «агента» она решает задачу, а в режиме «спекулятора» предсказывает следующий вызов на основе частичных траекторий. Такая архитектура позволяет повторно использовать KV-кэш префикса, что радикально снижает вычислительные затраты.

Joint RL и реальные цифры

Чтобы научить модель усидеть на двух стульях, команда внедрила метод совместного обучения с подкреплением (Joint Agent-Speculator RL). Система тренируется на собственных данных: она одновременно оттачивает качество решения задач и точность своих предсказаний. Это напоминает гроссмейстера, который не просто делает ход, а заранее готовит доску для следующей комбинации, экономя время на переключение контекста.

Наш метод значительно улучшает метрику Hit@1 для следующего вызова инструмента.

Цифры подтверждают: совместное обучение работает. В тестах на агентский поиск (QA) и диалоговое использование инструментов точность первого угадывания (Hit@1) резко выросла. При этом, как подчеркивают авторы, ускорение не идет в ущерб качеству — вероятность успешного выполнения задачи остается прежней. Вы получаете отзывчивую систему, которая не стала глупее от того, что начала торопиться.

Эта работа дает четкий сигнал архитекторам AI-систем: хватит пытаться «подпереть» тяжелые модели мелкими суррогатами. Будущее за оптимизацией внутренних возможностей самопредсказания. Да, метод требует качественных данных о траекториях и все еще наказывает за ошибки прогноза сбросом вычислений, но это первый реальный шаг к тому, чтобы автономные системы перестали раздражать своей медлительностью.

ИИ-агентыПроизводительностьБольшие языковые моделиАвтоматизацияLinkedIn