В классических сценариях на базе ReAct языковые агенты тратят непозволительно много времени впустую. Пока агент ожидает ответа от внешних инструментов, баз данных или API среды, процесс рассуждения полностью блокируется. Исследовательская группа из Сингапурского университета менеджмента — Чжэньсу Сунь, Чэнжань Ян, Юньбо Люй, Цзеке Ши и Дэвид Ло — решила проблему этого узкого горлышка с помощью Second Thought. Это инференс-фреймворк, созданный для использования простоев ввода-вывода (I/O) под асинхронные спекулятивные рассуждения.
Система вообще не требует дообучения (training-free), что избавляет от операционных накладных расходов и затрат на адаптацию весов модели. Как только агент завершает исходную фазу рассуждений (Thought), Second Thought тут же разветвляет генерацию на четыре вспомогательных потока параллельно основной траектории. Когда отклик среды наконец поступает, среда исполнения отсекает ненужные ветки и напрямую встраивает релевантные предварительно вычисленные рассуждения в последующие шаги.
Эмпирические тесты на трех наборах бенчмарков и трех reasoning-моделях подтвердили эффективность спекулятивной разгрузки. Second Thought сократил последовательное декодирование в основном потоке максимум на 43% в шести из девяти конфигураций, уменьшил общее число шагов во всех девяти и срезал медианную общую задержку (wall-clock latency) на задачу на 10,9%. Параллельно фреймворк показал прирост точности Pass@1 на 12,4 и 10,2 процентных пункта в отдельных тестах. Для инженерных команд, поддерживающих масштабные автономные пайплайны, превращение пауз ожидания I/O в упреждающий инференс дает практический рост пропускной способности без вмешательства в архитектуру моделей.