В новом техническом отчёте исследователи предложили растянуть вычислительный цикл между токенами с помощью архитектуры Recurrent Looped Transformer. В этой схеме декодер становится рекуррентным для каждого шага генерации, охватывая и входящий запрос, и генерируемый ответ. Общую KV-память формирует каузальный энкодер. При обработке каждого нового токена декодер объединяет его представление из энкодера, собственное финальное скрытое состояние от предыдущего шага и кеш недавних активаций со скользящим окном.

Главная особенность схемы заключается в масштабировании вычислений: глубина рассуждений растёт вместе с длиной последовательности, но стоимость обработки каждого отдельного токена остаётся постоянной. Например, при декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый конкретный шаг требует фиксированного числа операций. Один и тот же переход между состояниями применяется на всех этапах: во время предварительного обучения, SFT, генерации ответов и воспроизведения в RL. При этом на границе между пользовательским запросом и генерацией ответа состояние не сбрасывается, а во время RL replay цепочка состояний вычисляется заново с актуальными весами модели, исключая использование устаревших данных из прошлых прогонов.

Представленная концепция пока остаётся исключительно архитектурным предложением. Авторы прямо подчёркивают, что реальный прирост в качестве рассуждений, ускорение на реальном железе и эффекты масштабирования в RL ещё предстоит подтвердить прямыми измерениями на практике.

Для бизнеса это означает одно: пока инженеры соревнуются в теоретическом снижении костов на инференс, платить за инфраструктуру сегодня приходится по старым тарифам. Архитектурные прорывы на бумаге не равны готовым enterprise-решениям, и спешить переписывать IT-бюджеты под рекуррентные трансформаторы точно не стоит, пока технология не пройдет боевые тесты на продакшене.

Машинное обучениеБольшие языковые моделиСнижение затрат