Современные поисковые архитектуры сталкиваются с растущим давлением: от них требуют выдавать сбалансированные результаты списком, а не единичные точечные совпадения. Когда пользователи вводят широкие поисковые запросы для исследования темы, традиционная декомпозиция на несколько подзапросов опирается на тяжелые авторегрессионные языковые модели. Им приходится тратить вычислительные ресурсы на рассуждения токен за токеном перед тем, как выдать результаты.
Как отмечают Пэнчэн Цзян, исследователь-стажер, и Джудит Юэ Ли, старший инженер-исследователь из Google Research в статье, опубликованной 15 сентября 2026 года, опора на языковые модели zero-shot для декомпозиции с учетом баз данных порождает структурные задержки и парафрастический коллапс. Без явной оптимизации под конкретные базы данных стандартные модели скатываются в семантическое зацикливание, генерируя почти синонимичные подзапросы вместо поиска под разными углами.
"Вместо того чтобы полагаться на дорогие рассуждения во время инференса, фреймворк Retrieve-for-Train использует обучение с подкреплением один раз для тренировки легкой диффузионной модели."
Поскольку стандартные большие языковые модели фундаментально ограничены последовательной авторегрессионной генерацией, создание сотен промежуточных токенов рассуждения (chain-of-thought) формирует неизбежный нижний предел задержки. Это противоречит требованиям к отклику в продакшене быстрее секунды. Перенос этого экономического бремени с живых запросов полностью меняет юнит-экономику поиска.
Однопроходный поиск через диффузию
Чтобы избавиться от необходимости тратить бюджет на дорогостоящие онлайн-рассуждения, исследователи представили доклад на конференции ICML 2026 под названием «Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion». Предложенный фреймворк Retrieve-for-Train переносит обнаружение согласованных со свойствами разветвленных запросов в конвейер офлайн-обучения с подкреплением.
В рамках этой архитектуры компактная диффузионная модель учится напрямую отображать эмбеддинг запроса в полный набор целевых эмбеддингов за один неавторегрессионный проход. Эта стратегия компиляции позволяет системе достигать математически выверенных свойств на уровне наборов данных для фиксированной базы без генерации промежуточных токенов рассуждений во время выполнения живого запроса. Для руководителей инженерных команд это означает резкое сокращение затрат на инференс при одновременном обеспечении скорости отклика, необходимой для промышленных сред.
Как быстро поисковые системы перейдут на неавторегрессионную диффузию вместо моделей расширения через цепочки рассуждений, чтобы исключить расходы на вычисления во время тестирования?