Пост-тренинг языковых моделей долгое время опирался на дорогостоящую догму: чтобы привить нейросети способность к строгому логическому рассуждению, разработчики были обязаны контролировать каждый отдельный токен на всем пути вычислений. Считалось, что без плотной пошаговой обратной связи по всей сгенерированной последовательности аналитическая связность модели неизбежно разрушится.
Пересмотр концепции плотной обратной связи
Исследователи Чжишуай Лю, Синцзы Сюй, Мехмет Сайгын Сейфиоглу, Пан Сюй и Карим Буярмане из Amazon и Университета Дьюка опровергли это фундаментальное убеждение. Их выводы показывают, что устойчивое логическое мышление можно активировать с помощью ультраразреженного контроля — вмешиваясь всего в один или два токена на траекторию в процессе on-policy дистилляции (OPD), что составляет примерно 0,05% от общего объема токенов.
«Способность к логическому выводу можно эффективно стимулировать за счет крайне малой доли генерируемых токенов — всего одним или двумя токенами на траекторию рассуждения, что соответствует лишь 0,05% от их общего числа».
Вместо тяжелого расхода вычислительных ресурсов на расчет градиентов по всей цепочке рассуждений, точечная обратная связь в критических узлах дает результаты, сопоставимые с традиционным плотным обучением, а часто и превосходит его. Разреженные сигналы заставляют модель усваивать глубинную логическую структуру задачи, а не просто переобучаться под пошаговое подражание на уровне отдельных токенов.
Проверка на различных архитектурах
Команда исследователей подтвердила эту механику на девяти конфигурациях «учитель — ученик» различного масштаба в задачах на математическое мышление и написание кода. Эксперименты включали оценку на архитектурах Llama и алгоритмах обучения с подкреплением на основе проверяемого вознаграждения (RLVR) с использованием оптимизации PPO.
При тестировании математического мышления на бенчмарке AIME 2025 методом дистилляции Qwen3-4B-Instruct-2507 в модель-ученик Qwen3-8B вариант разреженной OPD под названием `maxtok` превзошел как модель-учителя, так и стандартную плотную дистилляцию. Даже метод `rand1tok`, случайно выбирающий один токен на траекторию, значительно улучшил рассуждения по сравнению с базовой моделью. Это доказывает, что запуск логического мышления гораздо меньше зависит от непрерывного градиентного контроля, чем предполагалось ранее.
Разрыв в эффективности на этапе пост-тренинга
Что это меняет для корпоративной ML-инфраструктуры:
Сокращение объема контролируемых токенов на 99,95% позволяет инженерным командам радикально снизить расходы на аренду GPU-кластеров при дообучении и дистилляции под узкие доменные задачи. Открывается быстрый и более дешевый путь к развертыванию высокопроизводительных компактных локальных моделей без потери глубины аналитики.
Главный открытый практический вопрос заключается в том, как масштабировать эвристический выбор токенов (вроде `maxtok` и `mintok`) на реальные неструктурированные бизнес-процессы, где сигналы проверяемого вознаграждения сформировать значительно сложнее.