Обучение с подкреплением (RL) для больших языковых моделей не наделяет их принципиально новыми когнитивными способностями по мановению волшебной палочки. Вместо этого оно просто перераспределяет вероятности в пользу тех цепочек рассуждений, которые уже заложены в скрытом распределении базовой модели. В исследовании под названием «Rethinking RL for LLM Reasoning: It’s Sparse Policy Selection, Not Capability Learning» ученые Омер Фарук Акгюль, Раджгопал Каннан, Вилли Найсвангер и Виктор Прасанна из Университета Южной Калифорнии и DEVCOM ARL доказали: стандартные алгоритмы RL меняют лишь ничтожную долю генерируемых токенов.
Разреженная реальность переранжирования токенов
Проведя посимвольный анализ на уровне токенов для нескольких семейств моделей, исследователи выяснили: полезный эффект обучения с подкреплением затрагивает всего от 1% до 3% позиций токенов. Причем на этих ключевых позициях продвигаемый алгоритмом токен почти никогда не представляет собой новую идею — как правило, он входит в топ-5 вариантов, которые базовая модель уже рассматривала. Подобные правки точечно концентрируются в точках ветвления с высокой энтропией, где неопределенность базовой модели в 7–12 раз выше, чем на остальных участках генерации.
Обучение с подкреплением не учит новым стратегиям — оно лишь перераспределяет вероятности в пользу решений, которые уже есть в базовой модели.
Точечные корректировки исключительно в этих редких точках ветвления с высокой энтропией позволяют получить практически тот же прирост точности, что и полноценное обучение с подкреплением. При этом случайные правки токенов не дают никакого эффекта. Поскольку собственная энтропия базовой модели позволяет находить эти критические развилки без привлечения RL-моделей, вся процедура остается низкоразмерной и требует изменения крошечной доли параметров.
Замена тяжелого RL методом REASONMAXXER
Чтобы доказать отсутствие необходимости в затратных циклах оптимизации, авторы разработали REASONMAXXER — метод постобучения без использования обучения с подкреплением. Вместо того чтобы сжигать вычислительные ресурсы на тяжелые алгоритмы градиента стратегии (вроде PPO или GRPO) с непрерывной онлайн-генерацией, REASONMAXXER применяет контрастивную функцию потерь строго в точках принятия решений, отфильтрованных по энтропии. Алгоритм использует всего несколько сотен готовых генераций базовой модели и полностью исключает циклы онлайн-генерации во время обучения.
Эксперименты показали, что от сложной инфраструктуры для этапа post-training можно отказаться. Метод протестировали на трех семействах моделей, шести масштабах и шести бенчмарках математических рассуждений: REASONMAXXER показал результаты на уровне классического RL или превзошел его. Процедура требует лишь несколько десятков задач и пары минут вычислений на одном GPU, снижая вычислительные затраты на постобучение примерно в 1000 раз.
Что это значит
Результаты исследования меняют парадигму рассуждений в ИИ: обучение сводится не к освоению новых навыков, а к выбору уже существующих стратегий. Это ставит под сомнение необходимость аренды огромных GPU-кластеров под алгоритмы вроде PPO и GRPO. Главное ограничение подхода связано с его рамками: методология работает на бенчмарках математических рассуждений, где базовые модели уже содержат правильные решения внутри своего распределения сэмплов. Метод раскрывает скрытые компетенции модели, но не создает знания с нуля, если базовая модель ими не обладает. Главным открытым вопросом остается то, насколько эффективно контрастивные обновления по энтропии покажут себя в неструктурированных областях, где результат нельзя однозначно верифицировать.