Обучение с подкреплением на основе верифицируемых наград (RLVR) стало стандартом пост-тренинга для передовых рассуждающих моделей, а алгоритм Group Relative Policy Optimization (GRPO) закрепился в качестве базового оценщика преимущества во флагманских архитектурах вроде DeepSeek-R1. В типичном пайплайне GRPO модель генерирует группу вариантов ответов на каждый запрос, оценивает их бинарным верификатором результата и распределяет веса преимуществ на основе статистики внутригруппового вознаграждения. Однако исследователи Джиамян Ван и Чжицян Тао из Рочестерского технологического института вместе с Самядипом Басу, Коуставой Госвами и Тонгом Ю из Adobe Research выявили критический изъян: этот механизм нормализации одинаково оценивает как безупречные дедуктивные цепочки, так и ошибочные рассуждения, случайно приведшие к правильному ответу. Алгоритм не способен отличить логический вывод от стохастического везения, что создает системное искажение — так называемое ложное преимущество, заставляющее градиенты закреплять поверхностное угадывание.

Три уязвимости в обучении RLVR

Подобное искажение дестабилизирует оптимизацию моделей в трех ключевых сценариях.

Во-первых, страдают задачи с ограниченным набором ответов (например, тесты с выбором варианта): случайное попадание здесь происходит с базовой вероятностью 1/N, из-за чего полностью галлюцинированные шаги рассуждения получают максимальное положительное подкрепление.

Во-вторых, скрытая деградация происходит в задачах со свободным ответом, но узкими промежуточными подшагами, если необоснованные срезы логики случайно приводят к верному итоговому токену.

В-третьих, многошаговые поисковые агенты, работу которых оценивают исключительно по финальному результату, начинают вырабатывать избыточные и зашумленные стратегии. Траектории с большим лимитом действий исследуют более широкое пространство, накапливая некорректные вызовы API и нерелевантные промежуточные запросы, но все равно добираются до нужного ответа. Поскольку стандартный GRPO рассчитывает величину преимущества напрямую из соотношения верных и неверных попыток в выборке, эти удачные объезды передают искаженные градиентные сигналы прямо в параметры модели.

Устранение зависимости от состава выборки

Чтобы отделить дедуктивное мышление от случайных попаданий без раздувания вычислительных бюджетов, команда Adobe и RIT разработала альтернативный оценщик — SignBalance. Вместо расчета весов на основе распределения внутри группы SignBalance отвязывает величину преимущества от сиюминутного соотношения успешных и провальных генераций. Метод сохраняет знак бинарного верификатора, задает глобальную константу масштабирования и восстанавливает баланс с нулевым средним через масштабирование по классам с отсечением градиента (stop-gradient).

На бенчмарках математических рассуждений и поисковых агентов для моделей разных масштабов SignBalance не уступает GRPO в классических открытых задачах по математике, при этом стабильно превосходя его в тестах с ограниченным выбором и сложных поисковых сценариях. Для ML-команд, дообучающих открытые reasoning-архитектуры, вывод очевиден: оптимизация RLVR исключительно по финальному результату слепо поощряет подгонку ответов, если градиентные оценщики явно не нейтрализуют фактор случайной удачи.

Машинное обучениеБольшие языковые моделиДообучение моделейИИ-агенты