Изучение феномена гиперфитинга показывает, как компактные предварительно обученные базовые модели адаптируются, когда микронаборы данных доводятся до нулевых потерь при обучении. В исследовании, опубликованном 11 сентября 2026 года, независимый исследователь tamewild оценил небольшие языковые модели, дообученные исключительно на 100–500 чистых траекториях логического вывода, состоящих из логических головоломок 5x5, причем в наборе для дообучения полностью отсутствовали математические данные. Синтетические траектории вывода были сгенерированы моделью Qwen3-235B-A22B-Instruct-2507 в сентябре 2025 года с использованием метода выборки с отклонением.

Дообучение Qwen 3 4B Base на 100 логических головоломках занимает примерно 6,5 минут на одном графическом процессоре. Эта краткая оптимизация позволяет 4-миллиардной модели достичь 85,26% на полном бенчмарке MATH, состоящем из 5000 задач, что означает прирост на +31,16% по сравнению с базовой контрольной точкой, и набрать 21,67% на тесте AIME 2025.

Qwen 3 4B Base, дообученная на 100 логических головоломках, достигает 85,26% на полном бенчмарке MATH из 5000 задач, обеспечивая прирост на +31,16% по сравнению с базовой версией.

Такое поведение демонстрирует, что обучение на структурированных синтетических шагах вывода напрямую переносится между доменами, зажигая обобщенные навыки решения количественных задач без необходимости использования миллиардов доменно-специфичных токенов.

Производительность на бенчмарках в разных масштабах моделей

Эффект логического переноса стабильно проявляется в различных семействах моделей и размерах параметров. Granite 4.1 3B Base, дообученная на 500 логических головоломках, набирает 77,73% на MATH-500 и 19.44% на AIME 2025, превосходя официальный базовый вариант IBM Granite 4.1 3B Instruct на 11,13 и 12,77 процентных пункта на соответствующих бенчмарках.

Масштабирование архитектуры до Qwen 3.5 9B Base дает еще более значительный прирост при обучении на 500 логических головоломках. Модель с 9 миллиардами параметров улучшает результат с 17,00% до 80,50% на логических головоломках 5x5 с метрикой Pass@3 на уровне 97,05%. На незагрязненной выборке ArXivMath от 05/26 ее точность возрастает с 5,42% до 22,92% при Pass@3 в 34,88%, достигая при этом 96,60% на MATH-500 и 60,67% на AIME 2025.

Адаптивное масштабирование потерь с помощью PCSS

Для управления оптимизацией на микронаборах данных без потери стабильности tamewild применил PCSS — масштабировщик потерь с сигмоидным калиброванием для каждого примера (Per-Example Calibrated Sigmoid Scaler). PCSS работает как адаптивный, учитывающий данные скалер потерь, производный непосредственно от фреймворка KTO.

Авторы продемонстрировали, что запуск KTO только с желательными/позитивными примерами дает результаты, крайне конкурентоспособные по сравнению со стандартным SFT.

Как зафиксировано в Таблице 4 оригинальной работы по KTO, запуск алгоритма выравнивания исключительно на желательных позитивных примерах не уступает обычному контролируемому дообучению. При настройке с параметром бета, равным 0.1, KTO увеличил общий средний балл бенчмарка с 29,7% до 31,1%, что обусловлено существенным относительным ростом на бенчмарке математических рассуждений GSM8K с 1,0% до 12,5%.

Получение сложных математических рассуждений не обязательно требует массивных математических корпусов, поскольку наборы данных чистого логического вывода при адаптивном масштабировании вроде PCSS могут высвободить скрытые алгоритмические возможности в компактных архитектурах. Для инженерных команд это сигнализирует о серьезном сдвиге в том, как кастомные ИИ-агенты могут локально адаптироваться на минимальном железе без вложения колоссальных капитальных затрат.

Большие языковые моделиМашинное обучениеДообучение моделейПроизводительность