Переход на инференс с низкой точностью стал вынужденным шагом для организаций, стремящихся масштабировать большие языковые модели без катастрофических затрат на вычислительные ресурсы. Хотя формат NVFP4 обещает 4-битную структуру с плавающей запятой и пропускную способность, оставляющую далеко позади FP8 или INT4, стандартный путь восстановления точности — квантование с дистилляцией знаний (QAD) — зашел в тупик. Инженеры PayPal диагностировали сбой на уровне репрезентаций, который объясняет досадный парадокс: почему модели, имитирующие вероятности ответов своих высокоточных учителей, все равно пасуют перед сложными логическими задачами. Исследование Фангбо Ту и Цзюньхуа Чжао показывает, что стандартные функции потерь на основе дивергенции Кульбака — Лейблера служат лишь сложной маской, скрывающей разрушение внутренней семантической иерархии модели под глянцем внешне правильных токенов.
Провал сопоставления результатов в моделях с RL-постобучением
Традиционная дистилляция зациклена на поверхности. Она заставляет модель-ученика имитировать итоговое распределение выходных данных замороженного учителя в формате BF16, исходя из предположения: если логиты совпадают, значит, и логика верна. Однако команда PayPal обнаружила, что такое выравнивание по выходу — опасное упрощение. Используя центрированное ядерное выравнивание (CKA) для анализа сходства слоев, исследователи выяснили, что стандартная дистилляция часто лишь усугубляет дрейф репрезентаций, который она призвана исправить. Это явление особенно губительно для моделей, сформированных обучением с подкреплением (RL). В таких сценариях модель-ученик учится жульничать: она выдает нужные токены, чтобы минимизировать функцию потерь, но делает это ценой искажения внутренней геометрии активаций. В итоге получается модель, которая успешно проходит поверхностные бенчмарки, но лишена глубокой семантической стабильности, необходимой для задач корпоративного уровня.
Сопоставление только выходных данных может маскировать внутреннюю деградацию, так как множество вариантов промежуточной геометрии активаций могут давать схожие, согласованные с учителем логиты.
Именно этот разрыв объясняет, почему 4-битная модель может выглядеть компетентной в демо-версии, но полностью проваливаться в реальном программировании или многошаговых логических выводах. Когда внутренняя логическая цепочка разорвана, модель перестает думать — она просто декламирует заученное. Исследование, в ходе которого оценивались такие модели, как Qwen3-4B-Thinking-2507 и Nemotron 3 Nano, доказывает, что внутренняя геометрия репрезентаций — единственный надежный фундамент для устойчивой работы в низкобитных форматах. Игнорирование этого факта при квантовании оставляет модель пустой внутри, склонной к галлюцинациям, которые невозможно исправить никаким дообучением на уровне выходных данных.
CKA-QAD: Сохранение внутренней геометрии через матрицы Грама
Чтобы преодолеть этот разрыв, исследователи PayPal представили CKA-QAD — методологию, в которой внутренняя форма модели рассматривается как приоритетный фактор. Вместо того чтобы просто оценивать финальный ответ, этот подход сопоставляет послойные матрицы Грама учителя и ученика. CKA выбран в качестве основного инструмента, так как он инвариантен к ортогональным преобразованиям и изотропному масштабированию. Проще говоря: если ограничения 4-битного формата заставляют данные вращаться или масштабироваться в пространстве активаций, CKA распознает, что базовая логика осталась нетронутой. Напротив, традиционные функции потерь для поточечных признаков остро реагируют на эти безобидные сдвиги, провоцируя вредные и ненужные корректировки, снижающие интеллект модели.
Инвариантность CKA к ортогональным преобразованиям и изотропному масштабированию делает этот метод менее чувствительным, чем поточечные потери, к безобидным поворотам и глобальным изменениям масштаба в пространстве активаций.
Оптимизируя как распределение выходных данных, так и внутреннюю геометрическую иерархию, CKA-QAD позволяет ученику унаследовать реальный процесс мышления учителя, а не только его словарный запас. В тестах на архитектурах Nemotron 3 Nano и Qwen этот метод значительно вернул точность в бенчмарках на кодинг и логику. Для руководства компаний бизнес-кейс очевиден: технология позволяет радикально снизить задержку инференса и капитальные затраты без ущерба для когнитивных способностей LLM. Накладные расходы на такое обучение незначительны, что делает метод обязательным для любых производственных циклов, нацеленных на развертывание в 4-битном режиме.
Итог
Выводы PayPal сигнализируют о необходимости перехода от измерения того, *что* говорит модель, к аудиту того, *как* она приходит к выводу. Хотя дивергенция Кульбака — Лейблера остается стандартом, ее явно недостаточно для архитектур с RL-постобучением, где требуется нечто большее, чем простое сопоставление слов. Индустрия столкнулась с новым технологическим порогом: если вы не сохраняете внутреннюю геометрию, вы не проводите дистилляцию модели — вы просто тренируете очень дорогого попугая. Следующим этапом станет проверка того, сохраняется ли эта геометрическая целостность при еще меньшей разрядности или формат NVFP4 является последним стабильным рубежом для сложных латентных пространств.