Сжатие больших языковых моделей ради сокращения расходов на инференс всегда требовало болезненного компромисса: урезание числа параметров и переход на 4-битные веса снижали требования к видеопамяти ценой деградации логики, математических способностей и качества генерации кода. Чтобы компенсировать эти потери, в пайплайнах применяют фазы восстановления после сжатия — такой подход используют для открытых моделей, включая gpt-oss, линейку Nemotron от NVIDIA и Hypernova 60B.

В чем изъян классических пайплайнов восстановления

Стандартные методы восстановления после сжатия дают сбой, когда структурное прореживание (прунинг) объединяют с низкобитным квантованием. Как показали исследователи Multiverse Computing Антонио Тьене, Икер Гарсия-Ферреро, Али Хашеми и Бакберген Рыскулов в работе «Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs», классические подходы упираются в жесткий структурный потолок. Основное решение — квантование в процессе обучения (QAT) — внедряет операции имитации квантования в прямой проход и возобновляет тонкую настройку по целевым функциям потерь. Это вынуждает команды проводить дорогостоящие этапы постобучения (SFT и RLHF) через зашумленные низкоточные проходы, провоцируя вычислительную нестабильность.

Дистилляция с учетом квантования пытается обойти эти накладные расходы за счет согласования выходных логитов с замороженной полноточной моделью-учителем через дивергенцию Кульбака — Лейблера (KL). Однако при структурном прунинге независимого полноточного бейзлайна для урезанной архитектуры просто не существует. В итоге инженеры используют восстановленный чекпоинт в формате bfloat16 — уже деградировавшую, дистиллированную аппроксимацию оригинальной модели. Дистилляция от такого учителя с потерями навсегда ограничивает точность 4-битной модели-ученика на искусственно заниженном уровне.

Прямая дистилляция от несжатых моделей

Метод Quantization-Aware Healing полностью исключает промежуточную потерю качества. Вместо использования скомпрометированного промежуточного чекпоинта дистилляция идет напрямую из оригинальной несжатой полноточной модели в 4-битную модель-ученика. Поскольку дивергенция Кульбака — Лейблера сопоставляет выходные распределения вероятностей, а не внутреннюю топологию весов, учителю и ученику не требуется совпадение числа параметров или слоев.

При такой схеме квантование перестает быть компромиссом с неизбежными потерями и превращается во второй проход обучения под контролем исходного учителя. Модель-ученик полностью избегает жестких меток, перенимая более богатые распределения сигналов, которые были упущены на начальном этапе восстановления bfloat16, и опирается на математическую стабильность фиксированной функции потерь.

Результаты тестов и влияние на инфраструктуру

В тестах на модели GPT-OSS 120B, сжатой до 60B параметров и квантованной до формата MXFP4, пайплайн Quantization-Aware Healing создал 4-битного ученика, который превзошел собственный полноточный бейзлайн bfloat16 в 7 из 9 бенчмарков. Полученная модель уменьшает число параметров вдвое и радикально снижает требования к видеопамяти, обеспечивая при этом более высокую точность, чем исходный неквантованный чекпоинт.

Для технических директоров и руководителей ML-инфраструктуры преодоление штрафа за сжатие меняет экономику локального инференса. Прямая дистилляция от несжатой модели к квантованной избавляет от необходимости держать в продакшене тяжелые полноточные веса только ради сохранения логических способностей, открывая дорогу плотным низкобитным развертываниям на бюджетном оборудовании без потери производительности.

Большие языковые моделиМашинное обучениеСнижение затратЛокальный ИИОпенсорс ИИ