Гонка за внедрением больших языковых моделей (LLM) в устройства с ограниченными ресурсами официально зашла в тупик: стандартное равномерное квантование не справляется из-за выраженной анизотропии активационных пространств. Данные последних исследований эмбеддингов подтверждают, что несколько аномальных признаков резко возрастают по амплитуде, заставляя специфические направления доминировать в ковариационной матрице уже после нескольких слоев. Традиционные квантователи фактически выбрасывают вычислительные ресурсы на ветер, относясь ко всем геометрическим направлениям как к равным. Новый метод, не требующий дообучения, под названием KLQ (Kullback-Leibler Quantization) от разработчика BalSob107, отказывается от этого демократичного подхода. Вместо этого он использует собственное разложение для поиска критических направлений и измеряет каузальную чувствительность модели к любым микроизменениям и возмущениям.

Квантование через дивергенцию Кульбака — Лейблера

Вместо попыток сгладить естественную геометрию модели с помощью манипуляций на основе вращения, KLQ адаптируется к хаосу. Для каждой матрицы весов алгоритм проводит собственное разложение ковариационной матрицы активаций на основе калибровочного набора данных. Затем он методично вносит искажения: возмущая активации вдоль выявленных направлений и измеряя дивергенцию Кульбака — Лейблера (KL) на выходе, KLQ вычисляет показатель каузальной значимости для каждого пути. Для распределения битового бюджета используется алгоритм заполнения водой (water-filling) — математически оптимальный способ гарантировать, что дефицитная видеопамять не будет потрачена на шум. В отличие от жестких двухуровневых систем вроде CoQuant, KLQ оценивает распределение битов на основе реально измеренной дивергенции, концентрируя точность там, где она лучше всего предотвращает деградацию логики.

KLQ распределяет биты по направлениям методом заполнения водой — доказуемо оптимальным способом в рамках данной модели.

Тестирование и производительность

Экономическую выгоду трудно игнорировать: отказываясь от фазы дообучения и огромных затрат GPU-часов, связанных с методами GPTQ или LDLQ, KLQ радикально сокращает капитальные затраты на развертывание локальных систем. Бенчмарки показывают, что Llama 3.2 1B в жесткой конфигурации W4A4KV4 обходит SpinQuant и вплотную приближается к ReSpinQuant. Этот переход от тяжелых облачных вычислений к высокоточному инференсу на дешевых чипах меняет правила игры для обеспечения приватности и снижения задержек на конечных устройствах. Однако существует техническая цена: фаза калибровки требует одного прямого прохода на каждое направление каждой матрицы. Хотя вы экономите на обучении, логическая целостность полученной модели остается заложницей качества исходных данных для калибровки. В специфических бизнес-сценариях, где распределение данных меняется, эта геометрическая заданность может привести к неожиданному снижению качества рассуждений, если калибровочный набор был недостаточно репрезентативным.

Большие языковые моделиПроизводительностьСнижение затратЛокальный ИИ