Развертывание передовых языковых моделей в условиях жестких ограничений по задержке и объему видеопамяти сделало 4-битное квантование весов и активаций (W4A4) базовым стандартом. Современные архитектуры все чаще переходят на гибридные конфигурации, заменяя стандартный механизм внимания softmax линейными операторами, чтобы ограничить потребление памяти на длинных последовательностях. Например, в архитектуре Qwen3.8-27B 48 из 64 слоев представляют собой рекуррентные блоки Gated DeltaNet (GDN), и лишь 16 остаются классическими слоями внимания. До недавнего времени инженеры оставляли рекуррентные компоненты в повышенной точности из-за опасений, что шум квантования внутри цикла рекуррентности будет бесконтрольно накапливаться на тысячах шагов обработки.
Опровержение мифа о хрупкости рекуррентных сетей
Исследователи в области ИИ Сергей Козырев и Давид Майборода опровергли это предположение, создав Minima — открытое решение, применяющее квантование NVFP4 W4A4 ко всем 496 линейным слоям Qwen3.8-27B, включая GDN-проекции. Формат NVFP4 объединяет 4-битные значения E2M1 со шкалой E4M3 на 16-элементный блок для нативного выполнения на современных ускорителях, сокращая размер модели до 17,5 ГБ.
«Мы проверили эту интуитивную догадку на практике, создав Minima: применили NVFP4 W4A4 ко всем 496 линейным слоям, включая GDN».
Вместо снижения качества по мере роста длины контекста квантованная архитектура сохраняет паритет с базовыми полноточными моделями. В тестах MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench и выборке RULER на длине до 64 000 токенов Minima соответствует точности BF16 в пределах статистической погрешности: средняя разница по пяти задачам составила незначительные -0,52 балла при стабильной перплексии на окнах контекста в 32K и 64K токенов.
Структурные механизмы стабильности 4-битного формата
Устойчивость рекуррентных слоев обусловлена математическими свойствами Gated DeltaNet. Во-первых, хотя входные данные содержат выбросы остаточного потока, поблочное масштабирование NVFP4 на 16 элементов изолирует эти всплески локально. Во-вторых, гейтовые проекции оказались наименее уязвимыми узлами: параметризации softplus, экспоненты и сигмоиды естественным образом сжимают погрешность матричного умножения примерно с 11% до 2% итоговой ошибки на выходе.
Кроме того, рекуррентный механизм дельта-правила удерживает шум квантования на стабильном плато на протяжении более чем 32 000 токенов. Обновления состояния перезаписывают накопленные следы ошибок по направлению текущего ключа, позволяя сети сбрасывать импульсы погрешности за несколько сотен шагов, вместо того чтобы накапливать отклонения на длинных дистанциях.
Рост эффективности и оптимизация инференса
Уменьшение объема модели до 17,5 ГБ ускоряет фазу префилла на 14–19% по сравнению со стандартными аналогами. Чтобы сохранить производительность на длинном контексте при промышленной эксплуатации, исследователи показали, что калиброванные шкалы FP8 для KV-кэша компенсируют 83% потерь без дополнительных вычислительных затрат. Готовый квантованный чекпоинт опубликован в открытом доступе на Hugging Face в репозитории minima-ai/mnma_qwen3.8_27b_nvfp4.
Вывод очевиден: рекуррентные слои в гибридных моделях не требуют сохранения высокой точности при низкобитном развертывании. Способность Gated DeltaNet подавлять дрейф квантования превращает гибридные архитектуры в экономичную и эффективную альтернативу классическим трансформерам для высоконагруженного корпоративного инференса.