Разработчик akopytko представил оптимизированное квантование NVFP4 GGUF для модели Qwen3.8-27B, созданное специально под архитектуру Nvidia Blackwell. Решение обеспечивает прирост пропускной способности при обработке промптов (prefill) на 50% по сравнению со стандартными 4-битными базовыми показателями. Что особенно важно для инженерных команд, кастомный формат N4_0 сохраняет полную совместимость с основной веткой llama.cpp из коробки и бесперебойно работает на широком спектре оборудования — от рабочих станций с картами линейки RTX 50 до корпоративных ускорителей DGX Spark, B200 и B300.

Аппаратные тесты на RTX 5090 (штатный TDP 575 Вт) зафиксировали для формата N4_0 скорость в 6 258,74 токена в секунду на этапе обработки промпта (pp2048, ubatch 512). Это превосходит показатели реализации NVFP4 от Unsloth (6 018,71 ток/с) и оставляет далеко позади стандартный Q4_0 (4 139,00 ток/с). Автору удалось выжать дополнительные 4–7% производительности за счет отказа от накладных расходов глобального масштабирования тензоров Nvidia, а также внедрения офлайн-поиска масштаба по методу среднеквадратичной ошибки (MSE) при квантовании. Это позволило изолировать оптимальное представление UE4M3 и минимизировать ошибки реконструкции тензоров. В связке со встроенной драфт-головой NVFP4 MTP пайплайн показал стабильную скорость генерации (decoding) в 152 ток/с при коэффициенте принятия драфт-токенов 0,75.

Метрики перплексии подтверждают, что рост скорости не привел к падению качества: тесты на датасете Wikitext показали для N4_0 среднюю дивергенцию Кульбака — Лейблера (KLD) 0,066254 и 88,525% совпадения по метрике Top-P относительно базовых весов BF16, что даже немного лучше результата Unsloth (0,070824 KLD). Для руководителей инфраструктуры и технических основателей нативное 4-битное исполнение на чипах Blackwell переводит модели масштаба 27B из категории тяжелых решений для дорогостоящих multi-GPU кластеров в формат локального развертывания на одной рабочей станции или edge-устройствах, радикально меняя экономику корпоративного инференса.

NVIDIAБольшие языковые моделиAI-чипыЛокальный ИИПроизводительность