Эра высокопроизводительного локального ИИ окончательно сворачивает в сторону радикального прагматизма. Стек GG/SparkInfer v20 наглядно демонстрирует, что для запуска тяжелой GLM-5.2 больше не нужно арендовать серверную стойку или кормить облачных гигантов. Разработчики выжали максимум из железа, внедрив агрессивное квантование NF3 и MXFP4. Для тех, кто привык считать совокупную стоимость владения (TCO), это сигнал: автономные системы на потребительских GPU становятся реальностью, не уступающей в скорости проприетарным API.
Технический прорыв в топологии данных
Технический прорыв здесь — не в маркетинговых лозунгах, а в оптимизации топологии DCP prefill. В версии v20 инженеры исключили лишние операции копирования (hot-path clone) и отказались от резервирования tail-padding, сохранив при этом физическую структуру head-major, безопасную для cuBLAS. Это позволило спрямить путь данных при обработке промпта и убрать инфраструктурные костыли, которые раньше «съедали» драгоценные миллисекунды.
Архитектурная эффективность v20 держится на виртуальном тензорном параллелизме (virtual TP6) и хитром управлении памятью через scratch extent формата W4A8-MX.
Согласно логам системы, SparkInfer теперь проводит адаптивное зондирование шины PCIe перед запуском модели. Это не просто проверка, а глубокий анализ DMA и пересечений CKV-оверлапа. Софт подстраивается под конкретную NUMA-конфигурацию локальной машины, а не полагается на «усредненные» параметры хоста разработки.
Главное в обновлении v20
Внедрение API для fused-MoE подняло скорость декодирования MTP0 с 44,66 до 48,48 токенов в секунду. Прирост производительности в 8,56% достигнут без ущерба для скорости обработки входного контекста (префилла). Жесткая фиксация границ элементов (element extents) и нативное исполнение смешанных режимов K3/K4 EXL3 превращают компактное железо в полноценную рабочую станцию.
Вы получаете стабильный, верифицируемый инференс и полную независимость от внешних поставщиков, сохраняя при этом возможности моделей флагманского уровня на собственном оборудовании.