Оптимизация локального инференса для архитектур Mixture of Experts (MoE) остается постоянным узким местом для инженерных команд, стремящихся снизить высокие расходы на коммерческие API без раздувания аппаратных бюджетов. Пулреквест #26534 в репозитории ggml-org/llama.cpp напрямую решает эту проблему, внедряя прогнозирование нескольких токенов (Multi-Token Prediction, MTP) на уровне вычислительного графа для модели GLM-4.5-Air через пайплайн выполнения `glm4moe graph_mtp`.

Техническая реализация и архитектурная поддержка

Опираясь на наработки для GLM-4.7-Flash, этот пулреквест интегрирует спекулятивное декодирование глубже в графы выполнения среды исполнения. Конвертер теперь поддерживает режимы `--no-mtp`, `--mtp` и унифицированные комбинированные файлы формата GGUF, тогда как загрузчик среды исполнения работает с комбинированными, trunk-only (только основа) и автономными MTP-конфигурациями. Для моделей, распространяемых без встроенного спекулятивного блока NextN, разработчики могут подключить внешнюю draft-голову MTP через Hugging Face. Тестирование подтвердило полное отсутствие регрессий на смежных архитектурах, таких как Solar Open и GLM-4.6V.

Результаты бенчмарков при различных уровнях квантования

Тестирование на рабочей станции потребительского класса с четырьмя видеокартами RTX 3090, где полностью выгруженная модель `GLM-4.5-Air-trunk-only-Q4_K_M` работала в связке с draft-моделью `GLM-4.5-Air-MTP-Q4_K_M`, показало базовую производительность в 74,55 токена в секунду. Активация одного спекулятивного токена (`--spec-draft-n-max 1`) подняла среднюю пропускную способность до 88,73 токена в секунду (ускорение в 1,19 раза) с пиковыми значениями 94,41 т/с (в 1,27 раза) на задачах структурированного мышления вроде `stepwise_math` и 90,34 т/с (в 1,21 раза) на переводе.

«Тестирование нескольких существующих GGUF-файлов с Hugging Face (как combined-MTP, так и trunk-only) показало, что одна и та же внешняя draft-модель MTP работает и с проверенными дообученными версиями, стабильно обеспечивая прирост скорости примерно в 1,17–1,20 раза при флаге --spec-draft-n-max 1».

Увеличение глубины спекуляции упирается в жесткие архитектурные ограничения. Переход на MTP 2 снизил среднюю пропускную способность до 83,69 токена в секунду (ускорение в 1,12 раза), а MTP 3 опустил производительность ниже базового уровня — до 72,05 токена в секунду (0,97x от базы). Для локальных MoE-стеков спекуляция в один токен оказалась оптимальной точкой баланса до того, как накладные расходы на валидацию draft-токенов нивелируют выигрыш.

Масштабирование Multi-Token Prediction на полную GLM-4.5

Оптимизация масштабируется и на полноразмерные развертывания GLM-4.5 в условиях жестких ограничений по памяти, обеспечивая прирост пропускной способности примерно в 1,07 раза даже при выгрузке 30 MoE-слоев на центральный процессор (`--n-cpu-moe 30`).

Интеграция поддержки MTP непосредственно в ядро среды исполнения позволяет опенсорсным движкам шаг за шагом лишать проприетарные облачные API их главного преимущества в скорости. В результате бизнес получает возможность запускать высокопроизводительные локальные MoE-модели с минимальными затратами на серверную инфраструктуру.

Опенсорс ИИЛокальный ИИБольшие языковые моделиПроизводительностьСнижение затрат