Движок инференса с открытым исходным кодом llama.cpp официально принял пулреквест #27342 от разработчика Цзянь Чэня, добавив нативную поддержку спекулятивного декодирования через алгоритм DFlash2. Архитектура решения объединяет групповые динамические поглубинные свертки (depthwise convolutions) с селектором кандидатов на основе ранжирования ребер. Механизм активируется автоматически при загрузке совместимого GGUF-чекпоинта, избавляя инженеров от ручной настройки нестабильных флагов во время запуска.
Результаты бенчмарков llama-benchy 0.4.0 на модели Qwen3.8-27B (UD-Q4_K_XL) показывают, что DFlash2 практически удваивает пропускную способность генерации на длинных контекстных окнах без потери качества ответов. При базовой глубине контекста DFlash2 показал скорость 26,39 токена в секунду против 11,81 токена при стандартном декодировании. Что особенно важно для RAG и анализа больших документов: на глубине в 32 000 токенов при ширине драфта 4 алгоритм удерживал скорость на уровне 21,11 токена в секунду, тогда как базовый инференс просел до 10,54, а первая версия DFlash v1 рухнула до 10,75 токена. Тесты на чипе Apple M5 Pro с моделью Qwen3.8-27B (квантование Q4_K_M) в задачах GSM8K подтвердили стабильность работы с использованием драфтер-весов от inco под лицензией Apache-2.0.
Для компаний с собственной LLM-инфраструктурой это мгновенно меняет юнит-экономику моделей на 27 млрд параметров. Бизнес фактически удваивает скорость обработки длинного контекста на существующих рабочих станциях и периферийных устройствах без перестройки пайплайнов оркестрации. Однако при экстремально больших объемах контекста увеличение ширины драфта дает убывающую отдачу, поэтому ML-командам потребуется профилировать параметры под целевую длину промптов, а не полагаться на стандартные настройки в проде.