Оптимизированная сборка движка инференса NInfer позволила сжать мультимодальную модель Ornith-1.5-35B-A3B архитектуры Mixture-of-Experts (MoE) с исходных 143,84 ГБ до 21,22 ГиБ. Это обеспечивает стабильную скорость генерации свыше 250 токенов в секунду на одной потребительской видеокарте Nvidia GeForce RTX 5090 при контекстных окнах префилла от 5 000 до 8 000 токенов.

Одно лишь квантование редко дает высокую пропускную способность при спекулятивном декодировании (speculative decoding). Базовый релиз от ornith-ai поставлялся с необученной головой Multi-Token Prediction (MTP), которая под нагрузкой подтверждала лишь 21,8% черновых спекулятивных токенов. Инженеры заменили ее на дистиллированный 15-тензорный MTP-модуль от Shisa AI (обученный на Qwen3.6-35B-A3B). Это повысило долю принятых черновых токенов до 39,0% — прирост эффективности в 1,8 раза разогнал пиковую скорость однопоточного декодирования до 336,5 токенов в секунду.

Итоговый артефакт балансирует архитектуру MoE на 256 экспертов с помощью смешанного группового целочисленного квантования (4-бит, 5-бит, 6-бит и 8-бит), сохраняя критические проекции внимания и эмбеддинги в точности BF16. Для инженерных команд, оценивающих локальное развертывание, достижение скорости проприетарных облачных API на одной готовой потребительской видеокарте радикально снижает совокупную стоимость владения (TCO) для приватных и высоконагруженных мультимодальных агентных пайплайнов.

Локальный ИИNVIDIAБольшие языковые моделиПроизводительностьСнижение затрат