Экосистема открытого ПО эффективно сокращает разрыв в производительности с проприетарными гигантами. Это происходит скорее благодаря архитектурной изобретательности, чем простому наращиванию вычислительных мощностей. Недавняя интеграция поддержки многотокенового прогнозирования (Multi-Token Prediction, MTP) для модели Qwen3-Next в репозиторий llama.cpp (PR #25589) — яркий тому пример. Предсказывая несколько токенов за один проход, модель преодолевает барьер последовательных вычислений, который долгое время замедлял локальное развертывание тяжелых нейросетей. Технически это не просто поверхностное исправление: обновление включает сложную перестройку графа вычислений и передачу опциональных тензоров масштабирования (.scale) в механизмы внимания и матричного умножения Mixture of Experts (MoE). Подобный подход отражает зрелость архитектурных решений, сравнимую с qwen35moe.
Главное
Оптимизация архитектуры позволяет локальным тяжеловесам конкурировать с облачными решениями по скорости отклика, сохраняя при этом полный контроль над данными.
Скорость генерации Qwen3-Next-80B на чипе M5 Max достигает 90.6 токенов в секунду в задачах вопрос-ответ. При выполнении перевода показатель возрастает до 92.4 токенов в секунду. Использование специализированных параметров черновика (draft parameters) разгоняет математические задачи до 142.7 токенов в секунду при коэффициенте принятия 0.973. Квантование Q4_K_M позволяет эффективно работать с моделью объемом 80 млрд параметров на профессиональных рабочих станциях.
Стратегический контекст
Бенчмарки на чипе M5 Max выглядят поразительно для тех, кто привык к медлительности моделей уровня 80B на периферийном оборудовании. Эти цифры фактически сводят на нет аргумент о том, что профессиональным моделям необходима облачная пуповина для обеспечения приемлемой отзывчивости. С точки зрения бизнеса такая оптимизация меняет расчет совокупной стоимости владения (TCO) для автономных агентов. Мы оставляем позади эпоху, когда локальное развертывание было компромиссом, где скоростью жертвовали ради конфиденциальности.
Итог
Возможность запускать сложные MoE-модели на скоростях, превышающих темп чтения человека, лишает смысла экономическое обоснование дорогих и небезопасных с точки зрения утечки данных API. Данное обновление не просто улучшает репозиторий — оно подтверждает жизнеспособность стратегии local-first для предприятий, которым нужен высокопроизводительный ИИ без огромных затрат на серверную инфраструктуру.