Гонка вооружений в сфере ИИ больше не сводится к накоплению кремния; теперь важно, чтобы этот кремний не простаивал. Пока индустрия борется за квоты на поставку NVIDIA Blackwell, команда Cursor доказала: даже самый дорогой графический процессор работает лишь настолько быстро, насколько позволяет код. С выпуском Mixture-of-Kittens (MoK) Cursor не просто создает среду разработки — они диктуют правила того, как на самом деле должна функционировать серверная стойка NVL72. Обходя стандартные библиотеки вендора в пользу специализированного мегаядра, построенного с нуля, они превратили архитектуры Blackwell SM100 и SM103 в нечто гораздо более эффективное, чем коробочное решение.
Архитектура мегаядра
Техническая эффективность в архитектуре Mixture-of-Experts (MoE) обычно приносится в жертву трубопроводу — постоянному и энергозатратному перемещению данных между видеокартами и центральными процессорами. Mixture-of-Kittens устраняет эту проблему, объединяя все вычисления и коммуникации MoE в единое агрессивное ядро. В типичной конфигурации CPU и GPU зациклены на утомительном обмене данными, что создает микрозадержки, превращающиеся в масштабные утечки производительности. MoK полностью исключает синхронизацию между CPU и GPU. Благодаря детальному совмещению вычислительных задач с сетевым взаимодействием между GPU, система гарантирует: пока одна часть стойки NVL72 рассчитывает веса токенов, другая уже передает следующий пакет данных по сети. Итог? Чипам Blackwell больше не нужно ждать инструкций.
MoK объединяет все вычисления и коммуникации MoE в единое ядро, совмещая расчеты и межчиповое сетевое взаимодействие с настраиваемой степенью детализации, что полностью исключает простои из-за синхронизации CPU и GPU.
Для технических директоров и руководителей инфраструктуры эти достижения переводят выгоду из теоретической плоскости в трансформационную. Бенчмарки Cursor показывают, что MoK работает до 2,37 раза быстрее при прямых проходах MXFP8 и в 1,92 раза быстрее для BF16 по сравнению с самыми быстрыми существующими аналогами. Это не лабораторный эксперимент — данные ядра обеспечивают промышленное обучение Cursor Composer. Сочетая формат BF16 с высокой пропускной способностью MXFP8, MoK предлагает детерминированный путь, который стабилизирует модели корпоративного уровня без потери чистой скорости кластера.
Экономические реалии оптимизированного обучения
Финансовая логика здесь беспощадна: когда одна стойка NVL72 стоит миллионы долларов, каждая секунда обучения становится отдельной строкой в балансовом отчете. Сокращение времени обучения фактически удваивает окупаемость инвестиций (ROI) в оборудование, которое большинству компаний до сих пор сложно достать. MoK требует современного стека — Python 3.12, PyTorch 2.10 и CUDA 13.0 — и нацелен на архитектуры SM103 и SM100. Оптимизируя как прямые, так и обратные проходы в рамках одной комбинированной структуры, Cursor позволяет предприятиям одновременно сокращать счета за облачные вычисления и потребление энергии, доказывая, что совокупная стоимость владения (TCO) — это в такой же степени проблема софта, как и железа.
По сравнению с быстрейшим базовым решением, MoK ускоряет прямой проход MXFP8 до 2,37 раза, а обратный проход BF16 — в 1,58 раза.
Этот сдвиг указывает на то, что основное конкурентное преимущество в ИИ сместилось от простого количества GPU к мастерству управления памятью и коммуникационными буферами. Функциональный уровень Cursor управляет созданием рабочих пространств и планированием, делая оптимизации первого эшелона доступными для фирм, у которых нет в штате целой армии специалистов по CUDA. Демократизация высокопроизводительных ядер через открытые репозитории означает, что циклы исследований и разработок больше не привязаны к графику релизов вендора. Если вы не можете оптимизировать свои ядра, вы переплачиваете за вычисления.
Экспертиза в разработке ПО теперь стала определяющим узким местом для производительности ИИ, независимо от того, сколько терафлопс NVIDIA обещает со сцены. Релиз Mixture-of-Kittens наглядно показывает, что гибкая инженерная команда может обойти универсальные библиотеки производителя, проектируя решения специально под физические реалии NVL72. По мере того как Blackwell становится корпоративным стандартом, победителями выйдут не те, у кого самые крупные заказы на поставку, а те, кто напишет самый умный код для их запуска.