Institute of Foundation Models (IFM), исследовательское подразделение MBZUAI, выкатил линейку из шести открытых моделей K2 Horizon с разбросом параметров от 0.9B до внушительных 375B. Однако реальный инженерный интерес вызывает не гигантомания, а флагманская средняя модель — K2-Horizon-MoVA-36B-A4B. Из полных 36 млрд параметров на каждый сгенерированный токен здесь активируется всего 4 млрд.
Двойная разреженность
Классические архитектуры Mixture-of-Experts (MoE) традиционно разрежают лишь блок полносвязных сетей (FFN), оставляя механизм внимания плотным. В итоге квадратичный расчет attention продолжает съедать такты при росте контекста. В K2-Horizon-MoVA-36B-A4B разработчики внедрили второй слой разреженности напрямую в механизм внимания, представив концепцию Mixture-of-Value Attention (MoVA).
Логика разделения здесь сугубо прагматична. Проекции query и key по-прежнему рассчитываются плотно: это необходимо, чтобы не ломать скалярное произведение и корректный поиск семантических связей. А вот для проекций value выделен пул независимых экспертов, к которым per-token router обращается по принципу top-k.
В K2-Horizon-MoVA-36B-A4B одновременно работают 100 экспертов в FFN со схемой top-8+1 и 64 value-эксперта в attention со схемой top-4, суммарно активируя 4 млрд параметров на токен.
Внимание MoVA управляется сигмоидным роутером с post-gate через softplus вместо дефолтного softmax-top-k. При этом разреженность в пространстве value нативно ложится на FlashAttention и групповое внимание GQA, не ломая граф вычислений и не требуя костылей в рантайме.
Инфраструктурные ограничения
Позволит ли архитектура MoVA урезать закупки видеокарт для серверной стойки? Чудес не бывает: требования к VRAM не снижаются ни на гигабайт. Физический объем памяти по-прежнему диктуется суммарным весом модели, поэтому все 36 млрд параметров придется целиком загружать в память GPU.
Чистый выигрыш заключается в вычислительной плотности: резкое сокращение FLOPs на токен дает кратный прирост скорости генерации, снижая TCO корпоративного инференса именно при обработке длинных контекстов. Примечательно, что IFM не стал публиковать полноценный рецензируемый препринт, ограничившись релизом весов и кратким постом в блоге.
Архитектура MoVA наглядно показывает, как оптимизировать latency без потери емкости модели, перенося разреженность в блоки внимания. Но для бизнеса вывод сугубо утилитарный: экономия на вычислениях оставляет в силе требование к объему VRAM, а стабильность двойного роутинга на масштабах свыше 36B параметров сообществу еще только предстоит проверить на практике.