Разработчик pwilkin опубликовал пулреквест #26185 в официальном репозитории ggml-org/llama.cpp, добавив реализацию архитектуры текстовой модели Kimi-K3. Изменение интегрирует гибридный механизм внимания, объединяющий линейное внимание (KDA) и полное внимание (MLA). Это решение адаптирует ключевые наработки модели Kimi-Linear-48B для кардинального снижения расхода видеопамяти при обработке сверхдлинных контекстов на пользовательском и локальном корпоративном оборудовании.
Согласно техническому описанию, патч включает пять низкоуровневых архитектурных оптимизаций по сравнению с предыдущими версиями: межслойное остаточное внимание (cross-layer residual attention), скрытую смесь экспертов (latent MoE), где маршрутизируемые эксперты функционируют в выделенном латентном пространстве, функцию активации situ взамен привычной SwiGLU, сигмоидный вентиль на выходе MLA перед проекцией и полноранговый вентиль KDA. Кроме того, реализация задействует фреймворк HC_PRE из DeepSeek4 для вычисления взвешенных сумм межслойных связей и добавляет поддержку переупаковки квантованных весов формата MXFP4.
Для корпоративных инфраструктурных команд это обновление открывает важные практические возможности. Перенос обработки сверхдлинного контекста на гибридный конвейер линейного внимания внутри llama.cpp позволяет локально развертывать передовые архитектуры без обращения к внешним облачным API. Это гарантирует полную безопасность конфиденциальных корпоративных данных внутри собственного периметра без необходимости строить многоузловые серверные кластеры.