Идея локального корпоративного ИИ-ассистента с завидной регулярностью разбивается о суровую реальность службы безопасности. Как только техническая команда заикается о выгрузке закрытого репозитория во внешний API, юристы и служба безопасности сворачивают инициативу за пятнадцать минут: критический код платежного контура наружу не пойдет ни при каких обстоятельствах. Долгое время выбор казался бинарным — либо подписывать тяжелый контракт с облачным провайдером, либо закупать собственный кластер из восьми карт Nvidia H100 по заоблачной цене.

В конце июля появился замер, наглядно показавший, как именно устроена альтернатива. Модель масштаба 2,8 триллиона параметров удалось запустить на одном MacBook с чипом M1 Max и 64 ГБ памяти. Правда, рабочая скорость генерации составила примерно один токен в минуту.

Архитектура смеси экспертов и оффлоадинг на диск

Этот запуск стал возможен благодаря архитектуре MoE (Mixture-of-Experts, смесь экспертов), где вместо монолитной нейросети задействовано множество специализированных блоков. Компания Moonshot выложила веса модели Kimi K3: из 2,8 триллиона суммарных параметров на каждый токен активируются лишь 16 экспертов из 896 на каждом слое. В непосредственных вычислениях участвует порядка 104 миллиардов параметров, а основная масса экспертов изначально хранится в четырехбитном формате с плавающей точкой MXFP4, причем репозиторий на Hugging Face занимает около 1,56 ТБ.

Архитектура смеси экспертов снижает вычислительную сложность генерации отдельного токена, но оставляет неизменным общий объем весов модели, превращая инженерную задачу в организацию многоуровневой иерархии памяти.

Как отметил Сергей Прощаев, руководитель направления Java | Kotlin разработки в FinTech & E-commerce и преподаватель курсов разработки и архитектуры в ОТУС, модель фактически делится на две части: постоянную спину (слои внимания, эмбеддинги, общие эксперты и латентные проекции объемом около 114 ГБ в bf16) и 82 432 маршрутизируемых эксперта весом около 1,45 ТБ, абсолютное большинство из которых на конкретном шаге лежит мертвым грузом. На Apple Silicon процессор и графика делят общую физическую память, поэтому вся разница сводится к тому, что успело осесть в оперативной памяти, а что приходится подтягивать с диска.

Сжатие до одного бита против интерактивности

Чтобы уместить гиганта в ограниченное железо, инженеры прибегли к динамическому квантованию. Команда Unsloth выпустила калиброванные динамические кванты K3, где большая часть весов ужимается до 1–2 бит, а чувствительные тензоры остаются в более высокой точности. Однобитная версия занимает около 594 ГБ против исходных 1,56 ТБ, удерживая около 78,9% от результата восьмибитного эталона на тестах команды, а двухбитные варианты требуют 711 и 861 ГБ.

Однако выдача одного токена в минуту полностью ставит крест на применении подобных конфигураций в качестве интерактивных ассистентов разработчика или чат-ботов реального времени. Ждать ответ на простой вопрос полчаса бессмысленно. Но инженерная ценность прецедента лежит в другой плоскости — это готовый фундамент для асинхронной верификации архитектур и глубокого ночного аудита закрытых контуров.

Запуск модели на 2,8 трлн параметров на потребительском ноутбуке доказывает жизнеспособность связки разреженных архитектур, агрессивного квантования и оффлоадинга весов на диск без закупки серверных кластеров. Сегодня такая схема пригодна исключительно для фоновых пакетных задач и проверки гипотез, но дальнейшая оптимизация алгоритмов доставки весов продолжит снижать порог входа в автономную локальную инфраструктуру.

Локальный ИИБольшие языковые моделиОпенсорс ИИБезопасность ИИKimi K3