Независимый разработчик bigattichouse представил QwenMix-3.7 — гибридную модель на 27,36 млрд параметров, созданную исключительно путем прямой интерполяции весов между Qwen3.6-27B и Qwen3.8-27B. Данный метод полностью исключает необходимость в обучающих датасетах, проходах обратного распространения ошибки и выделении мощностей GPU-кластеров: каждый параметр в чекпоинте объемом 55,6 ГБ представляет собой детерминированное математическое объединение родительских архитектур.

Согласно документации проекта на Hugging Face, слияние выполнялось с помощью алгоритма построчной линейной интерполяции $W = A + t \cdot (B - A)$ при коэффициенте $t=0,5$, дополненного построчным масштабированием величин для предотвращения сжатия нормы весов. Архитектурные компоненты более свежей версии — в частности, модуль компьютерного зрения, блок мультитокенного предсказания (multi-token prediction head), шаблон чата и семь дополнительных специальных токенов — были полностью перенесены из Qwen3.8-27B. Анализ тензорного дрейфа по всем 1199 слоям показал, что сильнее всего между итерациями изменились блоки MLP (среднее косинусное сходство 0,83), в то время как параметры SSM и слои нормализации (LayerNorm) практически не сдвинулись, сохранив показатели выше 0,998.

Независимая проверка подтвердила, что объединенные веса находятся точно в геометрической середине родительских моделей. Это позволяет развертывать гибрид из коробки в стандартных пайплайнах библиотеки Hugging Face transformers без применения кастомных патчей для ядер. Для технических руководителей, оптимизирующих бюджеты на локальную инфраструктуру, арифметическое слияние весов становится прагматичным инструментом: оно позволяет внедрять точечные улучшения моделей без затрат на полноценное дообучение.

Большие языковые моделиОпенсорс ИИСнижение затратHugging FaceQwen