Команда Qwen из Alibaba представила Qwen3.8-Flash-Next — мультимодальную модель на базе смеси экспертов (Mixture-of-Experts, MoE), которая служит прямым превью будущей архитектуры Qwen4. При общем объеме в 125 млрд параметров модель настолько эффективно распределяет вычисления, что на каждый токен активирует всего 6 млрд параметров. В продакшене на QwenCloud модель запущена под названием Qwen3.8-Flash с тарифами $0,16 за миллион входных и $0,47 за миллион выходных токенов — это уровень передовых флагманов при затратах на обучение примерно в девять раз меньше, чем у Qwen3.7-Plus.
Главный инженерный прорыв заключается в перераспределении памяти: отдельный слой N-gram эмбеддингов размером 51 млрд параметров вынесен из дорогой видеопамяти GPU (VRAM) с высокой пропускной способностью и полностью размещен в стандартной оперативной памяти системы (RAM). Этот слой работает как словарь фраз для часто встречающихся цепочек токенов. Перенос параметров в обычную RAM без критической потери в скорости генерации позволил сохранить нативный контекст в 262 144 токена (с возможностью расширения до 1 млн токенов через метод YaRN). Открытые веса модели уже опубликованы на Hugging Face и ModelScope.
По опубликованным бенчмаркам Alibaba, Flash-Next превосходит корпоративные базовые модели конкурентов в задачах агентного программирования и работы со знаниями: модель набрала 58,7 балла на DeepSWE, 62,5 на SWE-bench Pro и 91,7 на GPQA Diamond.
Предложив цену в 12 раз ниже своего флагмана Qwen3.8-Max при сопоставимом качестве в кодинге и офисной автоматизации, Alibaba делает ставку на аппаратную экономику. Перенос массивных эмбеддингов в стандартную RAM ставит под сомнение необходимость сверхдорогих GPU-кластеров для инференса в продакшене и усиливает ценовое давление на весь рынок корпоративных API.