Команда Qwen выпускает Qwen3.8-Flash-Next — открытую мультимодальную модель на базе архитектуры Mixture-of-Experts (MoE), размещенную на платформе Alibaba ModelScope. Релиз задуман как прямой архитектурный мост к будущему поколению Qwen4 и включает официальный чекпоинт Qwen/Qwen3.8-Flash-Next-FP8, запланированный к выходу на 26 августа 2026 года в 15:00 UTC.
Вместо рядовой выкатки весов Alibaba делает целенаправленный упор на устранение главного экономического барьера автономных систем — задержки инференса и вычислительных затрат на каждый токен. В высоконагруженных агентных сценариях, где автономные циклы выполняют тысячи рекурсивных вызовов внешних инструментов и мультимодальных запросов, работа стандартных dense-моделей мгновенно истощает бюджеты на инфраструктуру. Qwen3.8-Flash-Next использует разреженную (sparse) архитектуру MoE, что позволяет радикально снизить задержку отклика и вычислительные накладные расходы без ущерба для ключевых мультимодальных возможностей.
С точки зрения стратегии Alibaba продолжает опережать проприетарных конкурентов, предоставляя разработчикам легковесные веса следующего поколения задолго до дебюта флагманской Qwen4. Открывая инженерам ранний доступ к оптимизированным чекпоинтам FP8 на ModelScope, компания привязывает к себе сообщество и укрепляет собственную открытую экосистему MoE в статусе стандарта по умолчанию для промышленных ИИ-пайплайнов.