Команда inclusionAI открыла исходный код семейства базовых моделей Ling-3.0. Вместо привычной выгрузки лишь закрытых финальных весов разработчики опубликовали ключевые промежуточные чекпоинты всего пайплайна обучения. Релиз включает две линейки — Ling-3.0-flash и Ling-3.0-tiny — и предоставляет предобученные (на 30 трлн токенов), промежуточные чекпоинты, а также веса этапа Warmup-Stable and Merge (WSM) на платформах Hugging Face, ModelScope и OpenRouter. Это дает инженерам прозрачную основу для кастомного дообучения и непрерывного дообучения моделей.

Флагманская модель Ling-3.0-flash-base использует разреженную архитектуру смеси экспертов (Mixture-of-Experts, MoE) с коэффициентом 1/64: при общем объеме в 124 млрд параметров на каждый токен активируется лишь 5,1 млрд (без учета эмбеддингов). Сочетание 512 маршрутизируемых экспертов (активируются 8 на токен плюс один общий эксперт) и нативного гибридного механизма линейного внимания — связки слоев KDA и Gated MLA в соотношении 5:1 — обеспечивает инференс с длинным контекстом на доступном серверном оборудовании без критической нагрузки на видеопамять. Отказ от стандартного затухания скорости обучения в пользу слияния чекпоинтов WSM дополнительно позволяет командам тестировать отраслевые профили затухания без лишних затрат вычислительных мощностей на повторные запуски.

С точки зрения системной архитектуры публикация детальных промежуточных весов после 30 трлн токенов меняет юнит-экономику корпоративного ИИ. Высокопроизводительные компактные и разреженные модели все чаще делают дорогостоящие проприетарные API избыточными для специализированных агентных сценариев. Поскольку Flash и Tiny обучались по единому рецепту, R&D-команды могут с минимальными затратами валидировать доменную адаптацию и пайплайны дистилляции на версии Ling-3.0-tiny перед переносом на Flash, что ускоряет переход к экономичной локальной инфраструктуре.

Опенсорс ИИБольшие языковые моделиДообучение моделейСнижение затратHugging Face