Китайский технологический гигант Meituan продолжает наступление на совокупную стоимость владения (TCO) тяжелыми языковыми моделями. Релиз LongCat-Flash-Lite-Sparse — это не просто очередная итерация архитектуры Mixture-of-Experts (MoE), а заявка на новый индустриальный стандарт эффективности. При внушительном общем объеме в 69 млрд параметров система активирует всего 3 млрд на каждый токен. Для бизнеса это означает возможность использовать мощь гигантской модели, оплачивая вычислительные счета уровня компактных решений класса Llama.

Главное

Общий объем параметров составляет 69 млрд, но активными остаются лишь 3 млрд. Внедрена инновационная архитектура LongCat Sparse Attention (LSA) для работы с длинным контекстом. Модель полностью совместима с популярными инструментами деплоя: vLLM, SGLang и Transformers. Резкое снижение затрат на облачный инференс при сохранении высокого качества генерации.

Архитектурный фокус сместился с наращивания сырой мощности на изящное управление ресурсами. Вместо стандартного механизма Multi-Head Latent Attention разработчики внедрили LongCat Sparse Attention (LSA). Это прямое попадание в бутылочное горлышко систем с длинным контекстом — пропускную способность памяти и вычислительные накладные расходы. Именно такая архитектурная диета станет ключом к выживанию корпоративных AI-департаментов в условиях ограниченных бюджетов на облачные вычисления.

Будущее не за универсальными тяжеловесами, а за сложной архитектурной разреженностью, позволяющей сохранять общие знания при радикальном сокращении капитальных затрат.

Прагматизм Meituan подчеркивается полной готовностью к развертыванию здесь и сейчас. Модель из коробки поддерживает vLLM, SGLang и стандартную библиотеку Transformers, легко запускаясь через Docker. Это избавляет системных архитекторов от необходимости изобретать велосипед при интеграции решения в существующие рабочие процессы.

Итог

В сухом остатке мы имеем систему, которая не пытается имитировать человеческое мышление, а эффективно перерабатывает данные. LongCat-Flash-Lite-Sparse наглядно демонстрирует: Meituan создали инструмент, который делает обработку длинных контекстов экономически целесообразной, а не просто технически возможной.

Большие языковые моделиСнижение затратПроизводительностьMeituan