Разница между обещаниями и реальностью в AI-индустрии обычно измеряется месяцами разочарований, но Alibaba решила пойти против канона. Выход финальной версии Qwen2.5-Max (в брифе указана как 3.8 Max) — тот редкий случай, когда цифры в отчетах превращаются в приговор для маржинальности американских лабораторий. Пока OpenAI и Anthropic аккуратно упаковывают свои премиальные токены в маркетинговый сторителлинг, китайский гигант выкатил модель на 2,4 трлн параметров по цене, напоминающей ликвидацию склада. На фоне $6 за миллион выходных токенов ценники западных флагманов выглядят либо как налог на бренд, либо как расписка в собственной неэффективности.
Индекс агента против индекса цитирования
Intelligence Index от Artificial Analysis поставил Qwen2.5-Max на отметку 58,1 балла — это на четыре пункта ниже, чем у Claude 3.5 Sonnet (или ожидаемых версий Fable). Казалось бы, паритет не достигнут, можно расходиться. Но дьявол сидит в прикладных задачах. В Agentic Index, где модель обязана не рассуждать о смысле бытия, а работать с терминалом, править файлы и вызывать функции, Qwen выбила 58,4 балла, оставив западных конкурентов позади. Для бизнеса это сигнал: если вам нужен чат-бот для светских бесед — платите американцам. Если строите систему, которая должна десять дней кряду разгребать репозитории и доводить задачу до результата — китайский эксперт объективно эффективнее.
Qwen лучше прошла узкую агентную часть. Для системы, которая использует инструменты и выполняет длинные цепочки действий, эта цифра весомее абстрактных бенчмарков.
К слову о марафонах: Alibaba заявляет о поддержке агентных сессий длительностью более десяти дней. Пока независимые тесты проверяют этот заплыв, возможность скормить модели миллион токенов контекста — эквивалент десяти романов или пары инженерных баз — снимает извечную боль с нарезкой документов. Мы привыкли, что большой контекст — это дорого и медленно, но здесь чтение закэшированных данных стоит $0,25 за миллион токенов. Это меняет саму логику работы: вместо того чтобы экономить на каждом запросе, вы просто выгружаете в модель всё, что у вас есть.
Экономика демпинга и налог на многословие
Сравнение $6 за миллион токенов у Qwen против $15–50 у западных SOTA-моделей заставляет искать подвох. Он есть, и он математический. По данным Artificial Analysis, флагман Alibaba примерно в 2,3 раза многословнее медианы рынка. Там, где конкурент ответит коротко, Qwen с удовольствием потратит ваши деньги на подробные внутренние монологи. Однако даже с учетом этого коэффициента болтливости итоговый чек остается кратно ниже. Условный процесс, который на Claude обойдется в $350, на Qwen затянет на $50. Это не просто скидка, это демонтаж барьера для внедрения промышленного AI.
Новая флагманская модель получила уценку в 20 процентов еще до того, как успела состариться. В индустрии ИИ календарь работает быстрее отделов продаж.
Qwen2.5-Max уже доступна в QwenCloud, а на горизонте — открытые веса. Это создает жесткую вилку для менеджмента. С одной стороны — привычный, но неоправданно дорогой стек. С другой — инструмент, который стоит в семь раз дешевле, выдает 82 токена в секунду и не требует инженерной эквилибристики для обработки лонгридов. Риски санкционного давления и зависимости от китайского API никуда не делись, но при такой пропасти в операционных расходах игнорировать Qwen становится экономически опасно. Посчитайте стоимость вашего типичного агентного прогона: если разница существенна, пора выделить инженера для тестов QwenCloud API на ваших данных, пока бюджет не съели премиальные токены из Долины.