Новый флагман от Alibaba, Qwen 3.8 Max, сумел набрать 56 баллов в индексе Artificial Analysis, сравнявшись по показателям с заслуженной Claude 3 Opus. Хотя на бумаге скачок на 10 пунктов по сравнению с версией 3.7 выглядит впечатляюще, этот технический прорыв отдает архитектурным отчаянием. Qwen обошла GLM-5.2, но все еще уступает модели Kimi K3 от Moonshot AI, которая удерживает лидерство с 57 баллами. Однако главная новость не в оценках, а в методе грубой силы, который Alibaba использовала для достижения результата.
Главное
Модель требует в 4,5 раза больше шагов вычислений на одну задачу (64 вместо 14 у конкурентов). Объем входных токенов вырос в 15 раз из-за постоянной пересылки всей истории диалога. Реальная стоимость владения (TCO) выросла вдвое, несмотря на формальное снижение цен на токены. Уровень галлюцинаций подскочил с 23% до 40%.
Чтобы обеспечить рейтинг 1739 Elo в рабочих задачах (GDPval-AA), Qwen 3.8 Max превратилась в вычислительного обжору. Теперь модели требуется 64 шага на задачу — почти в пять раз больше, чем 14 шагов у более элегантных конкурентов. Ситуацию усугубляет взрывной рост объема входных токенов: он увеличился в 15 раз, так как модель настаивает на повторной отправке всей истории переписки на каждом этапе. В мире ИИ это не интеллект, а дорогостоящая привычка к повторениям.
«Скидка от Alibaba» — это иллюзия. Несмотря на громкое снижение цен до $2.00 за миллион входных и $6.00 за миллион выходных токенов, стоимость выполнения реальной задачи выросла в два раза.
Стратегический контекст
Для технических директоров и руководителей ИИ-направлений выгода оказывается мнимой. Одна задача в индексе интеллекта теперь обходится в $1.14 на Qwen 3.8 Max против $0.53 у предыдущей итерации. Тем временем Kimi K3 обеспечивает более высокое качество за $0.86, что делает её эксплуатацию на 25% дешевле. Если бизнес платит больше за структурно менее эффективную модель, то низкая цена за токен — лишь маркетинговый маневр для отвлечения внимания.
Технический регресс бьет не только по кошельку, но и по надежности: частота галлюцинаций Qwen взлетела с 23% до 40%. Вместо того чтобы признать нехватку знаний, модель предпочитает гадать, будучи погребенной под весом собственного раздутого контекста.
Итог
Alibaba делает ставку на чистую мощь инфраструктуры в попытке доминировать на рынке. Однако для корпоративных заказчиков компромисс очевиден: приходится платить вдвое больше за модель, которая галлюцинирует почти в два раза чаще и работает значительно медленнее конкурентов.