Иерархия автономных систем искусственного интеллекта только что была перевернута, и сейсмические волны идут с Востока. После публикации обновленного индекса интеллекта Intelligence Index v4.1.1 от агентства Artificial Analysis, модель Qwen 2.5 Max (в технических бенчмарках фигурирующая как Qwen 3.8 Max) фактически захватила корону лидера. Это не просто очередной незначительный прирост производительности; китайская модель теперь возглавляет рейтинг Agentic Index, демонстрируя пугающе эффективное владение навыками автономного планирования и исполнения. Это заставляет прежних фаворитов в лице o1-preview от OpenAI и Claude 3.5 Sonnet от Anthropic перейти в глухую оборону.

Главное

Qwen 2.5 Max заняла первое место в Agentic Index, опередив флагманские модели из США. Оценка проводилась по девяти критически важным бенчмаркам, включая Terminal-Bench v2.1 и SciCode. В тесте 𝜏³-Banking v1.0.1 модель показала исключительную точность в многошаговых финансовых операциях без риска галлюцинаций. Экономическая эффективность китайских моделей достигла паритета с американскими проприетарными системами при более высокой логической мощности.

Технический аудит, стоящий за этой сменой лидера, был изнурительным. Специалисты Artificial Analysis оценивали результаты в сложнейших условиях. Особо стоит отметить успех модели в обновленном тесте 𝜏³-Banking v1.0.1 — проверке способности ИИ ориентироваться в многоступенчатых финансовых рабочих процессах, не загоняя себя в угол ложными выводами. Поскольку методология расчета стоимости одной задачи была уточнена 30 июля, данные раскрывают новую реальность: китайские разработки больше не являются просто дешевыми альтернативами. Это элитные логические движки, способные превзойти закрытые системы из США в сложном многоуровневом рассуждении.

Мы наблюдаем поворотный момент, когда открытые или частично открытые системы от Alibaba Cloud не просто конкурируют по цене — они задают золотой стандарт того, как автономные агенты должны мыслить и действовать в корпоративной среде.

Стратегический контекст

Для технических директоров и основателей стартапов, создающих агентские фреймворки, юнит-экономика становится фактором, который невозможно игнорировать. Qwen 2.5 Max уверенно закрепилась на границе Парето в соотношении «интеллект — стоимость», предлагая редкое сочетание продвинутого исполнения задач, глубокой логики и конкурентоспособной цены. Хотя индекс теперь использует GPT-5.6 Luna в качестве высокоуровневого арбитра для оценки AA-Omniscience, планка элитной логики явно сместилась.

Итог

Доминирование западных лабораторий в области автономных агентов официально поставлено под сомнение. Успех Qwen 2.5 Max доказывает, что архитектурное превосходство в планировании и исполнении кода теперь доступно за пределами экосистем OpenAI и Anthropic, что открывает новые возможности для оптимизации затрат в масштабных корпоративных внедрениях ИИ.

ИИ-агентыБольшие языковые моделиИИ в бизнесеСнижение затратAlibaba Cloud