Для технологических лидеров корпоративного сектора, оценивающих экономику больших языковых моделей, стоимость инференса и доступность чипов годами диктовали архитектурные планы. Масштабное внедрение рассуждающих моделей передового уровня оставалось непомерно дорогим из-за полной зависимости от премиальной вычислительной инфраструктуры. Компания Z.ai изменила этот расклад, представив GLM-5.3-Flash — мультимодальную модель с открытыми весами, способную решать сложнейшие задачи при радикально более низких операционных расходах.
Передовая производительность при урезанном бюджете
GLM-5.3-Flash — первая нативно мультимодальная архитектура в серии GLM-5 от Z.ai, опубликованная под лицензией MIT с открытыми весами на Hugging Face. Модель насчитывает 320 миллиардов параметров, но активирует лишь 18 миллиардов при инференсе, поддерживая контекстное окно в один миллион токенов. По данным бенчмарков Artificial Analysis, модель набирает 57 баллов по индексу интеллекта при максимальных усилиях на рассуждение. Это всего на три балла меньше, чем у флагманской GLM-5.3 (60 баллов), и сопоставимо с ведущими проприетарными системами.
Главный прорыв кроется в юнит-экономике. В тестах Artificial Analysis стоимость решения задачи составила $0,09 для GLM-5.3-Flash против $0,68 для GLM-5.3, то есть модель оказалась примерно в 7,5 раз дешевле. В API Z.ai цены установлены на уровне $0,15 за миллион входных токенов и $0,50 за миллион выходных, что составляет едва ли десятую часть тарифов флагмана. Модель показала равные результаты с топовыми системами в агентских бенчмарках вроде GDPval-AA v2 (рейтинг Elo около 1770), однако паритет достигается за счет агрессивного выделения вычислительных ресурсов, а не внутренней эффективности.
Примерно 90 процентов сгенерированных токенов ушло на процесс рассуждения.
Эксперты Artificial Analysis отметили, что модель компенсирует низкую стоимость токенов их объемом: чтобы сравняться по качеству с лидерами рынка, ей требуется генерировать огромные массивы рассуждений.
Обход монополии CUDA на масштабе
Помимо ценовых характеристик, инфраструктура запуска GLM-5.3-Flash доказывает жизнеспособность альтернативных аппаратных стеков. До релиза Z.ai анонимно тестировала модель под псевдонимом «ox-alpha» на площадках OpenCode и OpenRouter, где та за несколько дней стала самым популярным решением. В Z.ai подтвердили, что вся нагрузка обрабатывалась исключительно на китайских AI-чипах без использования оборудования Nvidia.
По оценке аналитической компании SemiAnalysis, инфраструктура выдерживала пропускную способность в 100 триллионов токенов в день — объем, который ранее демонстрировали только ведущие западные лаборатории. Программная экосистема Nvidia CUDA удерживала монополию в сфере ИИ два десятилетия, вынуждая разработчиков при переходе на альтернативные чипы переписывать вычислительные операции, настраивать доступ к памяти и вручную устранять узкие места в железе. Чтобы преодолеть эти барьеры, Z.ai разработала собственный софт для инференса на базе SGLang. Разделение этапов вычислений позволило независимо масштабировать нагрузку и утроить пропускную способность на тех же мощностях.
В Z.ai заявляют, что их стек уравнивает эффективность альтернативного железа и удельную стоимость токена с показателями мейнстримных GPU от Nvidia. Для руководителей бизнеса это наглядный сигнал: эффективный инференс возможен и вне западной аппаратной монополии, если инженерная команда готова платить увеличенным объемом токенов рассуждения за колоссальную экономию на инфраструктуре.