Стоимость достижения фиксированных показателей производительности на стандартизированных бенчмарках искусственного интеллекта стремительно снижается с 2023 года. Исследовательские группы, отслеживающие цены на передовые модели, фиксируют неуклонное падение затрат, хотя истинный масштаб во многом зависит от того, удается ли аналитикам отфильтровать рыночный шум от фундаментальных инженерных достижений.
Рыночные спады против чистой эффективности
Исследовательская организация Epoch AI, отслеживающая тренды по пяти бенчмаркам в области математики, естественных наук и логических задач, подсчитала, что затраты на инференс снижаются примерно на 47 процентов за квартал — это потрясающие 13-кратное удешевление в годовом исчислении. Хотя эти цифры представляют собой приблизительные оценки на основе доступных рыночных данных, ни одна предыдущая промышленная технология никогда не масштабировала снижение затрат с такой скоростью.
Epoch AI считает, что затраты на инференс снижаются в среднем примерно на 47 процентов за квартал, или примерно в 13 раз в год.
Тем не менее, этот показатель отражает агрессивную рыночную ценовую политику и субсидирование оборудования, а не чистые алгоритмические прорывы. Когда независимые исследователи, в том числе Ханс Гундлах и его коллеги, оценивают данные о ценах с платформы сравнения Artificial Analysis за период с апреля 2024 по ноябрь 2025 года, общее снижение затрат оказывается ближе к 5–10 разам в год.
Изоляция алгоритмических достижений
Разница между этими метриками сводится к внешним переменным. Показатель Epoch в 13 раз выше, поскольку он не учитывает совокупное влияние более дешевого кремния и жестких ценовых войн между поставщиками инфраструктуры. Как только аналитики делают поправку на эффективность оборудования и рыночную конкуренцию, базовый прирост алгоритмической эффективности стабилизируется примерно на уровне 3 раз в год.
В то же время прогресс в бенчмарках затушевывает критическую стратегическую развилку для технических руководителей. Если запуск старых моделей дешевеет с каждым месяцем, то передовые архитектуры расходуют значительно больше вычислительных ресурсов на один запрос. Например, модель o3 от OpenAI показала результат 75 процентов в научном тесте уровня PhD — GPQA Diamond — при ориентировочной стоимости в 30 центов за запрос. Достижение исторических показателей производительности со временем обходится дешевле, но развертывание топовых моделей рассуждения поднимает бюджеты на вычисления до небес.
Заголовки о дефляции маскируют реальные механизмы: рыночная конкуренция и масштабирование оборудования обуславливают большую часть краткосрочного падения цен, в то время как истинная алгоритмическая эффективность неуклонно растет со скоростью примерно 3 раз в год, заставляя техдиректоров балансировать между дешевыми массовыми запросами и дорогими высокоуровневыми цепочками рассуждений.