Централизованная облачная инфраструктура по-прежнему поглощает почти все корпоративные запросы к LLM, однако законы физики дата-центров постепенно остужают хайп. По мере того как объем инференса приближается к триллионам запросов в сутки, лимиты по энергопотреблению и тепловыделению делают чисто облачное масштабирование нежизнеспособным. История вычислительной техники наглядно показывает, что происходит дальше: задачи неизбежно мигрируют с центральных мейнфреймов на периферийные устройства, как только это позволяет энергоэффективность. Исследователи из Стэнфордского университета и Together AI утверждают, что в сфере искусственного интеллекта мы подходим именно к этой точке перегиба.
Метрика интеллект на ватт
Чтобы очистить маркетинговые заявления от шелухи и свести их к точной физике, исследовательская группа Стэнфорда и Together AI под руководством Джона Саад-Фалькона, Аваники Нараян, Кристофера Ре и Джона Хеннесси вместе с Шаном Чжу и Беном Ативараткуном представила метрику Intelligence per Watt (IPW, интеллект на ватт). Она количественно оценивает реальную энергоэффективность вычислений, сопоставляя точность выполнения задач с прямым энергопотреблением конкретных связок моделей и аппаратных ускорителей.
Исследователи протестировали более 20 открытых моделей размером до 20 млрд активных параметров на 8 типах чипов — от потребительских процессоров до серверных GPU. Бенчмарк на выборке из 1 миллиона реальных одношаговых диалоговых и логических запросов фиксировал процент побед и ничьих в сравнении с флагманскими моделями, а также точную аппаратную телеметрию: задержку, активное энергопотребление и суммарные затраты энергии на токен.
Эмпирический выигрыш и резервы оптимизации
Полученные данные бросают вызов парадигме исключительного использования облаков: современные модели размером до 20B закрывают 88,7% стандартных одношаговых запросов с приемлемым качеством. С 2023 по 2025 год общий показатель интеллекта на ватт вырос в 5,3 раза благодаря сочетанию более компактных архитектур и оптимизации специализированных чипов.
Возможности локальных языковых моделей стремительно растут: доля запросов, эффективно обслуживаемых локально, увеличилась с 23,2% в 2023 году до 71,3% в 2025 году.
Такой скачок эффективности позволяет потребительским чипам вроде Apple M4 Max справляться с типовыми корпоративными задачами с интерактивным временем отклика. При этом авторы работы далеки от необоснованных иллюзий по поводу периферийных вычислений: локальные чипы пока уступают облачным серверным GPU по метрике IPW минимум в 1,4 раза на одних и тех же чекпоинтах, что указывает на необходимость доработки пропускной способности памяти и алгоритмов квантования.
Экономическая целесообразность гибридных архитектур инференса теперь подтверждена математически: перенос рутинных запросов на локальное оборудование радикально снижает совокупную стоимость владения (TCO) облачной инфраструктуры без критической потери качества. Впрочем, техническим лидерам стоит подходить к этим выводам со здоровым скепсисом: бенчмарк опирается на одношаговые сценарии, тогда как насыщение пропускной способности памяти в многошаговых агентских пайплайнах и деградация точности при квантовании в продакшене все еще остаются нерешенными инженерными вызовами.