Десятилетиями корпоративная инфраструктура двигалась по неизменной траектории — от централизованных мейнфреймов к распределенным вычислениям. Закон Куми зафиксировал этот структурный сдвиг: объем вычислений на ватт энергии удваивался примерно каждые 1,5 года, что в итоге позволило перенести задачи промышленного уровня на обычные ПК. Корпоративный ИИ подходит к аналогичной точке децентрализации: инференс постепенно уходит из дата-центров гиперскейлеров обратно за корпоративные файрволы.
Венчурный инвестор Томаш Тунгуз проанализировал бенчмарки исследователей из Стэнфордского университета и Together AI (Джона Саад-Фалькона, Аваники Нараян и их соавторов). Выяснилось, что локальные развертывания уже не уступают передовым облачным системам в 89% стандартных сценариев чата и рассуждений. Тестирование более миллиона реальных запросов на более чем 20 компактных моделях показало: общая эффективность локального инференса выросла в 5,3 раза всего за два года.
Эффективность архитектур и умная маршрутизация
Прогресс в кремнии объясняет лишь часть этого экономического сдвига. Как показали Энсон Хо, Эге Эрдил и Тамай Бесироглу в исследовании пределов масштабирования CMOS за 2023 год, вычислительная эффективность GPU за последние 15 лет удваивалась примерно каждые 2,7 года. Однако недавний скачок показателя интеллект на ватт в 5,3 раза сложился иначе: рост плотности чипов дал прирост лишь в 1,7 раза, тогда как оптимизация архитектур самих моделей обеспечила рывок в 3,1 раза.
С 2023 по 2025 год доля успешных ответов (победа или ничья) лучшей автономной локальной модели против передовых облачных API выросла с 23,2% до 71,3%, прибавляя около 20 процентных пунктов ежегодно. Добавление автоматического локального маршрутизатора поднимает планку еще выше: система динамически направляет каждый промпт наиболее эффективной специализированной модели.
«Точно так же, как производительность на ватт определила переход от мейнфреймов к ПК, показатель интеллекта на ватт определит миграцию ИИ на локальные устройства».
По наблюдениям исследователей из Стэнфорда и Together AI, умная маршрутизация между несколькими специализированными моделями поднимает результативность почти до 90%, фактически превращая обработку типовых корпоративных запросов в доступный базовый ресурс.
Инфраструктурный выбор
Централизованные дата-центры сохраняют решающее преимущество в сложных нестандартных рассуждениях, глубоком анализе данных и параллельной работе тяжелых цепочек агентов. По чистой утилизации оборудования облачные гиганты все еще на 40% энергоэффективнее за счет пакетной обработки огромного потока запросов.
Однако для рутинных корпоративных задач отправка данных во внешние API становится неоправданным операционным налогом. Локальный инференс убирает сетевые задержки, защищает корпоративную интеллектуальную собственность и радикально снижает совокупную стоимость владения (TCO). Архитектура из локальных моделей с маршрутизатором снижает энергопотребление на 80%, вычислительные накладные расходы на 77% и сокращает совокупные затраты на инфраструктуру на 74% по сравнению с полностью облачным стеком.