Рынок ИИ-инфраструктуры подошел к критической архитектурной развилке: развертывание высоконагруженного промышленного инференса на универсальных GPU превратилось в дорогое и энергоемкое узкое место. По мере масштабирования передовых моделей операционные издержки на оплату избыточных матричных вычислений Nvidia — в сценариях, где требуется лишь быстрая авторегрессионная генерация — всё сильнее бьют по корпоративным балансам. Стартап Etched, разрабатывающий специализированные ИИ-чипы, монетизирует этот архитектурный дисбаланс, привлекая $700 млн свежих инвестиций при оценке в $21 млрд.
Динамика капитализации подчеркивает стремление индустрии избавиться от «налога на GPU». В декабре 2025 года оценка Etched составляла $5 млрд, в июле компания закрыла раунд Series C на $300 млн при оценке $10,3 млрд, а теперь удвоила ее до $21 млрд всего за месяц — четырехкратный рост менее чем за год. В расширенный список инвесторов вошли Kleiner Perkins, Sequoia Capital, Andreessen Horowitz, Питер Тиль, Tiger Global, Bain Capital Ventures, Neo, Stripes, Primary, Positive Sum, Diffusion, Argo и Blackstone.
Проверка квантами и разделение заказных чипов
Принципиально важно, что речь идет не просто о венчурном ажиотаже вокруг кремниевых прототипов. Лид-инвестором раунда на $700 млн выступил гигант количественного трейдинга Jane Street, подписавший соглашение только после стресс-тестирования чипов в реальных производственных условиях и развертывания физических серверных стоек непосредственно в собственных дата-центрах. В то время как Nvidia продвигает универсальные «ИИ-фабрики», Etched поставляет специализированные инференс-кластеры, спроектированные исключительно под механику исполнения трансформеров.
Чтобы максимизировать пропускную способность токенов, Etched разделила аппаратное исполнение на два физических домена. Как объяснил сооснователь и операционный директор Etched Роберт Вахен в комментарии для TechCrunch, процесс вычислений фундаментально состоит из двух фаз:
«Инференс делится на два этапа: предварительное заполнение (prefill) и декодирование (decode).»
Во время фазы prefill, ограниченной вычислительной мощностью при обработке контекста запроса, Etched задействует специализированный чип при низком напряжении, что позволяет разместить более высокую плотность транзисторов без термического троттлинга. На этапе декодирования, ограниченном пропускной способностью памяти при генерации выходных токенов, стартап использует масштабируемую память кластера, объединенную через кастомный интерконнект. Это позволяет нескольким ASIC делить единый пул памяти с низкой задержкой, максимизируя пропускную способность и резко снижая стоимость инференса в пересчете на токен.
Универсальность архитектуры для передовых моделей
Коммерческий успех Etched зависит от решения главной проблемы специализированных ASIC — аппаратного устаревания. Если изначально компания исследовала возможность жесткого зашивания весов конкретных моделей прямо в кремний, то серийная архитектура стала универсальной для любых передовых трансформерных моделей. В заявлении касательно инвестиций Jane Street подтвердила производственную эффективность: «Мы протестировали чип и довольны первыми результатами. Уникальный подход Etched к инференсу обеспечивает необходимую точность для наших самых требовательных нагрузок. Мы рады, что теперь в нашем дата-центре работает собственная стойка».
Экзистенциальным риском остается жесткость кремниевой архитектуры: если передовые модели отойдут от механизма трансформерного внимания в пользу принципиально иных парадигм, узкоспециализированные аппаратные конвейеры столкнутся с быстрым списанием амортизационных затрат. Для технических руководителей вывод очевиден: стоит пересмотреть производственные контракты на вычисления, чтобы оценить, обеспечит ли разделение нагрузок prefill и decode на специализированных чипах лучшую юнит-экономику по сравнению со стандартными однородными GPU-кластерами.