Гонка за производительностью инференса вышла на новый этап: автономные агентные процессы требуют кардинального сокращения циклов генерации. Сложные мультиагентные системы выполняют сотни и тысячи последовательных шагов рассуждения, вызовов внешних инструментов и автоматических проверок в условиях жестких ограничений по задержке. На этом фоне Nvidia на конференции Hot Chips 2026 объявила о запуске в серийное производство ускорителя Groq 3 LPX в рамках платформы Vera Rubin, релиз которой запланирован на конец этого года.

Результаты бенчмарков и агентные нагрузки

В конце декабря Nvidia приобрела лицензию Groq примерно за 20 млрд долларов, пригласив основателя Groq Джонатана Росса и президента Санни Мадру для разработки специализированного железа исключительно под инференс. В агентных вычислениях пропускная способность напрямую определяет ценность всей системы. Высокая скорость позволяет автономным агентам мгновенно анализировать файлы, писать и запускать код, а также верифицировать результаты без пауз, что, по заявлению Nvidia, сокращает время решения задач программирования «с часов до считаных минут».

В тестах независимой лаборатории Artificial Analysis на открытой плотной модели Gemma 4 31B стойка с LPX показала скорость 3400 токенов в секунду на 50 последовательных запросах с контекстным окном в 100 000 токенов. Производительность оставалась стабильной на входных последовательностях от 10 000 до 100 000 токенов, установив абсолютный рекорд для данной модели. В Nvidia подчеркнули, что это четырехкратное превосходство над ускорителем Cerebras, показавшим 882 токена в секунду на аналогичной нагрузке.

Ограничения памяти и аппаратные масштабы

За этими впечатляющими цифрами бенчмарков скрывается принципиальное различие в аппаратной архитектуре. Groq опирается на потоковую архитектуру с упором на сверхбыструю память SRAM, ориентированную на минимальные задержки, а не на хранение больших объемов данных.

Каждый LPU оснащен всего 500 МБ памяти — это в 576 раз меньше, чем у графического процессора Rubin с его 288 ГБ.

Из-за столь жесткого лимита памяти модель приходится распределять между десятками или сотнями чипов, объединенных через Ethernet внутри стоек вместимостью до 256 устройств. В таких конфигурациях GPU берут на себя ресурсоемкую фазу предварительной обработки контекста (prefill), тогда как LPU отвечают за фазу генерации токенов (decode), требующую высокой пропускной способности. Как отмечает издание The Register, для достижения планки в 3400 токенов в секунду потребовался кластер минимум из 64 ускорителей Nvidia LPX, тогда как Cerebras справился с этой же задачей силами одного-двух чипов.

Масштабирование кластеров для крупных моделей

Архитектурная математика становится еще более суровой по мере роста параметров моделей. Gemma 4 31B представляет собой идеальный сценарий, поскольку веса плотной модели целиком умещаются в пределах одной физической стойки. При переходе к масштабным архитектурам требования к инфраструктуре растут лавинообразно: для запуска DeepSeek V3 на такой конфигурации потребуется уже 1342 ускорителя, то есть более пяти полных серверных стоек.

Для технических лидеров enterprise-сегмента, оценивающих совокупную стоимость владения инфраструктурой (TCO), экстремальная скорость генерации оборачивается существенным налогом на физическую площадь и стойко-места. Готовы ли облачные провайдеры и корпоративные ЦОД оплачивать колоссальные расходы на энергопотребление, сетевую инфраструктуру и межчиповые соединения многостоечных SRAM-кластеров исключительно ради устранения задержек в работе агентов — пока остается открытым операционным риском.

AI-чипыNVIDIAИИ-агентыПроизводительностьБольшие языковые модели