Экономика корпоративного ИИ окончательно сместилась от разового обучения моделей к тяжелым операционным расходам на постоянный инференс. Для руководителей, внедряющих автономных ИИ-агентов, аппаратная эффективность перестала быть академической метрикой: теперь она напрямую определяет маржинальность токенов, цены на API и скорость выполнения задач в реальном времени. Стремясь снизить зависимость от сторонних чипмейкеров, OpenAI представила собственный специализированный процессор (ASIC) под кодовым названием Jalapeño, разработанный совместно с Broadcom специально для ускорения работы уже обученных моделей.
Тестирование во фреймворке InferenceX в сравнении с флагманскими архитектурами Nvidia GB200 и GB300 показало, что Jalapeño обеспечивает в 1,5–1,9 раза более высокую вычислительную производительность на ватт на моделях GPT-OSS 120B, DeepSeek R1 и Kimi K2.5 1T. Что еще важнее для интерактивных сценариев с агентами, чип продемонстрировал снижение сквозной задержки (latency) в 1,7–3,6 раза, устраняя классический аппаратный компромисс между скоростью отклика на запрос и общей пропускной способностью кластера.
Вице-президент OpenAI по аппаратному обеспечению Ричард Хо сформулировал инженерную задачу предельно прямо на брифинге для прессы:
«Системам ИИ обычно приходится искать компромисс между этими параметрами», тогда как Jalapeño предлагает «лучшее из двух миров» — меньшую задержку и более высокую пропускную способность.
Преодоление этого компромисса при пакетировании запросов критически важно: традиционные конвейеры инференса намеренно жертвуют скоростью отклика для отдельного пользователя ради максимальной плотности общего батча. Для бизнеса, внедряющего автономных агентов с многошаговыми цепочками рассуждений, устранение этой проблемы снижает кривую затрат, сохраняя отклик систем в пределах долей секунды.
График внедрения и стратегия вычислений
Партнерство с Broadcom, впервые анонсированное в виде концепта в июне, знаменует переход OpenAI к кастомной инфраструктуре, призванной обойти высокую маржинальную наценку стандартных GPU. По словам Хо, заказная архитектура нацелена на то, чтобы предоставить «более быстрые ответы, более отзывчивых агентов и более надежный доступ по мере роста спроса». Внедрение будет постепенным: OpenAI планирует пилотные запуски малых объемов в конце этого года, а масштабное наращивание мощностей намечено на 2027 год. Ближайшие целевые объемы поставок компания пока не раскрывает.
Впрочем, эта дорожная карта по заказным чипам не означает немедленного отказа от действующих поставщиков. Хо признал, что OpenAI продолжит работать со сторонними провайдерами инфраструктуры и сохранит партнерство с Nvidia, параллельно разрабатывая второе и третье поколения Jalapeño.
Главным операционным препятствием остается масштабирование производства: пока кастомные ASIC-чипы не выйдут на устойчивые гипермасштабные объемы после 2027 года, корпоративным заказчикам стоит рассматривать проприетарное железо скорее как тактический рычаг против дефицита GPU, чем как гарантию моментального обвала цен на токены.