Современные корпоративные внедрения все чаще опираются на модели пошаговых рассуждений и автономных агентов, выполняющих десятки последовательных операций в рамках одного запроса. Хотя возможности передовых моделей стремительно растут, центры обработки данных уперлись в жесткие ограничения по энергопотреблению. Для корпоративных бюджетов текущее железо диктует неприятный компромисс между интерактивной задержкой отклика и общей пропускной способностью, заставляя компании оплачивать непомерные счета за вычисления. OpenAI опубликовала первые результаты тестирования собственного чипа для инференса Jalapeño, созданного специально для устранения этого узкого места.
Согласно техническому отчету OpenAI, Jalapeño обеспечивает одновременно более высокую пропускную способность и сокращение интервалов между токенами в рамках единой архитектуры. В прямом сравнении с ведущими коммерческими ускорителями кастомный ASIC продемонстрировал в 1,5–1,9 раза больше полезной работы на киловатт при пиковой нагрузке, а также снижение сквозной задержки в 1,7–3,6 раза на различных открытых архитектурах моделей.
Тестирование на различных архитектурах
Чтобы оценить процессор в жестких производственных условиях, OpenAI протестировала Jalapeño в сценариях пакетной обработки высокой пропускной способности и интерактивной работы со сверхнизкой задержкой. Оценка охватывала плотные архитектуры и модели смеси экспертов (MoE) разного масштаба: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Чип Jalapeño расположился прямо на границе Парето-эффективности для всех трех целей, доказав, что его архитектурные преимущества работают не только на закрытых внутренних кодовых базах, но и на сторонних открытых моделях.
В интерактивных задачах рассуждения Jalapeño продемонстрировал рост производительности в 2,1–4,1 раза на всех протестированных моделях.
«Jalapeño обеспечивает более высокую пропускную способность и меньшую задержку в рамках единой архитектуры, тогда как существующим аппаратным системам часто приходится идти на компромисс между ними».
Такой профиль задержки имеет решающее значение для рассуждающих агентов, где задержки накапливаются на каждом промежуточном этапе генерации, фазе планирования и вызове внешних инструментов.
Сквозная оптимизация и архитектура чипа
OpenAI спроектировала чип с использованием замкнутого инженерного цикла. Ранние внутренние модели помогали инженерам при физическом проектировании и запуске кремния, в то время как текущие reasoning-модели автоматизируют оптимизацию ядер, компиляцию программного обеспечения и планирование времени выполнения. Jalapeño изначально создавался так, чтобы нейросети могли программировать аппаратное обеспечение и динамически управлять им.
Такая вертикальная интеграция объединяет модели, фреймворки обслуживания, кремний, сетевую инфраструктуру и память в единый стек, откалиброванный под реальные нагрузки API. Jalapeño — это не экспериментальный прототип, а работающее собственное железо, снижающее себестоимость единицы вычислений и защищающее маржинальность OpenAI от ценовых наценок Nvidia.
OpenAI планирует нарастить производство чипов в ближайшие кварталы для перевода на них инфраструктуры API и корпоративной платформы. Разработка собственного кремния окончательно превратилась из страховки в R&D в ключевой операционный фактор для любой лаборатории, стремящейся масштабировать ИИ-агентов в условиях фиксированных лимитов энергопотребления.