Jalapeño: собственный чип OpenAI для AI-инференса
OpenAI опубликовала первые результаты Jalapeño — собственного чипа для AI-инференса, который обходит Nvidia Blackwell по скорости и энергоэффективности.
Jalapeño: собственный чип OpenAI для AI-инференса бьёт рекорды скорости и энергоэффективности
OpenAI сделала неожиданный шаг для компании, известной прежде всего своими языковыми моделями: она создала собственный кремниевый чип. 26 августа 2026 года компания опубликовала первые официальные результаты тестирования Jalapeño — специализированного процессора для AI-инференса (inference, то есть запуска обученных моделей для генерации ответов). Цифры впечатляют: чип превзошёл флагманские системы Nvidia Blackwell сразу по нескольким ключевым показателям.
Откуда появился Jalapeño?
Когда OpenAI анонсировала Jalapeño — свой первый кастомный чип для инференса — компания сразу заявила об амбициозных целях. Чип разработан совместно с Broadcom и создан с нуля специально под задачи больших языковых моделей (LLM), с акцентом на значительно более высокую производительность на ватт по сравнению с существующими ускорителями.
Результаты были представлены на конференции Hot Chips и детально описаны в официальном блоге OpenAI — это важный этап в стратегии компании по снижению зависимости от сторонних поставщиков кремния и переходу к собственной AI-инфраструктуре.
Создание кастомного кремния обычно занимает годы ручной инженерной работы. Чтобы ускорить разработку, OpenAI использовала собственные AI-модели для проектирования и тестирования Jalapeño — это позволило пройти путь от концепции до финального дизайна (tapeout) всего за девять месяцев.
Что показали первые бенчмарки?
Публичное тестирование проводилось с использованием бенчмарк-платформы SemiAnalysis InferenceX. Jalapeño сравнивался с ведущими коммерческими AI-системами на нескольких открытых моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T.
В сравнении с системами Nvidia GB200 и GB300 чип показал от 1,5 до 1,9× больше полезной работы на ватт потребляемой мощности и от 1,7 до 3,6× меньшую задержку (latency — время от запроса до ответа).
Для интерактивных задач в реальном времени, таких как выполнение шагов AI-агента, преимущество выросло ещё значительнее: прирост производительности составил от 2,1 до 4,1 раза.
Сводная таблица результатов
| Метрика | Jalapeño vs. Nvidia GB200/GB300 |
|---|---|
| Производительность на ватт (пиковая) | в 1,5–1,9× выше |
| Задержка end-to-end | в 1,7–3,6× ниже |
| Интерактивные нагрузки (AI-агенты) | в 2,1–4,1× лучше |
| Модель Kimi K2.5 1T: скорость ответа | в 3,4× быстрее |
| Энергопотребление (TDP) | 700 Вт (реальное — ≤550 Вт) |
| Объём памяти HBM4 | 216 ГБ при 15,4 ТБ/с |
Номинальное энергопотребление Jalapeño составляет 700 ватт, однако в реальных тестах устойчивая мощность не превышала 550 ватт.
«Итог прост: результаты демонстрируют очень, очень значительный прогресс по сравнению с лучшими существующими решениями», — Ричард Хо, руководитель аппаратного направления OpenAI.
Почему это важно для пользователей?
Jalapeño обеспечивает одновременно высокий throughput (пропускную способность) и низкую latency (задержку) в рамках одной архитектуры — там, где существующие аппаратные системы нередко вынуждены выбирать между этими двумя характеристиками. Для конечных пользователей это означает более быстрые ответы, более отзывчивых AI-агентов и более стабильный доступ по мере роста спроса.
OpenAI оценивает производительность при сопоставимом пользовательском опыте, измеряя, сколько полезной AI-работы система может выполнить на единицу мощности при соблюдении задержек, необходимых клиентам и интерактивным агентам. Это особенно важно для агентов, которым требуется выполнять множество последовательных шагов — любые задержки накапливаются и замедляют выполнение всей задачи.
Архитектура: в чём секрет?
Благодаря комплексному подходу к разработке всего стека OpenAI смогла устранить узкие места на конкретных фазах инференса. В частности, Jalapeño спроектирован так, чтобы минимизировать задержки на этапах prefill (предобработки запроса) и передачи данных — именно они чаще всего становятся узкими местами.
Кроме того, OpenAI хранит важные данные модели максимально близко к процессору. Чип локально содержит состояние модели, включая так называемый KV-кэш (key-value cache) — краткосрочную память, которую модель использует при генерации ответа. Это снижает объём передаваемых данных и уменьшает накопленные задержки.
Каждый модуль Jalapeño, анонсированный в июне после девятимесячного цикла разработки, сочетает вычислительный кристалл с шестью стеками HBM4 суммарным объёмом 216 ГиБ и пропускной способностью 15,4 ТБ/с.
graph TD
A[Входящий запрос пользователя] --> B[Фаза Prefill\nпредобработка токенов]
B --> C[KV-кэш\nлокально на чипе]
C --> D[Фаза Decode\nгенерация токенов]
D --> E[Ответ пользователю]
style A fill:#f9a825,color:#000
style B fill:#1565c0,color:#fff
style C fill:#2e7d32,color:#fff
style D fill:#1565c0,color:#fff
style E fill:#f9a825,color:#000
Full-stack подход: чипы, модели и ПО в одной экосистеме
OpenAI может проектировать модели, продукты, серверное программное обеспечение, чипы, память, сети и системы совместно, используя данные из реальных нагрузок для улучшения каждого слоя стека.
Компания планирует сделать Jalapeño мультипоколенческой платформой, в которой AI-продукты, модели, чипы и память разрабатываются в тесной взаимосвязи.
OpenAI использовала собственные AI-модели для ускорения разработки чипа, пройдя от дизайна до финального производственного шаблона всего за девять месяцев. По словам Ричарда Хо, второе поколение чипа уже находится на продвинутой стадии разработки, а третье — уже начато; второй чип ожидает финальной стадии проектирования в ближайшие месяцы.
Когда ждать Jalapeño в проде?
Хо оценил, что Jalapeño начнёт поставляться в «очень небольших объёмах» в конце 2026 года, а более значимое развёртывание ожидается в 2027 году.
При этом чип не будет доступен на рынке аренды, не будет предлагаться как облачный инстанс и не планируется к продаже сторонним компаниям.
OpenAI не собирается отказываться от Nvidia в ближайшем будущем: Jalapeño обрабатывает только инференс, но не ресурсоёмкий процесс обучения новых моделей — здесь GPU от Nvidia по-прежнему незаменимы.
Важные оговорки: не всё так однозначно
Jalapeño не тестировался против Vera Rubin — нового поколения Nvidia, поставки которого только начались, — и не предназначен для обучения моделей вообще.
Аналитики отмечают, что сравнение проводилось с текущими системами Nvidia Blackwell, тогда как Nvidia уже работает над архитектурами следующего поколения. К тому времени, когда Jalapeño масштабируется в 2027 году, разрыв в производительности может сократиться, что делает долгосрочную конкурентную картину менее очевидной.
Большая картина: OpenAI в гонке кастомного кремния
OpenAI присоединяется к растущему числу AI-компаний, строящих собственные чипы. Google давно развивает линейку TPU, Amazon активно инвестирует в кастомный кремний, а Anthropic недавно подтвердила аналогичные планы.
Первоначальные тесты указывают на потенциальное снижение операционных расходов примерно на 50% по сравнению со стандартными GPU. Если эти цифры подтвердятся в реальной эксплуатации, это изменит экономику обслуживания AI-сервисов принципиально.
Аппаратный шаг OpenAI сигнализирует о более широкой отраслевой тенденции: AI-компании больше не готовы полностью полагаться на универсальные процессоры. Кастомный кремний обеспечивает более тесную интеграцию между дизайном модели и аппаратным обеспечением, открывая потенциал для выигрышей, недостижимых на универсальных чипах.
Будущее AI — не только в том, насколько умна модель, но и в том, насколько эффективно железо под ней умеет её запускать.
Итог
Jalapeño — это не просто очередной процессор. Это стратегический манифест OpenAI: компания намерена контролировать весь стек, от весов модели до кремния под ними. Первые результаты убедительны, хотя и требуют независимой проверки. Если цифры устоят, а второе и третье поколения чипов окажутся ещё лучше, OpenAI может изменить не только свою экономику, но и расстановку сил на рынке AI-инфраструктуры в целом.