Jalapeño: собственный чип OpenAI для AI-инференса бьёт рекорды скорости и энергоэффективности

OpenAI сделала неожиданный шаг для компании, известной прежде всего своими языковыми моделями: она создала собственный кремниевый чип. 26 августа 2026 года компания опубликовала первые официальные результаты тестирования Jalapeño — специализированного процессора для AI-инференса (inference, то есть запуска обученных моделей для генерации ответов). Цифры впечатляют: чип превзошёл флагманские системы Nvidia Blackwell сразу по нескольким ключевым показателям.

ℹ Что такое AI-инференс?
AI-инференс (AI inference) — это процесс запуска уже обученной нейронной сети для получения ответов на запросы пользователей. В отличие от обучения (training), инференс происходит миллиарды раз в день на серверах таких компаний, как OpenAI, и именно здесь скорость и энергоэффективность критически важны.

Откуда появился Jalapeño?

Когда OpenAI анонсировала Jalapeño — свой первый кастомный чип для инференса — компания сразу заявила об амбициозных целях. Чип разработан совместно с Broadcom и создан с нуля специально под задачи больших языковых моделей (LLM), с акцентом на значительно более высокую производительность на ватт по сравнению с существующими ускорителями.

Результаты были представлены на конференции Hot Chips и детально описаны в официальном блоге OpenAI — это важный этап в стратегии компании по снижению зависимости от сторонних поставщиков кремния и переходу к собственной AI-инфраструктуре.

Создание кастомного кремния обычно занимает годы ручной инженерной работы. Чтобы ускорить разработку, OpenAI использовала собственные AI-модели для проектирования и тестирования Jalapeño — это позволило пройти путь от концепции до финального дизайна (tapeout) всего за девять месяцев.

💡 AI разрабатывает чипы для AI
OpenAI использовала две волны собственных моделей: ранние версии помогали проектировать и отлаживать чип, а самые свежие модели ускоряют оптимизацию и программирование уже готового кремния. Это первый масштабный случай применения LLM для разработки специализированного AI-железа.

Что показали первые бенчмарки?

Публичное тестирование проводилось с использованием бенчмарк-платформы SemiAnalysis InferenceX. Jalapeño сравнивался с ведущими коммерческими AI-системами на нескольких открытых моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T.

В сравнении с системами Nvidia GB200 и GB300 чип показал от 1,5 до 1,9× больше полезной работы на ватт потребляемой мощности и от 1,7 до 3,6× меньшую задержку (latency — время от запроса до ответа).

Для интерактивных задач в реальном времени, таких как выполнение шагов AI-агента, преимущество выросло ещё значительнее: прирост производительности составил от 2,1 до 4,1 раза.

Сводная таблица результатов

МетрикаJalapeño vs. Nvidia GB200/GB300
Производительность на ватт (пиковая)в 1,5–1,9× выше
Задержка end-to-endв 1,7–3,6× ниже
Интерактивные нагрузки (AI-агенты)в 2,1–4,1× лучше
Модель Kimi K2.5 1T: скорость ответав 3,4× быстрее
Энергопотребление (TDP)700 Вт (реальное — ≤550 Вт)
Объём памяти HBM4216 ГБ при 15,4 ТБ/с

Номинальное энергопотребление Jalapeño составляет 700 ватт, однако в реальных тестах устойчивая мощность не превышала 550 ватт.

«Итог прост: результаты демонстрируют очень, очень значительный прогресс по сравнению с лучшими существующими решениями», — Ричард Хо, руководитель аппаратного направления OpenAI.

Почему это важно для пользователей?

Jalapeño обеспечивает одновременно высокий throughput (пропускную способность) и низкую latency (задержку) в рамках одной архитектуры — там, где существующие аппаратные системы нередко вынуждены выбирать между этими двумя характеристиками. Для конечных пользователей это означает более быстрые ответы, более отзывчивых AI-агентов и более стабильный доступ по мере роста спроса.

OpenAI оценивает производительность при сопоставимом пользовательском опыте, измеряя, сколько полезной AI-работы система может выполнить на единицу мощности при соблюдении задержек, необходимых клиентам и интерактивным агентам. Это особенно важно для агентов, которым требуется выполнять множество последовательных шагов — любые задержки накапливаются и замедляют выполнение всей задачи.

📝 Пример для агентов
Представьте AI-агента, который автоматизирует написание отчёта: он выполняет 20 последовательных запросов к модели. Если каждый запрос на GPU занимает 2 секунды, а на Jalapeño — 0,6 секунды, вся задача завершится за 12 секунд вместо 40. Именно такой сценарий делает низкую latency принципиально важной.

Архитектура: в чём секрет?

Благодаря комплексному подходу к разработке всего стека OpenAI смогла устранить узкие места на конкретных фазах инференса. В частности, Jalapeño спроектирован так, чтобы минимизировать задержки на этапах prefill (предобработки запроса) и передачи данных — именно они чаще всего становятся узкими местами.

Кроме того, OpenAI хранит важные данные модели максимально близко к процессору. Чип локально содержит состояние модели, включая так называемый KV-кэш (key-value cache) — краткосрочную память, которую модель использует при генерации ответа. Это снижает объём передаваемых данных и уменьшает накопленные задержки.

Каждый модуль Jalapeño, анонсированный в июне после девятимесячного цикла разработки, сочетает вычислительный кристалл с шестью стеками HBM4 суммарным объёмом 216 ГиБ и пропускной способностью 15,4 ТБ/с.


graph TD
    A[Входящий запрос пользователя] --> B[Фаза Prefill\nпредобработка токенов]
    B --> C[KV-кэш\nлокально на чипе]
    C --> D[Фаза Decode\nгенерация токенов]
    D --> E[Ответ пользователю]

    style A fill:#f9a825,color:#000
    style B fill:#1565c0,color:#fff
    style C fill:#2e7d32,color:#fff
    style D fill:#1565c0,color:#fff
    style E fill:#f9a825,color:#000

Full-stack подход: чипы, модели и ПО в одной экосистеме

OpenAI может проектировать модели, продукты, серверное программное обеспечение, чипы, память, сети и системы совместно, используя данные из реальных нагрузок для улучшения каждого слоя стека.

Компания планирует сделать Jalapeño мультипоколенческой платформой, в которой AI-продукты, модели, чипы и память разрабатываются в тесной взаимосвязи.

OpenAI использовала собственные AI-модели для ускорения разработки чипа, пройдя от дизайна до финального производственного шаблона всего за девять месяцев. По словам Ричарда Хо, второе поколение чипа уже находится на продвинутой стадии разработки, а третье — уже начато; второй чип ожидает финальной стадии проектирования в ближайшие месяцы.

Когда ждать Jalapeño в проде?

Хо оценил, что Jalapeño начнёт поставляться в «очень небольших объёмах» в конце 2026 года, а более значимое развёртывание ожидается в 2027 году.

При этом чип не будет доступен на рынке аренды, не будет предлагаться как облачный инстанс и не планируется к продаже сторонним компаниям.

OpenAI не собирается отказываться от Nvidia в ближайшем будущем: Jalapeño обрабатывает только инференс, но не ресурсоёмкий процесс обучения новых моделей — здесь GPU от Nvidia по-прежнему незаменимы.

Важные оговорки: не всё так однозначно

⚠ Критический взгляд
Все опубликованные результаты получены самой OpenAI. Независимое сообщество SemiAnalysis присутствовало при проведении тестов, однако не проводило полный бенчмарк самостоятельно. Кроме того, сравнение велось с Nvidia GB300, тогда как новейшее поколение Vera Rubin уже начало поставляться — и против него Jalapeño не тестировался.

Jalapeño не тестировался против Vera Rubin — нового поколения Nvidia, поставки которого только начались, — и не предназначен для обучения моделей вообще.

Аналитики отмечают, что сравнение проводилось с текущими системами Nvidia Blackwell, тогда как Nvidia уже работает над архитектурами следующего поколения. К тому времени, когда Jalapeño масштабируется в 2027 году, разрыв в производительности может сократиться, что делает долгосрочную конкурентную картину менее очевидной.

Большая картина: OpenAI в гонке кастомного кремния

OpenAI присоединяется к растущему числу AI-компаний, строящих собственные чипы. Google давно развивает линейку TPU, Amazon активно инвестирует в кастомный кремний, а Anthropic недавно подтвердила аналогичные планы.

Первоначальные тесты указывают на потенциальное снижение операционных расходов примерно на 50% по сравнению со стандартными GPU. Если эти цифры подтвердятся в реальной эксплуатации, это изменит экономику обслуживания AI-сервисов принципиально.

Аппаратный шаг OpenAI сигнализирует о более широкой отраслевой тенденции: AI-компании больше не готовы полностью полагаться на универсальные процессоры. Кастомный кремний обеспечивает более тесную интеграцию между дизайном модели и аппаратным обеспечением, открывая потенциал для выигрышей, недостижимых на универсальных чипах.

Будущее AI — не только в том, насколько умна модель, но и в том, насколько эффективно железо под ней умеет её запускать.

Итог

Jalapeño — это не просто очередной процессор. Это стратегический манифест OpenAI: компания намерена контролировать весь стек, от весов модели до кремния под ними. Первые результаты убедительны, хотя и требуют независимой проверки. Если цифры устоят, а второе и третье поколения чипов окажутся ещё лучше, OpenAI может изменить не только свою экономику, но и расстановку сил на рынке AI-инфраструктуры в целом.