Главное

Cerebras обеспечивает работу GPT-5.6 Sol Ultrafast в OpenAI API, доставляя передовой интеллект на скоростях реального времени. Новый режим Ultrafast позволяет обрабатывать до 750 токенов в секунду — это в 14 раз быстрее стандартного режима. При этом GPT-5.6 Sol Ultrafast сохраняет ровно ту же интеллектуальную мощь, что и стандартная версия модели.


Что такое Ultrafast Mode

Cerebras и OpenAI представляют ранний предварительный просмотр Ultrafast Mode — нового уровня обслуживания, запускаемого сначала в OpenAI API и работающего на инфраструктуре Cerebras. Изначально доступ открыт для ограниченного круга клиентов, но будет расширяться.

ℹ Что такое токены в секунду
Tokens per second (TPS) — единица измерения скорости генерации текста языковой моделью. Один токен примерно равен 3–4 символам. При 750 TPS модель генерирует около 2500–3000 символов в секунду — это быстрее, чем человек успевает читать.

Разработчикам AI всегда приходилось выбирать между скоростью и интеллектом: чем крупнее и умнее модель, тем выше вычислительные издержки и тем дольше ожидание ответа. Пользователям нередко приходилось либо ждать качественный результат, либо соглашаться на менее точный, но быстрый.

GPT-5.6 Sol Ultrafast снимает этот компромисс, принося передовой интеллект в продукты и рабочие процессы, где каждая секунда на счету.


Технология: Wafer-Scale Engine

За рекордной скоростью стоит уникальная аппаратная архитектура Cerebras.

Cerebras размещает всё на единственной кремниевой пластине (wafer), держа вычисления и память интегрированными — чипу не нужно запрашивать данные у соседнего чипа. Именно эта интеграция позволяет минимизировать узкие места по пропускной способности памяти, которые мучают традиционные GPU-конфигурации при инференсе больших моделей.

Архитектура Wafer-Scale Engine хранит 44 ГБ весов модели прямо в SRAM на чипе, исключая обращения к внешней памяти. Это устраняет «память-пропускной» узел, который обычно ограничивает скорость инференса фронтирных моделей на обычном GPU-железе.


graph LR
    A[Запрос пользователя] --> B[OpenAI API]
    B --> C{Режим?}
    C -->|Standard| D[GPU-кластер\n~53 tok/s]
    C -->|Ultrafast| E[Cerebras WSE-3\n750 tok/s]
    D --> F[Ответ модели]
    E --> F
    style E fill:#4CAF50,color:#fff
    style D fill:#FF9800,color:#fff


Бенчмарки и сравнение с конкурентами

GPT-5.6 Sol — лучшая на сегодня модель OpenAI для юридических документов, финансовых моделей и инженерных отчётов. На бенчмарке GDP-Val, измеряющем экономически ценные задачи, Ultrafast показал ускорение в 5,6× без какой-либо деградации качества.

МодельСкорость (tok/s)Разница с Ultrafast
GPT-5.6 Sol Ultrafastдо 750
GPT-5.6 Sol Standard~5314× медленнее
Claude Opus 4.8 (Fast)~1505× медленнее
Claude Fable 5~6811× медленнее

По данным бенчмарков, Ultrafast работает примерно в 5× быстрее Claude Opus 4.8 в режиме Fast и в 11× быстрее Claude Fable 5 по скорости вывода.

💡 Для агентных сценариев это меняет всё
При 750 tok/s агент, который на стандартной GPU-инфраструктуре завершал задачу за 30 секунд, справляется менее чем за 3 — разница между тем, бросят ли пользователи рабочий процесс, или включат его в свою ежедневную работу.

Где и когда доступно

OpenAI представила GPT-5.6 Sol в июне вместе со сбалансированной моделью Terra и быстрой Luna. Вся линейка стала широко доступна в июле через ChatGPT, Codex и API.

GPT-5.6 Sol Ultrafast пока доступен в ограниченном предварительном просмотре для небольшой группы клиентов OpenAI. Желающие могут зарегистрироваться на сайте Cerebras, чтобы получить уведомление о расширении доступа.

📝 Сценарии применения

Ultrafast особенно полезен там, где задержка критична:

  • 🤖 AI-агенты на критическом пути задач
  • ⚖️ Юридические документы и договорная работа
  • 💹 Финансовое моделирование в режиме реального времени
  • 💻 Кодинг и ревью кода в Codex
  • 🏭 Производственные рабочие процессы, где каждая секунда стоит денег

Контекст: стратегическое партнёрство

Партнёрство OpenAI и Cerebras было официально оформлено 14 января 2026 года: компании заключили многомиллиардное соглашение на предоставление до 750 МВт вычислительных мощностей на три года — до 2028–2029 года — для сверхбыстрого инференса флагманских продуктов OpenAI, включая ChatGPT.

По финансовым результатам второго квартала 2026 года выручка Cerebras более чем удвоилась до 210 миллионов долларов, а облачный бизнес почти учетверился год к году.

«GPT-5.6 Sol on Ultrafast is proof that speed and intelligence are no longer mutually exclusive» — Эндрю Фельдман, CEO и сооснователь Cerebras

«Объединяя GPT-5.6 Sol с технологиями инференса Cerebras, мы исследуем, что становится возможным, когда клиенты получают интеллект наших самых мощных моделей с существенно меньшей задержкой», — прокомментировал Сачин Катти, вице-президент по вычислительной стратегии OpenAI. По его словам, компания начинает с небольшой группы клиентов, чтобы понять, где скорость создаёт реальную ценность.


Значение для отрасли

Каждый крупный технологический сдвиг открывался прорывом в скорости, а не только в возможностях: эра ПК потребовала перехода от килогерц к гигагерцам, интернет стал массовым лишь с переходом от dial-up к широкополосному доступу. AI — не исключение. Теперь, когда фронтирные модели демонстрируют явную полезность, следующим барьером для массового внедрения становится скорость их работы.

⚠ Важный нюанс
Ultrafast Mode пока недоступен широкой публике — это предварительный просмотр для избранных клиентов. Дата массового запуска не объявлена. Следите за обновлениями в OpenAI API и на сайте Cerebras.

Партнёрство OpenAI и Cerebras наглядно показывает: будущее AI-инфраструктуры — не только в более умных моделях, но и в специализированном кремнии, способном выдавать эти возможности с минимальной задержкой. Режим Ultrafast — первый публичный шаг к эпохе, когда ждать ответа AI станет таким же анахронизмом, как dial-up модем.