GPT-5.6 Sol Ultrafast: в 14 раз быстрее на чипах Cerebras
OpenAI и Cerebras запустили режим Ultrafast для GPT-5.6 Sol: 750 токенов в секунду, ускорение в 14× без потери качества.
Главное
Cerebras обеспечивает работу GPT-5.6 Sol Ultrafast в OpenAI API, доставляя передовой интеллект на скоростях реального времени. Новый режим Ultrafast позволяет обрабатывать до 750 токенов в секунду — это в 14 раз быстрее стандартного режима. При этом GPT-5.6 Sol Ultrafast сохраняет ровно ту же интеллектуальную мощь, что и стандартная версия модели.
Что такое Ultrafast Mode
Cerebras и OpenAI представляют ранний предварительный просмотр Ultrafast Mode — нового уровня обслуживания, запускаемого сначала в OpenAI API и работающего на инфраструктуре Cerebras. Изначально доступ открыт для ограниченного круга клиентов, но будет расширяться.
Разработчикам AI всегда приходилось выбирать между скоростью и интеллектом: чем крупнее и умнее модель, тем выше вычислительные издержки и тем дольше ожидание ответа. Пользователям нередко приходилось либо ждать качественный результат, либо соглашаться на менее точный, но быстрый.
GPT-5.6 Sol Ultrafast снимает этот компромисс, принося передовой интеллект в продукты и рабочие процессы, где каждая секунда на счету.
Технология: Wafer-Scale Engine
За рекордной скоростью стоит уникальная аппаратная архитектура Cerebras.
Cerebras размещает всё на единственной кремниевой пластине (wafer), держа вычисления и память интегрированными — чипу не нужно запрашивать данные у соседнего чипа. Именно эта интеграция позволяет минимизировать узкие места по пропускной способности памяти, которые мучают традиционные GPU-конфигурации при инференсе больших моделей.
Архитектура Wafer-Scale Engine хранит 44 ГБ весов модели прямо в SRAM на чипе, исключая обращения к внешней памяти. Это устраняет «память-пропускной» узел, который обычно ограничивает скорость инференса фронтирных моделей на обычном GPU-железе.
graph LR
A[Запрос пользователя] --> B[OpenAI API]
B --> C{Режим?}
C -->|Standard| D[GPU-кластер\n~53 tok/s]
C -->|Ultrafast| E[Cerebras WSE-3\n750 tok/s]
D --> F[Ответ модели]
E --> F
style E fill:#4CAF50,color:#fff
style D fill:#FF9800,color:#fff
Бенчмарки и сравнение с конкурентами
GPT-5.6 Sol — лучшая на сегодня модель OpenAI для юридических документов, финансовых моделей и инженерных отчётов. На бенчмарке GDP-Val, измеряющем экономически ценные задачи, Ultrafast показал ускорение в 5,6× без какой-либо деградации качества.
| Модель | Скорость (tok/s) | Разница с Ultrafast |
|---|---|---|
| GPT-5.6 Sol Ultrafast | до 750 | — |
| GPT-5.6 Sol Standard | ~53 | 14× медленнее |
| Claude Opus 4.8 (Fast) | ~150 | 5× медленнее |
| Claude Fable 5 | ~68 | 11× медленнее |
По данным бенчмарков, Ultrafast работает примерно в 5× быстрее Claude Opus 4.8 в режиме Fast и в 11× быстрее Claude Fable 5 по скорости вывода.
Где и когда доступно
OpenAI представила GPT-5.6 Sol в июне вместе со сбалансированной моделью Terra и быстрой Luna. Вся линейка стала широко доступна в июле через ChatGPT, Codex и API.
GPT-5.6 Sol Ultrafast пока доступен в ограниченном предварительном просмотре для небольшой группы клиентов OpenAI. Желающие могут зарегистрироваться на сайте Cerebras, чтобы получить уведомление о расширении доступа.
Ultrafast особенно полезен там, где задержка критична:
- 🤖 AI-агенты на критическом пути задач
- ⚖️ Юридические документы и договорная работа
- 💹 Финансовое моделирование в режиме реального времени
- 💻 Кодинг и ревью кода в Codex
- 🏭 Производственные рабочие процессы, где каждая секунда стоит денег
Контекст: стратегическое партнёрство
Партнёрство OpenAI и Cerebras было официально оформлено 14 января 2026 года: компании заключили многомиллиардное соглашение на предоставление до 750 МВт вычислительных мощностей на три года — до 2028–2029 года — для сверхбыстрого инференса флагманских продуктов OpenAI, включая ChatGPT.
По финансовым результатам второго квартала 2026 года выручка Cerebras более чем удвоилась до 210 миллионов долларов, а облачный бизнес почти учетверился год к году.
«GPT-5.6 Sol on Ultrafast is proof that speed and intelligence are no longer mutually exclusive» — Эндрю Фельдман, CEO и сооснователь Cerebras
«Объединяя GPT-5.6 Sol с технологиями инференса Cerebras, мы исследуем, что становится возможным, когда клиенты получают интеллект наших самых мощных моделей с существенно меньшей задержкой», — прокомментировал Сачин Катти, вице-президент по вычислительной стратегии OpenAI. По его словам, компания начинает с небольшой группы клиентов, чтобы понять, где скорость создаёт реальную ценность.
Значение для отрасли
Каждый крупный технологический сдвиг открывался прорывом в скорости, а не только в возможностях: эра ПК потребовала перехода от килогерц к гигагерцам, интернет стал массовым лишь с переходом от dial-up к широкополосному доступу. AI — не исключение. Теперь, когда фронтирные модели демонстрируют явную полезность, следующим барьером для массового внедрения становится скорость их работы.
Партнёрство OpenAI и Cerebras наглядно показывает: будущее AI-инфраструктуры — не только в более умных моделях, но и в специализированном кремнии, способном выдавать эти возможности с минимальной задержкой. Режим Ultrafast — первый публичный шаг к эпохе, когда ждать ответа AI станет таким же анахронизмом, как dial-up модем.