GPT-5.6 Sol Ultrafast: скорость 750 токенов в секунду
OpenAI и Cerebras запустили Ultrafast — новый уровень API с GPT-5.6 Sol до 14× быстрее стандарта. До 750 токенов/сек без потери качества.
GPT-5.6 Sol Ultrafast: когда скорость больше не требует жертв
«До сих пор получить реальную скорость в реальном времени означало выбрать модель поменьше или более специализированную. Ultrafast указывает на прогресс в новом направлении: больше полезной работы за секунду.» — OpenAI
Сегодня Cerebras и OpenAI открыли ранний доступ к Ultrafast Mode — новому сервисному уровню (service tier), запускающемуся сначала в OpenAI API. Он работает на чипах Cerebras и генерирует до 750 выходных токенов в секунду, приближая самую интеллектуальную модель компании к продуктам и рабочим процессам, где каждая секунда на счету.
Конец компромисса между скоростью и интеллектом
Разработчики AI всегда были вынуждены выбирать между скоростью и интеллектом: чем крупнее и умнее модель, тем выше вычислительные затраты и медленнее отклик. Пользователи либо ждут качественного результата, либо соглашаются на компромисс ради скорости.
GPT-5.6 Sol на Ultrafast mode работает с тем же интеллектом, что и GPT-5.6 Sol Standard, обеспечивая передовой интеллект на головокружительной скорости Cerebras. Иными словами, никакой деградации качества — только скорость.
Каждый крупный технологический сдвиг был обеспечен скачком скорости, а не только возможностей: эра ПК потребовала перехода от килогерц к гигагерцам, интернет — от dial-up к широкополосному соединению прежде, чем стал массовым. AI — не исключение.
Как работает технология: Wafer-Scale Engine
За феноменальными показателями Ultrafast стоит фундаментально иная аппаратная архитектура — Wafer-Scale Engine (WSE) компании Cerebras.
Вместо того чтобы нарезать кремниевую пластину (wafer) на сотни отдельных кристаллов, Cerebras превращает почти весь wafer в один процессор. Актуальный WSE-3 — это единый процессор площадью 46 225 мм² с 4 триллионами транзисторов, 900 000 AI-оптимизированных ядер, 44 ГБ встроенной SRAM-памяти и 21 петабайтом/сек пропускной способности памяти.
Скорость Ultrafast обеспечивается именно этой архитектурой: веса модели хранятся непосредственно на чипе — в 44 ГБ SRAM на каждом пластинчатом чипе — вместо того чтобы перемещаться между встроенной и внешней памятью, как это вынуждены делать GPU. Это устраняет узкое место пропускной способности памяти, которое ограничивает скорость инференса frontier-моделей на традиционном оборудовании.
graph LR
A["Запрос пользователя"] --> B["OpenAI API
Ultrafast tier"]
B --> C["Cerebras WSE-3
44 ГБ on-chip SRAM"]
C --> D["GPT-5.6 Sol
(полная модель)"]
D --> E["До 750 токенов/сек"]
E --> F["Ответ в реальном времени"]
style C fill:#4a90d9,color:#fff
style D fill:#10a37f,color:#fff
style E fill:#f5a623,color:#fff
Современный LLM-инференс ограничен не вычислительной мощью, а скоростью перемещения весов и активаций. GPU обладают огромной вычислительной мощью, но при низкобатчевом инференсе для отдельных пользователей они большую часть времени простаивают в ожидании данных из памяти.
Цифры и бенчмарки
Ultrafast демонстрирует конкурентное преимущество Cerebras: он работает в 5 раз быстрее, чем сопоставимые модели вроде Claude Opus 4.8, и в 11 раз быстрее, чем Claude Fable 5.
На бенчмарке Humanity’s Last Exam модель в режиме Ultrafast завершила тест за 11 часов 11 минут — почти в 7 раз быстрее, чем Claude Fable 5, при сопоставимой точности.
На GDP-Val — бенчмарке для экономически ценных задач, требующих профессиональных знаний — Ultrafast обеспечил ускорение в 5,6× без какой-либо деградации качества.
| Параметр | GPT-5.6 Sol Standard | GPT-5.6 Sol Ultrafast |
|---|---|---|
| Скорость генерации | ~54 токена/сек | до 750 токенов/сек |
| Ускорение vs Standard | 1× (базовый) | до 14× |
| Качество модели | Полное (Sol) | Полное (Sol) |
| Ускорение vs Claude Opus 4.8 Fast | — | ~5× |
| Ускорение vs Claude Fable 5 | — | ~11× |
| GDP-Val speedup | — | 5,6× |
| Доступность | Широкая | Ограниченный preview |
Для каких задач создан Ultrafast
Ultrafast разработан для живых и почти-production рабочих нагрузок: голосовые интерфейсы в реальном времени, поддержка клиентов, коммерция, агенты для разработчиков, финансовые исследования и реагирование на инциденты безопасности.
Разберём каждый сценарий подробнее:
🔴 Инциденты и DevOps
Когда критическая система падает, Ultrafast способен в режиме реального времени анализировать логи приложений, последние изменения в коде и отчёты инженеров — выявлять вероятную причину и помогать готовить патч прямо в ходе инцидента.
Разработчики самого OpenAI уже использовали Ultrafast для анализа логов во время инцидентов, а также для сжатия исследовательских циклов: задачи, которые раньше выполнялись за ночь, теперь умещаются в несколько итераций в течение рабочего дня.
💬 Голосовая поддержка и клиентский сервис
Ultrafast позволяет решать сложные клиентские проблемы в реальном времени, не прерывая разговор — даже когда для поиска ответа требуется несколько шагов или систем.
Руководитель продукта компании Podium Кортланд Лайкинс назвал Ultrafast «бесценным для голосового стека», отметив, что скорость «полностью меняет опыт звонка».
📈 Финансы и безопасность
Анализ рыночных сигналов, оценка транзакций и выявление подозрительной активности в то время, пока условия ещё меняются — именно здесь скорость превращается в конкурентное преимущество.
💻 Разработка и агенты
С Ultrafast можно помещать агентов на критический путь решения задач, где каждая секунда имеет значение. Инженер по AI компании Jane Street Джон Крепецци отметил, что скорость Cerebras «открывает принципиально другие способы использования моделей».
Семейство GPT-5.6 и ценообразование
OpenAI представила GPT-5.6 Sol в июне вместе со сбалансированной Terra и скоростной Luna. Полное семейство стало широко доступным в июле — через ChatGPT, Codex и API.
GPT-5.6 Sol стоит $5,00 за входные и $30,00 за выходные токены на 1 млн (со ставкой $0,50 для кэшированного ввода); GPT-5.6 Terra — $2,50/$15,00; GPT-5.6 Luna — $1,00/$6,00.
| Модель | Входные токены ($/1М) | Выходные токены ($/1М) | Специализация |
|---|---|---|---|
| GPT-5.6 Sol | $5,00 | $30,00 | Максимальный интеллект |
| GPT-5.6 Sol Ultrafast | TBD (preview) | TBD (preview) | Максимальный интеллект + скорость |
| GPT-5.6 Terra | $2,50 | $15,00 | Баланс |
| GPT-5.6 Luna | $1,00 | $6,00 | Скорость / объём |
Стратегический смысл: скорость как новый фронтир
Каждый крупный технологический сдвиг открывался скачком скорости, а не только возможностей. Теперь, когда frontier-модели доказали свою компетентность, следующим ограничителем их широкого распространения становится скорость работы.
Этот упор на скорость совпадает с общим разворотом индустрии: лаборатории переключаются с вопроса «кто умнее» на «кто достаточно быстр для агентов».
Когда скорость больше не требует жертв интеллектом, AI способен проникнуть в самые критичные ко времени части бизнеса — и открыть принципиально новые виды работы.
«GPT-5.6 Sol на Ultrafast — доказательство того, что скорость и интеллект больше не являются взаимоисключающими», — сказал Эндрю Фельдман, CEO и сооснователь Cerebras.
Сачин Катти, вице-президент по вычислительной стратегии и GPT-инфраструктуре в OpenAI, отметил, что компании «исследуют, что становится возможным, когда клиенты получают интеллект наших самых способных моделей со значительно меньшей задержкой».
Итог
Ultrafast — это не просто «более быстрый ChatGPT». Это смена парадигмы в том, где и как может применяться frontier-уровень AI. Когда GPT-5.6 Sol генерирует ответы со скоростью человеческого мышления, открывается целый класс задач, для которых прежде не существовало инструментов: живые голосовые агенты с глубокими рассуждениями, анализ инцидентов в реальном времени, мгновенные финансовые исследования.
По мере того как возможности моделей продолжают расти, расширяется и диапазон приложений для быстрого инференса. Cerebras и OpenAI сделали первый шаг к будущему, где задержка перестаёт быть барьером между человеком и AI.