GPT-Live-1 в API: живой голосовой ИИ от OpenAI
OpenAI открыла GPT-Live-1 для разработчиков: full-duplex голос, поддержка телефонии, кастомные голоса и цена $0.05/мин.
Что такое GPT-Live-1 и почему это важно
10 сентября 2026 года OpenAI официально запустила GPT-Live-1 — новую голосовую модель — в своём публичном API. Это не просто очередное обновление: речь идёт о смене парадигмы в создании разговорных голосовых приложений.
GPT-Live-1 умеет слушать и говорить одновременно, заменяя привычный трёхэтапный конвейер (распознавание речи → языковая модель → синтез речи) единой интегрированной моделью. Это принципиально меняет то, как звучат разговоры с ИИ: меньше пауз, меньше искусственных задержек, больше живости.
От ChatGPT к API: история модели
8 июля 2026 года OpenAI представила новое поколение full-duplex голосовых моделей: GPT-Live-1 и GPT-Live-1 mini были интегрированы прямо в ChatGPT для всех пользователей с обещанием в будущем открыть API. Это обещание выполнено.
Теперь та же модель, что стоит за голосом ChatGPT, доступна разработчикам для создания голосовых агентов в приложениях и колл-центрах. При этом конкуренция на рынке голосового ИИ продолжает накаляться: Microsoft продвигает MAI Realtime full-duplex, xAI — Grok Voice. Все игроки гонятся за одной целью: создать голос, который не звучит как автоответчик.
Архитектура: как это работает
Раньше создание голосового приложения означало сборку из трёх независимых частей:
graph LR
A[🎙️ Речь пользователя] --> B[STT: Распознавание речи]
B --> C[LLM: Языковая модель]
C --> D[TTS: Синтез речи]
D --> E[🔊 Ответ ИИ]
style B fill:#f9d0d0
style C fill:#f9d0d0
style D fill:#f9d0d0
Раньше разработка говорящего приложения означала соединение трёх отдельных компонентов: одного для транскрипции, одного для рассуждений и одного для синтеза ответа. Каждая передача данных добавляла задержку и делала разговор ненатуральным.
С GPT-Live-1 схема принципиально иная:
graph LR
A[🎙️ Речь пользователя] --> B[GPT-Live-1\nГолосовой слой]
B <--> C[Backend-модель\nGPT-6 Astra и др.]
B --> D[🔊 Мгновенный ответ]
C --> E[🛠️ Инструменты и действия]
style B fill:#d0f0d0
style C fill:#d0e8f9
GPT-Live-1 фактически превращает голос в агентский интерфейс, а не просто речевую надстройку над текстовым чат-ботом. Live-модель управляет таймингом и ходом разговора, backend-модели отвечают за рассуждения, а инструменты выполняют внешние действия.
Ключевые возможности GPT-Live-1
1. Умная обработка перебиваний
Определяющее свойство full-duplex: модель продолжает слушать, пока ещё говорит, — поэтому собеседник может перебить на середине фразы, и ответ адаптируется, вместо того чтобы дожидаться конца своей «очереди».
Реальный эффект уже измерен: в ранних оценках компания Speak обнаружила, что GPT-Live-1 давал учащимся больше времени подумать, прежде чем языковой репетитор отвечал, что сократило количество перебиваний почти на 80% по сравнению с прежними пошаговыми системами.
2. Делегирование рассуждений (Reasoning Delegation)
GPT-Live-1 может делегировать рассуждения и вызовы инструментов фоновой текстовой модели — например, GPT-6 Astra или сторонней модели. Это даёт возможность сохранять живость разговора, не жертвуя глубиной ответов.
3. Настройка тона и стиля
Разработчики могут управлять тоном, темпом и разговорным поведением через системные инструкции, вместо того чтобы обрабатывать голос как отдельный фиксированный выходной этап.
4. Работа с фоновым шумом и паузами
Улучшенная обработка фоновых шумов и тишины — без прерывания разговора и без «озвучивания» каждого промежуточного шага вслух. Модель отлично работает в кафе, на улице, в шумном офисе.
5. Надёжность в длинных сессиях
Улучшено сохранение контекста и качество разговора на протяжении длительных взаимодействий. Это критично для сценариев технической поддержки или обучения.
6. Поддержка телефонии
Есть поддержка телефонии для создания агентов, принимающих звонки в полнодуплексном режиме, нативные ASR-транскрипты наряду с текстом ответа, определение очерёдности реплик, смещение по ключевым словам (что помогает распознавать имена и аббревиатуры), а также понимание буквенно-цифровых последовательностей — кодов, номеров дел и т.д.
7. Голоса и кастомизация
Модель запускается с 12 голосами, охватывающими различные акценты, диалекты и языки; доступ к пользовательским голосам требует обращения в отдел продаж.
Производительность и бенчмарки
Модель поднимает результат Full Duplex Bench на 30 процентных пунктов по сравнению с GPT-Realtime-2.1. Латентность тоже впечатляет: одна модель слушает и говорит одновременно, достигая латентности 0,798 секунды.
OpenAI также упоминает раннее внедрение, при котором замена каскадного голосового стека на GPT-Live-1 сократила соответствующую кодовую базу примерно на 80% и убрала около 23 000 строк кода.
Меньше кода — меньше мест для ошибок. GPT-Live-1 упрощает не только пользовательский опыт, но и архитектуру самого приложения.
Цены и доступность
Цена GPT-Live-1 составляет $0,05 за минуту в API — это ставка, которую OpenAI опубликовала при запуске модели для разработчиков 10 сентября 2026 года.
Но важно понимать структуру расходов:
| Компонент | Что включено | Оплата |
|---|---|---|
| Голосовой слой (GPT-Live-1) | Full-duplex разговор, обработка аудио | $0,05/мин |
| Backend-модель (напр., GPT-6 Astra) | Рассуждения, сложные ответы | По токенам, отдельно |
| Инструменты и агент | Внешние вызовы API, действия | По использованию |
| Кастомные голоса | Брендированные голосовые персонажи | По договорённости с sales |
$0,05/мин — это не весь счёт. GPT-Live-1 делегирует реальные рассуждения отдельной backend-модели, и за её токены вы платите дополнительно, плюс расходы на агентский слой.
Модель принимает аудио и текст, работает только через эндпоинт Live sessions, ограничена по числу одновременных сессий и недоступна на бесплатном уровне.
Сценарии применения
Релиз открывает возможности для голосовых приложений в сферах клиентской поддержки, образования и развлечений. Рассмотрим конкретные примеры:
Колл-центры и телефония. Поддержка телефонии позволяет развёртывать full-duplex голосовых агентов для телефонных звонков — от бронирования ресторанов до службы поддержки клиентов.
Образование и языковые тренажёры. Пример Speak наглядно показывает, как грамотная обработка пауз и перебиваний создаёт психологически комфортную среду для изучения языка — ИИ-репетитор «не торопит» студента.
Корпоративные ассистенты. API поддерживает смещение по ключевым словам и улучшенное распознавание буквенно-цифровых последовательностей — полезно для имён, справочных кодов, номеров заказов, адресов, идентификаторов аккаунтов и кодов продуктов.
Здравоохранение и финансы. Tau3 оценивает задачи устной клиентской поддержки в авиакомпаниях, ритейле и телекоме; OpenAI также сообщает об оценках в банковской поддержке, охватывающих извлечение знаний и работу с инструментами учётных записей.
Правовые аспекты и конфиденциальность
Запись и обработка аудио звонков считается обработкой персональных данных, что влечёт обязательства по раскрытию информации, получению согласия и срокам хранения, а также государственные и местные законы о записи звонков, которые варьируются в зависимости от юрисдикции.
Пример интеграции
Вот как выглядит базовая инициализация Live-сессии с GPT-Live-1:
from openai import OpenAI
client = OpenAI()
# Создание Live-сессии с GPT-Live-1
session = client.live.sessions.create(
model="gpt-live-1",
instructions="Ты — дружелюбный ассистент службы поддержки. "
"Говори чётко, не торопись, дай клиенту время подумать.",
voice="alloy", # Один из 12 доступных голосов
backend_model="gpt-6-astra", # Модель для глубоких рассуждений
)
print(f"Сессия создана: {session.id}")
# Далее — потоковая передача аудио через WebSocket
instructions не только задачу агента, но и его коммуникативный стиль: темп речи, уровень формальности, как реагировать на паузы. GPT-Live-1 точно следует этим инструкциям благодаря улучшенному instruction following.Итог: что меняет GPT-Live-1
GPT-Live-1 — это не просто новая модель, а новый способ думать о голосовых интерфейсах. Введение GPT-Live-1 в API OpenAI представляет собой крупный эволюционный шаг в архитектуре разговорного ИИ.
Главное, что меняется:
- Архитектура: один слой вместо трёх — меньше кода, меньше задержек
- Естественность: full-duplex позволяет перебивать, менять тему, делать паузы
- Гибкость: выбор backend-модели под конкретную задачу
- Доступность: $0,05/мин делает технологию доступной для стартапов
- Готовность к production: встроенная телефония, 12 голосов, ASR-транскрипты
Голосовой ИИ перестаёт быть «надстройкой» над текстовым чат-ботом и становится самостоятельным агентским интерфейсом. GPT-Live-1 — первый шаг в этом направлении, доступный каждому разработчику.
Для начала работы — документация доступна на platform.openai.com. Кастомные голоса и enterprise-возможности — через отдел продаж OpenAI.