15 сентября 2026 года Google DeepMind представила сразу две новые голосовые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Gemini 3.8 Live создана для масштабирования и экономичности с акцентом на плавный диалог и визуальный контекст, а 3.8 Live Extended Thinking ориентирована на более сложные задачи, требующие глубокого рассуждения, без прерывания разговора. Обе модели уже доступны разработчикам через Gemini API и Google AI Studio.

Что нового в Gemini 3.8 Live

Оба новых голосовых агента умеют автоматически определять и переключаться между 97 поддерживаемыми языками прямо в ходе разговора, выполнять вызовы инструментов и API в фоновом режиме, не прерывая беседу, а также обрабатывать визуальный ввод в режиме, близком к реальному времени.

ℹ Ключевые возможности

Gemini 3.8 Live — быстрые и плавные разговоры, визуальный контекст, поддержка 97 языков, фоновое выполнение задач.

Gemini 3.8 Live Extended Thinking — глубокое многоэтапное рассуждение при непрерывном голосовом диалоге, корпоративный уровень выполнения задач.

Модель Extended Thinking использует особый подход к сложным задачам: вместо паузы она произносит вербальные сигналы вроде «Дайте проверю…» и продолжает нарратив по мере выполнения многоэтапных фоновых операций — всё это без прерывания живого разговора.

Бенчмарки: лидерство по всем фронтам

По данным Artificial Analysis’ Speech to Speech Quality Index, Gemini 3.8 Live Extended Thinking занял первое место с результатом 82,6%, опередив GPT-Live-1 Astra (Medium) с 81,5% и Grok Voice Think Fast 2.0 (High) с 81,3%.

В агентском тесте τ-Voice разрыв ещё заметнее: 3.8 Live Extended Thinking набирает 68,6% — чуть выше GPT-Live-1 Astra (67,9%) и значительно выше Grok Voice Think Fast 2.0 (56,5%).

На банковском агентском бенчмарке Sierra τ³-Banking новинка от Google лидирует с 35,1%, тогда как GPT-Live-1 Astra показывает 32,0%, а xAI-Realtime — лишь 16,5%.

МодельSpeech-to-Speech Indexτ-Voiceτ³-Banking
Gemini 3.8 Live Extended Thinking82,6%68,6%35,1%
GPT-Live-1 Astra (Medium)81,5%67,9%32,0%
Grok Voice Think Fast 2.0 (High)81,3%56,5%
xAI-Realtime16,5%
💡 Для разработчика
Помимо качества, важна цена. Gemini 3.8 Live стоит всего $0,84 в час за входящее аудио, а Extended Thinking — $3,50 в час. Для сравнения: Grok Voice Think Fast 2.0 обходится в $4,80/час, а GPT-Live-1 Astra — в $5,83/час. То есть флагманская reasoning-модель Google дешевле ближайших конкурентов и при этом превосходит их по качеству.

Как это работает


graph TD
    A[Голосовой запрос пользователя] --> B[Gemini 3.8 Live]
    B --> C{Тип задачи}
    C -->|Простая| D[Мгновенный ответ + визуальный контекст]
    C -->|Сложная| E[Gemini 3.8 Live Extended Thinking]
    E --> F[Параллельное рассуждение + вербальный нарратив]
    F --> G[Вызов инструментов / API в фоне]
    G --> H[Результат без прерывания разговора]
    D --> H

Где уже доступны модели

Google начинает выкатывание 3.8 Live через Gemini API, Google AI Studio и Search Live уже сегодня, корпоративный доступ — через Gemini Enterprise.

Для конечных пользователей:

  • 3.8 Live — в Search Live (без подписки)
  • 3.8 Live Extended Thinking — в Gemini Live и для подписчиков Google AI Pro / Ultra в Workspace (Docs, Gmail, Keep)

Для предприятий обе модели выходят в приватный превью в Gemini Enterprise, а Gemini Enterprise for Customer Experience получит их в ближайшее время.

Безопасность: SynthID-водяные знаки

Весь аудиоконтент, генерируемый новыми моделями, помечается невидимым водяным знаком SynthID — технологией Google для маркировки ИИ-сгенерированного звука. Водяной знак встраивается прямо в аудиовыход и позволяет отличить синтезированный голос от настоящего, что важно для борьбы с дезинформацией.

⚠ Важно
Все бенчмарковые данные в этой статье основаны на цифрах, опубликованных Google. Независимым подтверждением от Artificial Analysis располагает только Speech to Speech Quality Index — его результаты можно проверить самостоятельно.

Контекст: гонка голосовых ИИ-агентов

Этот выпуск продолжает насыщенный темп Google в 2026 году: компания выпустила Gemini 3.8 Flash всего две недели назад, а до этого — Gemini 3.7 Flash. Теперь фокус сместился на аудиосторону стека Gemini.

Голосовые агенты перестают быть нишевым продуктом. Когда топовая reasoning-модель дешевле конкурентов и при этом бьёт их на всех основных бенчмарках — это меняет расчёты для любого разработчика, строящего voice-first приложение.

Гугл также объявил о партнёрстве с платформами Agora, LangChain, LiveKit, Pipecat, Vercel и Salesforce, которые уже используют Gemini Live API для построения production-ready голосовых интерфейсов. Это сигнал о том, что экосистема вокруг голосовых ИИ-агентов быстро зреет — и Gemini 3.8 Live намерен стать её центральным слоем.