
Google запустила Gemini 3.8 Live: голосовой ИИ нового поколения
Google DeepMind выпустила Gemini 3.8 Live и 3.8 Live Extended Thinking — голосовые модели с многоязычностью, визуальным контекстом и рекордными бенчмарками.
15 сентября 2026 года Google DeepMind представила сразу две новые голосовые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Gemini 3.8 Live создана для масштабирования и экономичности с акцентом на плавный диалог и визуальный контекст, а 3.8 Live Extended Thinking ориентирована на более сложные задачи, требующие глубокого рассуждения, без прерывания разговора. Обе модели уже доступны разработчикам через Gemini API и Google AI Studio.
Что нового в Gemini 3.8 Live
Оба новых голосовых агента умеют автоматически определять и переключаться между 97 поддерживаемыми языками прямо в ходе разговора, выполнять вызовы инструментов и API в фоновом режиме, не прерывая беседу, а также обрабатывать визуальный ввод в режиме, близком к реальному времени.
Gemini 3.8 Live — быстрые и плавные разговоры, визуальный контекст, поддержка 97 языков, фоновое выполнение задач.
Gemini 3.8 Live Extended Thinking — глубокое многоэтапное рассуждение при непрерывном голосовом диалоге, корпоративный уровень выполнения задач.
Модель Extended Thinking использует особый подход к сложным задачам: вместо паузы она произносит вербальные сигналы вроде «Дайте проверю…» и продолжает нарратив по мере выполнения многоэтапных фоновых операций — всё это без прерывания живого разговора.
Бенчмарки: лидерство по всем фронтам
По данным Artificial Analysis’ Speech to Speech Quality Index, Gemini 3.8 Live Extended Thinking занял первое место с результатом 82,6%, опередив GPT-Live-1 Astra (Medium) с 81,5% и Grok Voice Think Fast 2.0 (High) с 81,3%.
В агентском тесте τ-Voice разрыв ещё заметнее: 3.8 Live Extended Thinking набирает 68,6% — чуть выше GPT-Live-1 Astra (67,9%) и значительно выше Grok Voice Think Fast 2.0 (56,5%).
На банковском агентском бенчмарке Sierra τ³-Banking новинка от Google лидирует с 35,1%, тогда как GPT-Live-1 Astra показывает 32,0%, а xAI-Realtime — лишь 16,5%.
| Модель | Speech-to-Speech Index | τ-Voice | τ³-Banking |
|---|---|---|---|
| Gemini 3.8 Live Extended Thinking | 82,6% | 68,6% | 35,1% |
| GPT-Live-1 Astra (Medium) | 81,5% | 67,9% | 32,0% |
| Grok Voice Think Fast 2.0 (High) | 81,3% | 56,5% | — |
| xAI-Realtime | — | — | 16,5% |
Как это работает
graph TD
A[Голосовой запрос пользователя] --> B[Gemini 3.8 Live]
B --> C{Тип задачи}
C -->|Простая| D[Мгновенный ответ + визуальный контекст]
C -->|Сложная| E[Gemini 3.8 Live Extended Thinking]
E --> F[Параллельное рассуждение + вербальный нарратив]
F --> G[Вызов инструментов / API в фоне]
G --> H[Результат без прерывания разговора]
D --> H
Где уже доступны модели
Google начинает выкатывание 3.8 Live через Gemini API, Google AI Studio и Search Live уже сегодня, корпоративный доступ — через Gemini Enterprise.
Для конечных пользователей:
- 3.8 Live — в Search Live (без подписки)
- 3.8 Live Extended Thinking — в Gemini Live и для подписчиков Google AI Pro / Ultra в Workspace (Docs, Gmail, Keep)
Для предприятий обе модели выходят в приватный превью в Gemini Enterprise, а Gemini Enterprise for Customer Experience получит их в ближайшее время.
Безопасность: SynthID-водяные знаки
Весь аудиоконтент, генерируемый новыми моделями, помечается невидимым водяным знаком SynthID — технологией Google для маркировки ИИ-сгенерированного звука. Водяной знак встраивается прямо в аудиовыход и позволяет отличить синтезированный голос от настоящего, что важно для борьбы с дезинформацией.
Контекст: гонка голосовых ИИ-агентов
Этот выпуск продолжает насыщенный темп Google в 2026 году: компания выпустила Gemini 3.8 Flash всего две недели назад, а до этого — Gemini 3.7 Flash. Теперь фокус сместился на аудиосторону стека Gemini.
Голосовые агенты перестают быть нишевым продуктом. Когда топовая reasoning-модель дешевле конкурентов и при этом бьёт их на всех основных бенчмарках — это меняет расчёты для любого разработчика, строящего voice-first приложение.
Гугл также объявил о партнёрстве с платформами Agora, LangChain, LiveKit, Pipecat, Vercel и Salesforce, которые уже используют Gemini Live API для построения production-ready голосовых интерфейсов. Это сигнал о том, что экосистема вокруг голосовых ИИ-агентов быстро зреет — и Gemini 3.8 Live намерен стать её центральным слоем.