Google запустила Gemini 3.8 TTS: голос из текстовой строки
Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS — самые выразительные TTS-модели семейства Gemini с поддержкой 100+ языков.
Google выпустила Gemini 3.8 Flash TTS: голос теперь создаётся из текстовой строки
23 сентября 2026 года Google представила две новые text-to-speech (преобразование текста в речь) модели: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Google описывает их как самые выразительные аудио-модели в истории семейства Gemini. Оба инструмента уже доступны через Gemini API и Google AI Studio без листа ожидания.
Две модели — два сценария использования
Flash TTS ориентирован на творческие задачи — подкасты, аудиокниги, игровые персонажи. Flash-Lite TTS создан для дешёвой массовой генерации речи: дублирования, контент-конвейеров и голосовых агентов.
| Параметр | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| Назначение | Творчество, персонажи, сцены | Масштаб, дублирование, агенты |
| Языков | 130 | 101 |
| Готовых голосов | 30 студийных пресетов + дизайн | Те же возможности дизайна |
| Цена (до конца 2026) | $9 / млн токенов | $6 / млн токенов |
| Цена с 01.01.2027 | $18 / млн токенов | $12 / млн токенов |
Google считает одну секунду аудио равной 25 токенам: час генерированной речи обойдётся в $0.81 для Flash TTS и $0.54 для Flash-Lite TTS до конца 2026 года.
Как работает генеративный дизайн голоса
Flash TTS умеет создавать новые голоса из текстового описания, а функция клонирования строит голосовой профиль всего из 30-секундного аудиосэмпла.
Пример промпта для создания голоса:
High-energy DJ from Melbourne, warm baritone,
fast-paced delivery with a slight Australian twang
Обе модели поддерживают режиссёрские ремарки для каждой реплики, диалог двух персонажей и невербальные звуки — смех, вздохи, паузы.
gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.Пайплайн создания аудио
graph LR
A[Текстовый промпт / скрипт] --> B[Gemini 3.8 Flash TTS]
B --> C{Что нужно?}
C -->|Новый персонаж| D[Генеративный дизайн голоса]
C -->|Клонирование| E[30-секундный сэмпл + согласие]
C -->|Диалог| F[Двухспикерная сцена]
D --> G[Готовый аудиофайл WAV 24kHz]
E --> G
F --> G
Бенчмарки: первые места
Gemini 3.8 Flash TTS занял первое место на Voice Design Benchmark от Hume AI с общим баллом 71.4 и лидирует в воспроизведении акцентов с оценкой 60.8.
Обе модели заняли первое и второе места соответственно в Overall Quality Index Hume AI, а также показали значительный прирост по сравнению с Gemini 3.1 Flash TTS в задачах создания длинного контента и управления диалогом двух спикеров.
В слепых пользовательских оценках на Voice Arena модели заняли топовые позиции среди конкурентов в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.
Gemini 3.8 Flash TTS — первое место на Voice Design Benchmark Hume AI (71.4) и лидерство в моделировании акцентов (60.8).
Безопасность и защита голоса
Для клонирования голоса пользователь обязан предоставить запись вербального согласия от владельца голоса, совпадающую с референсным спикером.
Каждый аудиофрагмент, созданный моделями Gemini Audio, несёт водяной знак SynthID — невидимую метку, встроенную прямо в аудиовыход. Реплицированные голоса также получают учётные данные C2PA.
Контекст и значение для рынка
ElevenLabs уже построила крупный бизнес на синтезе речи, OpenAI последовательно расширяет аудиовозможности. Рынок TTS превратился из нишевого сегмента в поле реальной конкуренции — AI-агенты, боты поддержки и инструменты создания контента требуют всё более качественных голосов.
Новые модели дополняют быстро растущее семейство Gemini Audio, следуя за 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking.
Генерация голоса из простого текстового описания, клонирование по 30-секундному сэмплу, поддержка 130 языков и цена ниже предыдущего поколения — Google делает TTS-инструменты доступными для широкого круга разработчиков и контент-мейкеров, ещё больше снижая порог входа в профессиональное аудиопроизводство.