Google выпустила Gemini 3.8 Flash TTS: голос теперь создаётся из текстовой строки

23 сентября 2026 года Google представила две новые text-to-speech (преобразование текста в речь) модели: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Google описывает их как самые выразительные аудио-модели в истории семейства Gemini. Оба инструмента уже доступны через Gemini API и Google AI Studio без листа ожидания.


Две модели — два сценария использования

Flash TTS ориентирован на творческие задачи — подкасты, аудиокниги, игровые персонажи. Flash-Lite TTS создан для дешёвой массовой генерации речи: дублирования, контент-конвейеров и голосовых агентов.

ПараметрGemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
НазначениеТворчество, персонажи, сценыМасштаб, дублирование, агенты
Языков130101
Готовых голосов30 студийных пресетов + дизайнТе же возможности дизайна
Цена (до конца 2026)$9 / млн токенов$6 / млн токенов
Цена с 01.01.2027$18 / млн токенов$12 / млн токенов

Google считает одну секунду аудио равной 25 токенам: час генерированной речи обойдётся в $0.81 для Flash TTS и $0.54 для Flash-Lite TTS до конца 2026 года.

ℹ Сравнение с предшественником
Предыдущая модель Gemini 3.1 Flash TTS Preview стоила $20 за миллион аудио-токенов — новые версии значительно дешевле при улучшенном качестве.

Как работает генеративный дизайн голоса

Flash TTS умеет создавать новые голоса из текстового описания, а функция клонирования строит голосовой профиль всего из 30-секундного аудиосэмпла.

Пример промпта для создания голоса:

High-energy DJ from Melbourne, warm baritone,
fast-paced delivery with a slight Australian twang

Обе модели поддерживают режиссёрские ремарки для каждой реплики, диалог двух персонажей и невербальные звуки — смех, вздохи, паузы.

💡 Для разработчиков
Платформы Agora, LiveKit, Pipecat и Vercel уже поддерживают интеграцию через Gemini API. Имена моделей в API: gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.

Пайплайн создания аудио


graph LR
    A[Текстовый промпт / скрипт] --> B[Gemini 3.8 Flash TTS]
    B --> C{Что нужно?}
    C -->|Новый персонаж| D[Генеративный дизайн голоса]
    C -->|Клонирование| E[30-секундный сэмпл + согласие]
    C -->|Диалог| F[Двухспикерная сцена]
    D --> G[Готовый аудиофайл WAV 24kHz]
    E --> G
    F --> G


Бенчмарки: первые места

Gemini 3.8 Flash TTS занял первое место на Voice Design Benchmark от Hume AI с общим баллом 71.4 и лидирует в воспроизведении акцентов с оценкой 60.8.

Обе модели заняли первое и второе места соответственно в Overall Quality Index Hume AI, а также показали значительный прирост по сравнению с Gemini 3.1 Flash TTS в задачах создания длинного контента и управления диалогом двух спикеров.

В слепых пользовательских оценках на Voice Arena модели заняли топовые позиции среди конкурентов в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.

Gemini 3.8 Flash TTS — первое место на Voice Design Benchmark Hume AI (71.4) и лидерство в моделировании акцентов (60.8).


Безопасность и защита голоса

Для клонирования голоса пользователь обязан предоставить запись вербального согласия от владельца голоса, совпадающую с референсным спикером.

Каждый аудиофрагмент, созданный моделями Gemini Audio, несёт водяной знак SynthID — невидимую метку, встроенную прямо в аудиовыход. Реплицированные голоса также получают учётные данные C2PA.

⚠ Региональные ограничения
Функция клонирования голоса недоступна в AI Studio в ряде регионов, включая Великобританию, ЕЭЗ и Индию.

Контекст и значение для рынка

ElevenLabs уже построила крупный бизнес на синтезе речи, OpenAI последовательно расширяет аудиовозможности. Рынок TTS превратился из нишевого сегмента в поле реальной конкуренции — AI-агенты, боты поддержки и инструменты создания контента требуют всё более качественных голосов.

Новые модели дополняют быстро растущее семейство Gemini Audio, следуя за 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking.

Генерация голоса из простого текстового описания, клонирование по 30-секундному сэмплу, поддержка 130 языков и цена ниже предыдущего поколения — Google делает TTS-инструменты доступными для широкого круга разработчиков и контент-мейкеров, ещё больше снижая порог входа в профессиональное аудиопроизводство.