Voicebox: открытая AI-студия клонирования голоса

«Clone any voice. Generate speech. Dictate into any app. Talk to agents in voices you own.» — README проекта

Voicebox — это local-first AI-студия звука, бесплатная альтернатива ElevenLabs и WisprFlow в одном приложении. Проект создан разработчиком Джейми Пайном (автором Spacedrive) и распространяется с открытым исходным кодом на GitHub.

ℹ Для кого этот инструмент
Voicebox ориентирован на разработчиков, контент-мейкеров, подкастеров и всех, кто хочет клонировать голос, диктовать текст или озвучивать проекты — без облака, подписки и утечки данных.

Что такое Voicebox

Это полный стек голосового ввода/вывода, работающий локально на вашей машине. Два облачных лидера — ElevenLabs (вывод) и WisprFlow (ввод) — закрывают лишь по половине цикла. Voicebox делает и то и другое, объединяя их с локальной LLM для уточнения транскриптов и поддержки персон.

Система построена на философии «local-first»: все веса моделей, голосовые данные и процессы генерации остаются на железе пользователя, обеспечивая полную приватность.

Приложение сочетает рабочий процесс DAW (Digital Audio Workstation) с современным машинным обучением, позволяя создавать голосовые профили, генерировать речь и компоновать многоголосые проекты без единой строки кода.


Ключевые возможности

🎤 Клонирование голоса

Клонирование голоса из нескольких секунд аудио, генерация речи на 23 языках через 7 TTS-движков, диктовка в любое текстовое поле с глобальной горячей клавишей и возможность дать голос любому MCP-агенту.

Движки: Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA и Kokoro — плюс 50+ готовых пресетных голосов.

🗣️ Системная диктовка

Удержите настраиваемую комбинацию клавиш (по умолчанию: right-Cmd + right-Option на macOS, right-Ctrl + right-Shift на Windows), скажите фразу, отпустите — плавающая подсказка на экране пройдёт через этапы «запись → транскрибирование → уточнение → готово», и текст вставится в нужное поле.

Voicebox использует OpenAI Whisper для транскрибирования — ту же модель, что стоит за диктовкой, вкладкой Captures и API /transcribe.

🎭 Выразительная речь и эффекты

Широчайшее языковое покрытие — арабский, датский, финский, греческий, иврит, хинди, малайский и другие. С Chatterbox Turbo можно вставлять паралингвистические теги вида [laugh], [chuckle], [gasp], [cough], [sigh].

8 аудиоэффектов на базе библиотеки Spotify Pedalboard: применяются после генерации, можно предпросматривать в реальном времени и сохранять пресеты. Встроены 4 готовых пресета: Robotic, Radio, Echo Chamber, Deep Voice.

📖 Stories Editor — многодорожечный редактор

Во вкладке Stories можно создавать разговоры между несколькими спикерами с помощью мультидорожечной временной шкалы, как в аудио- и видеоредакторах: расставлять блоки, обрезать, разбивать или перегенерировать их.

Отличный сценарий использования — подкасты, аудиокниги и разработка игр с AI-голосами.

🤖 MCP-интеграция (агенты со своим голосом)

MCP-совместимые агенты — Claude Code, Cursor, Spacebot — могут отвечать через экранный пузырь одним из ваших клонированных голосов.

Репозиторий содержит преднастроенный .mcp.json в корне — запуск Claude Code внутри этого checkout автоматически подхватывает инструменты Voicebox MCP.

🔌 REST API

Локальный REST API на 127.0.0.1 предоставляет эндпоинты для генерации, транскрибирования и управления профилями — для автоматизации.

Пример запроса:

# Генерация речи
curl -X POST http://localhost:17493/generate \
  -H "Content-Type: application/json" \
  -d '{"text": "Привет, мир!", "profile_id": "abc123", "language": "ru"}'

# Получить список голосовых профилей
curl http://localhost:17493/profiles

Архитектура и стек технологий


graph TD
    A[Пользователь] --> B[Tauri Desktop App]
    B --> C[React Frontend]
    C --> D[Python FastAPI Backend]
    D --> E[TTS-движки]
    E --> E1[Qwen3-TTS]
    E --> E2[Chatterbox Turbo]
    E --> E3[Kokoro]
    E --> E4[LuxTTS]
    E --> E5[HumeAI TADA]
    D --> F[OpenAI Whisper STT]
    D --> G[Локальная LLM]
    D --> H[MCP Server]
    H --> I[Claude / Cursor / Agents]

Для сборки из исходников потребуются: Bun, Rust, Python 3.11+, зависимости Tauri и Xcode на macOS.

Установка — нативное Tauri-приложение для macOS, Windows и Linux (или Docker-образ); при первом запуске скачиваются локальные TTS-модели.

⚠ Linux: только из исходников
Для Linux готовые бинарники пока недоступны — нужно собирать из исходного кода по инструкции на voicebox.sh/linux-install.

Тарифы и цены

Voicebox — полностью бесплатная open-source альтернатива, работающая целиком на вашей машине. Никаких подписок, лимитов на символы или платы за использование нет.

ТарифЦенаЛимиты
VoiceboxБесплатноБез лимитов (ограничено лишь вашим железом)
ElevenLabs Free$0/мес~10 мин TTS, нет коммерческих прав
ElevenLabs Starter$6/мес~30 мин TTS, коммерческие права
ElevenLabs Creator$22/мес~100 мин TTS, профессиональное клонирование
ElevenLabs Pro$99/мес~500 мин TTS

Актуальные цены ElevenLabs (проверено 18 июля 2026): Free — $0, Starter — $6, Creator — $22, Pro — $99, Scale — $299, Business — $990 в месяц.

💡 Экономия
Voicebox полностью бесплатен и без лимитов на генерацию. Единственное ограничение — мощность вашего GPU. Для тяжёлых моделей рекомендуется видеокарта с 8+ ГБ VRAM.

Плюсы и минусы

✅ Плюсы❌ Минусы
Полностью бесплатно, без лимитовТребует мощного GPU для комфортной работы
Локальная обработка — данные не покидают машинуНет готовых бинарников для Linux
7 TTS-движков, переключаемых на летуПроект ведёт один разработчик (bus factor = 1–2)
23 языка, включая арабский, хинди, японскийНекоторые баги на Apple Silicon M4/M5
Диктовка с вставкой в любое поле (macOS/Windows)Первый запуск требует загрузки моделей (~несколько ГБ)
MCP-интеграция с Claude, Cursor и другими агентамиОфлайн-режим ещё не доработан (возможны паузы)
Stories Editor — мультитрек как в DAWУточнение транскриптов может переводить не-английский текст в английский
Открытый код, активное комьюнитиКачество клонирования всё ещё уступает ElevenLabs Pro

Сравнение с альтернативами

ПараметрVoiceboxElevenLabsCoqui XTTS-v2
ЦенаБесплатно$0–$990/месБесплатно (OSS)
Тип развёртыванияЛокально (Desktop)ОблакоЛокально (библиотека)
TTS-движков7Проприетарные модели1 (XTTS-v2)
Языков2329+17
Клонирование голоса✅ Zero-shot✅ Instant/Professional✅ (6 сек референса)
GUI✅ Нативное приложение✅ Веб-интерфейс❌ Только CLI/API
Диктовка (STT)✅ Whisper❌ Отдельный продукт
MCP-агенты
Stories Editor✅ (Studio)
REST API✅ Локальный✅ Облачный✅ Python-библиотека
Приватность🔒 Абсолютная☁️ Данные в облаке🔒 Абсолютная
Коммерческое использование✅ (зависит от лицензии движка)✅ (с платного плана)⚠️ Ограничена лицензией

ElevenLabs — лидирующая облачная платформа клонирования и TTS: организации выбирают Voicebox, чтобы убрать посимвольную тарификацию и не хранить биометрические отпечатки голоса на стороннем сервере.

Coqui XTTS — это движок и тулкит для самостоятельной интеграции, а не упакованная десктопная студия с GUI.

📝 Пример: подкаст с несколькими спикерами
  1. Запишите 5–10 секунд голоса каждого участника
  2. Создайте голосовые профили в Voicebox
  3. В Stories Editor напишите сценарий диалога, назначьте голос каждой реплике
  4. Экспортируйте финальное аудио одним кликом

Всё это — без облака, без подписки, без ограничений по длине.


Вердикт

Рейтинг: 8/10

Voicebox — ставка на то, что растущий сегмент пользователей (разработчики, privacy-conscious создатели, команды, которые не могут отправлять аудио на внешние серверы) хотят чего-то другого: local-first, бесплатно, с открытым кодом.

Кому подойдёт:

  • 🧑‍💻 Разработчикам — для голосовых агентов, домашних ассистентов, автоматизации через REST API
  • 🎙️ Подкастерам и аудиокнигмейкерам — Stories Editor с мультитреком и клонирование голосов
  • 🔒 Privacy-focused пользователям — все данные строго локально
  • 🌐 Мультиязычным проектам — 23 языка, включая редкие
  • 🤖 AI-энтузиастам — MCP-интеграция с Claude, Cursor и другими агентами

Кому не подойдёт:

  • Профессиональным студиям, где критично максимальное качество клонирования (ElevenLabs Pro всё ещё впереди)
  • Пользователям без GPU или мощного железа
  • Командам, которым нужна enterprise-поддержка и SLA

ElevenLabs по-прежнему превосходит по потолку качества вывода — для профессиональной коммерческой работы. Но качество Voicebox действительно отличное, просто не идентичное.

Для большинства сценариев — личных проектов, инди-разработки, приватного использования — Voicebox уже сегодня является полноценной заменой платным облачным сервисам.

GitHub: github.com/jamiepine/voicebox
Сайт: voicebox.sh