LiveKit Agents: фреймворк для голосовых AI-агентов реального времени
LiveKit Agents — open-source Python/TS фреймворк для голосовых AI-агентов с поддержкой WebRTC, MCP, телефонии и мультиагентных сценариев.
Голосовые AI-агенты реального времени — теперь проще
LiveKit Agents достиг версии 1.0 в апреле 2025 года и к середине 2026 года вышел на линейку 1.6.x с адаптивной обработкой прерываний и нативной поддержкой Model Context Protocol (MCP). SDK включает компоненты для решения ключевых задач голосового AI в реальном времени: потоковая передача аудио через пайплайн STT-LLM-TTS, надёжное определение очереди речи, обработка прерываний и оркестрация LLM. На GitHub уже вышел релиз livekit-agents@1.7.0.
Что такое LiveKit Agents
Фреймворк Agents позволяет добавлять любые Python или Node.js программы в LiveKit-комнаты в качестве полноценных участников в реальном времени. Агентов можно создавать с помощью Python и Node.js SDK или использовать LiveKit Agent Builder для прототипирования и деплоя прямо в браузере — без написания кода.
OpenAI построил Advanced Voice для ChatGPT на LiveKit Cloud — им пользуются миллионы людей по всему миру каждый день.
«Голосовые агенты меняют то, как люди взаимодействуют с программным обеспечением — от AI-ассистентов для обработки звонков до систем, бронирующих встречи.»
Ключевые возможности
SDK решает ключевые задачи голосового AI в реальном времени и поддерживает плагины для большинства крупных AI-провайдеров, причём их список постоянно пополняется.
| Функция | Описание |
|---|---|
| STT / LLM / TTS | Гибкая интеграция Deepgram, OpenAI, Cartesia, Google и др. |
| Semantic Turn Detection | Трансформер-модель для определения конца реплики пользователя |
| MCP Support | Нативная поддержка Model Context Protocol — одна строка кода |
| Telephony | Нативная интеграция SIP для входящих и исходящих звонков |
| Multi-agent Handoff | Передача управления между агентами внутри сессии |
| Встроенные тесты | Фреймворк для автоматизированного тестирования с LLM-судьёй |
| WebRTC | Открытый SDK-экосистема для всех платформ |
| Open-source | Apache 2.0, весь стек можно запустить на своих серверах |
В версии 1.7.0 появился Expressive Mode — агент говорит с естественной интонацией и эмоциями. Подача речи определяется тегами эмоций, генерируемыми из контекста разговора. Включается одним параметром в AgentSession.
Установить фреймворк со всеми популярными плагинами можно одной командой:
pip install "livekit-agents[openai,deepgram,cartesia]"
Требуется Python 3.10–3.14.
Архитектура пайплайна
Типичный голосовой агент на LiveKit работает по схеме STT → LLM → TTS, замкнутой через WebRTC:
graph LR
U([👤 Пользователь]) -->|Аудио| STT[STT\nDeepgram / Whisper]
STT -->|Текст| LLM[LLM\nGPT / Gemini / Gemma]
LLM -->|Ответ| TTS[TTS\nCartesia / ElevenLabs]
TTS -->|Речь| U
LLM -->|Tools| Tools[🔧 Function Tools / MCP]
Tools -->|Результат| LLM
style STT fill:#4f8ef7,color:#fff
style LLM fill:#a855f7,color:#fff
style TTS fill:#22c55e,color:#fff
Большинство голосовых агентов следуют пайплайну STT-LLM-TTS: Speech-to-Text преобразует аудио пользователя в текст, LLM генерирует умный ответ, Text-to-Speech конвертирует ответ обратно в звук. Такой модульный подход даёт максимальную гибкость.
Пример простого агента
from livekit.agents import Agent, AgentServer, AgentSession, JobContext, inference
server = AgentServer()
@server.rtc_session()
async def entrypoint(ctx: JobContext):
session = AgentSession(
vad=inference.VAD(),
stt=inference.STT("deepgram/nova-3", language="multi"),
llm=inference.LLM("google/gemma-4-31b-it"),
tts=inference.TTS("cartesia/sonic-3"),
)
agent = Agent(instructions="You are a friendly voice assistant.")
await session.start(agent=agent, room=ctx.room)
await session.generate_reply(instructions="greet the user")
Стартовый шаблон использует быструю open-weight модель Gemma 4 31B, которую LiveKit хостит и оптимизирует для голосового AI, а также Fish Audio S2.1 Pro для TTS с поддержкой inline-разметки эмоций.
Тестирование агентов
Автоматизированные тесты — важная часть разработки. LiveKit Agents предоставляет встроенный тест-фреймворк на базе pytest с поддержкой LLM-судьи (judge), который проверяет намерения ответа:
@pytest.mark.asyncio
async def test_agent_greeting():
async with AgentSession(llm=google.LLM()) as sess:
await sess.start(MyAgent())
result = await sess.run(user_input="Hello!")
await (
result.expect.next_event()
.is_message(role="assistant")
.judge(llm, intent="agent should greet the user warmly")
)
pip install livekit-agents==X.Y.Z) и обновляться осознанно.Поддержка телефонии и новые интеграции
С 27 августа 2026 года разработчики на LiveKit Inference могут подключить Speechmatics менее чем за минуту. Модель Linden — первая от Speechmatics, созданная специально для голосовых агентов, — теперь доступна через LiveKit Inference.
Среди причин выбора LiveKit вместо управляемых платформ — экономия: свыше 10 000 минут в месяц фреймворк обходится на 60–80% дешевле. Ниже этого порога управляемые платформы могут быть выгоднее с учётом инженерного времени.
LiveKit Cloud соответствует требованиям SOC 2 Type II, GDPR, CCPA и HIPAA.
Итог
LiveKit Agents — наиболее мощный open-source фреймворк для создания сложных, низколатентных голосовых AI-приложений. Комбинация модульной архитектуры, WebRTC-транспорта и гибкой экономики делает его исключительно ценным для разработчиков, которым важны контроль и операционная эффективность.
LiveKit Inference поддерживает более 50 AI-моделей из коробки, без API-ключей и дополнительной настройки. Фреймворк подойдёт командам, которым нужна полная гибкость в выборе моделей, поддержка телефонии и возможность деплоя на собственных серверах.