Голосовые AI-агенты реального времени — теперь проще

LiveKit Agents достиг версии 1.0 в апреле 2025 года и к середине 2026 года вышел на линейку 1.6.x с адаптивной обработкой прерываний и нативной поддержкой Model Context Protocol (MCP). SDK включает компоненты для решения ключевых задач голосового AI в реальном времени: потоковая передача аудио через пайплайн STT-LLM-TTS, надёжное определение очереди речи, обработка прерываний и оркестрация LLM. На GitHub уже вышел релиз livekit-agents@1.7.0.


Что такое LiveKit Agents

Фреймворк Agents позволяет добавлять любые Python или Node.js программы в LiveKit-комнаты в качестве полноценных участников в реальном времени. Агентов можно создавать с помощью Python и Node.js SDK или использовать LiveKit Agent Builder для прототипирования и деплоя прямо в браузере — без написания кода.

OpenAI построил Advanced Voice для ChatGPT на LiveKit Cloud — им пользуются миллионы людей по всему миру каждый день.

«Голосовые агенты меняют то, как люди взаимодействуют с программным обеспечением — от AI-ассистентов для обработки звонков до систем, бронирующих встречи.»


Ключевые возможности

SDK решает ключевые задачи голосового AI в реальном времени и поддерживает плагины для большинства крупных AI-провайдеров, причём их список постоянно пополняется.

ФункцияОписание
STT / LLM / TTSГибкая интеграция Deepgram, OpenAI, Cartesia, Google и др.
Semantic Turn DetectionТрансформер-модель для определения конца реплики пользователя
MCP SupportНативная поддержка Model Context Protocol — одна строка кода
TelephonyНативная интеграция SIP для входящих и исходящих звонков
Multi-agent HandoffПередача управления между агентами внутри сессии
Встроенные тестыФреймворк для автоматизированного тестирования с LLM-судьёй
WebRTCОткрытый SDK-экосистема для всех платформ
Open-sourceApache 2.0, весь стек можно запустить на своих серверах

В версии 1.7.0 появился Expressive Mode — агент говорит с естественной интонацией и эмоциями. Подача речи определяется тегами эмоций, генерируемыми из контекста разговора. Включается одним параметром в AgentSession.

💡 Быстрый старт

Установить фреймворк со всеми популярными плагинами можно одной командой:

pip install "livekit-agents[openai,deepgram,cartesia]"

Требуется Python 3.10–3.14.


Архитектура пайплайна

Типичный голосовой агент на LiveKit работает по схеме STT → LLM → TTS, замкнутой через WebRTC:


graph LR
    U([👤 Пользователь]) -->|Аудио| STT[STT\nDeepgram / Whisper]
    STT -->|Текст| LLM[LLM\nGPT / Gemini / Gemma]
    LLM -->|Ответ| TTS[TTS\nCartesia / ElevenLabs]
    TTS -->|Речь| U
    LLM -->|Tools| Tools[🔧 Function Tools / MCP]
    Tools -->|Результат| LLM
    style STT fill:#4f8ef7,color:#fff
    style LLM fill:#a855f7,color:#fff
    style TTS fill:#22c55e,color:#fff

Большинство голосовых агентов следуют пайплайну STT-LLM-TTS: Speech-to-Text преобразует аудио пользователя в текст, LLM генерирует умный ответ, Text-to-Speech конвертирует ответ обратно в звук. Такой модульный подход даёт максимальную гибкость.


Пример простого агента

from livekit.agents import Agent, AgentServer, AgentSession, JobContext, inference

server = AgentServer()

@server.rtc_session()
async def entrypoint(ctx: JobContext):
    session = AgentSession(
        vad=inference.VAD(),
        stt=inference.STT("deepgram/nova-3", language="multi"),
        llm=inference.LLM("google/gemma-4-31b-it"),
        tts=inference.TTS("cartesia/sonic-3"),
    )
    agent = Agent(instructions="You are a friendly voice assistant.")
    await session.start(agent=agent, room=ctx.room)
    await session.generate_reply(instructions="greet the user")

Стартовый шаблон использует быструю open-weight модель Gemma 4 31B, которую LiveKit хостит и оптимизирует для голосового AI, а также Fish Audio S2.1 Pro для TTS с поддержкой inline-разметки эмоций.

ℹ Мультиагентные сценарии
Фреймворк поддерживает Multi-agent Handoff — один агент может передавать управление другому прямо внутри сессии. Например: агент-приветствие собирает данные, затем передаёт пользователя специализированному агенту-рассказчику с другой LLM-моделью и голосом.

Тестирование агентов

Автоматизированные тесты — важная часть разработки. LiveKit Agents предоставляет встроенный тест-фреймворк на базе pytest с поддержкой LLM-судьи (judge), который проверяет намерения ответа:

@pytest.mark.asyncio
async def test_agent_greeting():
    async with AgentSession(llm=google.LLM()) as sess:
        await sess.start(MyAgent())
        result = await sess.run(user_input="Hello!")
        await (
            result.expect.next_event()
            .is_message(role="assistant")
            .judge(llm, intent="agent should greet the user warmly")
        )
⚠ Важно при обновлении
Пакет активно развивается: с марта по июль 2026 года вышло 26 релизов, включая минорный переход на версию 1.6. Рекомендуется фиксировать точную версию (pip install livekit-agents==X.Y.Z) и обновляться осознанно.

Поддержка телефонии и новые интеграции

С 27 августа 2026 года разработчики на LiveKit Inference могут подключить Speechmatics менее чем за минуту. Модель Linden — первая от Speechmatics, созданная специально для голосовых агентов, — теперь доступна через LiveKit Inference.

Среди причин выбора LiveKit вместо управляемых платформ — экономия: свыше 10 000 минут в месяц фреймворк обходится на 60–80% дешевле. Ниже этого порога управляемые платформы могут быть выгоднее с учётом инженерного времени.

LiveKit Cloud соответствует требованиям SOC 2 Type II, GDPR, CCPA и HIPAA.


Итог

LiveKit Agents — наиболее мощный open-source фреймворк для создания сложных, низколатентных голосовых AI-приложений. Комбинация модульной архитектуры, WebRTC-транспорта и гибкой экономики делает его исключительно ценным для разработчиков, которым важны контроль и операционная эффективность.

LiveKit Inference поддерживает более 50 AI-моделей из коробки, без API-ключей и дополнительной настройки. Фреймворк подойдёт командам, которым нужна полная гибкость в выборе моделей, поддержка телефонии и возможность деплоя на собственных серверах.