LiveKit Voice AI в 2026: практическое руководство для инженеров

5/2/2026
·
Обновлено
8.11.2026

Голосовой ИИ, который действительно звучит как человек, — это в первую очередь вопрос задержки, а уже во вторую — моделей. Если уложиться в 800 мс на pipeline-стеке или в 300 мс на модели speech-to-speech — от микрофона до динамика — разговор будет казаться естественным. Превысите эти пределы — собеседник заметит каждую паузу. LiveKit Agents 1.х — это open-source-фреймворк, который чаще всего выбирают серьёзные команды, чтобы достичь таких показателей и при этом не зависеть от одного поставщика.

Этот плейбук — краткая версия того, что Фора Софт рассказывает новым инженерам в первый день проекта по голосовому ИИ. Мы запускаем агентов на LiveKit для поддержки клиентов, исходящих продаж, приёма в медицинских учреждениях и встроенных в продукт ассистентов — и прошли через каждую ловушку с задержками, каждый случай перерасхода бюджета и каждый сюрприз с compliance минимум по два раза. Целевой читатель — основатель, CTO или старший инженер, которому к пятнице нужен честный ответ на вопрос: «Стоит ли это строить и на чём».

Главное

  • Pipeline (STT → LLM → TTS) даёт контроль и обходится в 3,7–11 ₽ за минуту со всеми расходами; speech-to-speech даёт задержку 300 мс, но привязывает к одному вендору.
  • LiveKit Agents — правильный выбор, когда нужны кастомные сценарии, контроль или больше 10 000 минут в месяц. Меньше — Retell или Vapi запустятся быстрее.
  • Оптимальная связка провайдеров в 2026 году: Deepgram Nova-3 для распознавания речи, Claude Haiku 4.5 для языковой модели, Cartesia Sonic-3 или Deepgram Aura-2 для синтеза речи — итоговая задержка 550–700 мс.
  • Шумоподавление Krisp с 1 мая 2026 будет тарифицироваться отдельно. Закладывайте в бюджет 0,15–0,30 ₽ за минуту или отключайте его, если используете в тихих условиях.
  • Compliance — на вас, а не на платформе. TCPA, HIPAA, согласие на запись от обеих сторон и GDPR начинают действовать с момента первого исходящего звонка.

Почему команды выбирают LiveKit для голосового ИИ в 2026

Любая команда, работающая с голосовым ИИ, рано или поздно сталкивается с одним и тем же выбором. Либо вы подключаете агента к сторонней управляемой платформе (Vapi, Retell, Bland, Synthflow) и миритесь с её задержками, шаблонами промптов и комиссией, либо строите систему на собственном реальном времени, которым управляете сами. LiveKit — это второй вариант: стек медиа в реальном времени под лицензией Apache-2.0 с production-готовым фреймворком Agents сверху.

Что вы получаете из коробки: WebRTC между пользователями и агентом, HTTP/WebSocket между агентом и бэкендом, подключаемые провайдеры STT/LLM/TTS, обученную модель определения конца реплики, лицензированное шумоподавление Krisp, метрики задержки по каждому ходу, запись звонков и мост в PSTN через Telnyx или Twilio. Open source, без привязки к вендору, плагины сообщества для каждого крупного провайдера.

Что вы отдаёте взамен: пишете на Python или Node, берёте на себя операционную нагрузку, если хостите сами, и закладываете на production-агента одну–три инженерные недели вместо трёх часов, которые рекламирует Retell. Для всего, что серьёзнее proof of concept, эта сделка выгодна — почему именно, покажем ниже в разборе затрат.

Что на самом деле значит «звучит как человек»

В естественном разговоре люди ожидают ответа от собеседника в течение 200–300 мс. Если задержка превышает 500 мс, человек начинает замечать паузу. А если прошло больше секунды — он может перебить, повесить трубку или нажать «ноль», чтобы дозвониться до оператора. Именно это и определяет реальную границу производительности голосового ИИ — не качество модели, не естественность голоса и не количество доступных функций.

«Звучит как человек» — это четыре вещи, сложенные вместе:

  • Быстрый первый отклик. 300–800 мс — время от конца реплики пользователя до начала ответа агента, зависит от архитектуры.
  • Аккуратное прерывание. Агент замолкает через 120–200 мс, если собеседник начинает говорить поверх, и возвращается к нужному контексту.
  • Просодия, совпадающая со смыслом. Ударения на нужных словах, дыхательные паузы, соответствующие смысловой структуре, выразительный голос в эмоционально значимых моментах.
  • Опора на факты. Агент знает, когда сказать «давайте проверю», и действительно проверяет — через вызов функций, а не через галлюцинации.

Промах хотя бы в одном из четырёх пунктов — и иллюзия рассыпается. Большинство команд сосредотачиваются на третьем («нам нужен голос получше»), хотя настоящая проблема — в первом. ElevenLabs не узкое место с TTFB в 75 мс; ваш LLM с 1,2 с — да.

Бюджет задержки в 800 мс — и где он уходит

Классический pipeline проходит пять стадий. Вот реалистичный лучший случай для провайдеров в 2026 году, измеренный сквозным образом при развёртывании в регионе США:

Стадия Лучший случай Типичное Где утекает
VAD и определение конца реплики 50 мс 80–150 мс Медленная или шумная речь, акценты, настройка модели VAD
Транскрипция STT (стриминг) 150 мс 200–300 мс Без стриминга, межрегиональные хопы, батч уровня Whisper
TTFT у LLM 400 мс 600–1200 мс Длинные промпты, большой контекст, холодный провайдер, без стриминга
Первый байт TTS 75 мс 150–250 мс Без стриминга TTS, выразительные голоса, регионы с низкой нагрузкой
Сеть и воспроизведение 50 мс 80–200 мс Мобильная связь, переход в PSTN, удалённый TURN-сервер
Итого (pipeline) ~725 мс 1,1–1,7 с  
Speech-to-speech (Realtime / Gemini Live) 200 мс 300–500 мс Длинный контекст, переход в PSTN, холодный старт

Рисунок 1. Бюджет задержки голосового ИИ: pipeline против speech-to-speech (бенчмарки 2026 года, регион США).

В каждом production-деплое, который мы аудируем, две самые быстрые утечки — TTFT у LLM и межрегиональные сетевые хопы. Обе устраняются. Возьмите модель с низким TTFT, держите STT, LLM и TTS в одном облачном регионе и стримите всё. Если после этого вы всё ещё не укладываетесь в 800 мс — проблема в длине промпта, а не в инфраструктуре.

Берите pipeline, когда…

Нужен кастомный вызов функций, лучшая в классе точность распознавания речи, контроль затрат при больших объёмах, возможность замены компонентов под каждую задачу или соответствие требованиям, запрещающим отправлять аудио целиком в одну модель.

Pipeline или speech- to- speech: что подходит вашему продукту

Модели speech-to-speech (OpenAI Realtime, Gemini 3.1 Flash Live) полностью пропускают этап транскрипции: на вход подаётся аудио, на выходе — тоже аудио. Весь цикл обработки умещается в 200 мс. Звучат они невероятно естественно и корректно реагируют на перебивания — без единого дополнительного кода. Но есть подвох: вы покупаете всё сразу — рассуждение, голос, обработку прерываний, вызов функций — готовым пакетом у одного поставщика.

Pipeline — это не размен, а выгодный обмен. Вы объединяете трёх-четырёх провайдеров, тратите 500–700 мс на накладные расходы, но взамен получаете гибкость: можете быстро заменить LLM, когда Anthropic выпустит новую модель Claude, использовать специализированного провайдера для STT (например, Deepgram Medical или AssemblyAI для извлечения сущностей), применять клонированный фирменный голос в TTS и независимо логировать каждый этап для аудита.

Наше практическое правило: speech-to-speech — для потребительских ассистентов, где важнее личность, чем точность. Pipeline — для всех случаев, где система общается с базой данных, называет цену или может вызвать серьёзные последствия, если ошибётся. LiveKit поддерживает оба варианта — pipeline изначально проектировался под этот подход и до сих пор оптимизируется лучше.

Эталонная архитектура на LiveKit Agents 1.0

У production-агента на LiveKit пять движущихся частей и одна схема трафика. Пользователь заходит в комнату LiveKit. Воркер агента берёт задачу, подписывается на аудиотрек пользователя, прогоняет его через STT, передаёт частичные транскрипты в LLM, стримит токены LLM в TTS и публикует аудио TTS обратно в комнату — всё это пока модель определения конца реплики решает, закончил ли пользователь говорить.

from livekit.agents import Agent, AgentSession, JobContext, WorkerOptions, cli
from livekit.plugins import deepgram, anthropic, cartesia, silero

async def entrypoint(ctx: JobContext):
    await ctx.connect()

    session = AgentSession(
        vad=silero.VAD.load(),
        stt=deepgram.STT(model="nova-3", language="en-US"),
        llm=anthropic.LLM(model="claude-haiku-4-5"),
        tts=cartesia.TTS(model="sonic-3", voice="professional-warm"),
        turn_detection="livekit",   # trained turn model
    )

    agent = Agent(
        instructions="You are a polite scheduling assistant. "
                     "Always call check_availability before suggesting a time.",
        tools=[check_availability, book_meeting],
    )

    await session.start(agent=agent, room=ctx.room)

if __name__ == "__main__":
    cli.run_app(WorkerOptions(entrypoint_fnc=entrypoint))

Это и есть полная форма. Диспетчер LiveKit передаёт задачу свободному воркеру, AgentSession связывает плагины, а модель определения конца реплики livekit решает, когда собеседник закончил говорить. Всё остальное — бизнес-логика: инструменты, промпты, конечные автоматы, передача на связь с оператором. Подробный разбор этого же подхода — в нашем гайде по AI-агентам на LiveKit.

Нужен готовый голосовой агент, а не исследовательский проект?

Фора Софт разрабатывает агентов на LiveKit для EdTech, приёма в медицине, исходящих продаж и B2B-поддержки. Мы достигаем задержки менее 700 мс и уровня соответствия требованиям production за 3–6 недель — вместо 3–6 месяцев.

Позвоните нам → Напишите нам →

STT: Deepgram, AssemblyAI, Gladia или Soniox

Распознавание речи — единственная стадия, где чистая задержка почти не влияет на точность. Разница между 150 мс и 300 мс в работе STT почти не ощущается при разговоре; а вот разница между 5% и 12% WER — это уже разница между «работает» и «позвонил не тому клиенту».

Провайдер Задержка Точность (en) Цена Лучше всего для
Deepgram Nova-3 <300 мс 5,26% WER 0,32 ₽/мин Универсально, дешевле всех
AssemblyAI Universal-3 Pro P50 150 мс 5,65% WER 27 ₽/час Извлечение сущностей (email, ID)
Gladia Solaria-1 103 мс на частичный результат −29% WER на разговорах По договору Акценты, шум, переключение языков
Soniox стриминг Лучше всего подходит для многоязычных По договору Юридическая, медицинская, многоязычная сфера
OpenAI Whisper ~500 мс по чанкам Хорошая 1,5–4,5 ₽/час Офлайн, батч, ограниченный бюджет

По умолчанию мы используем Deepgram Nova-3 для англоязычного трафика в США, AssemblyAI Universal-3 Pro — когда агенту нужно называть номера счетов или email, и Gladia — для контакт-центров со сильными акцентами и переключением языков. Whisper подходит для батч-обработки и выгрузки транскриптов, но не для живых звонков.

LLM: Claude Haiku, Gemini Flash или GPT-5

LLM — это место, где у большинства проектов голосового ИИ ломается бюджет. TTFT (время до первого токена) важнее общей пропускной способности — агент должен начать говорить быстро, а не закончить быстро. TTFT в 600 мс со стримингом по 80 токенов в секунду ощущается быстрее, чем TTFT в 300 мс, который застревает на первой фразе.

Модель TTFT Токенов/сек Цена (вход) Лучше всего для
Claude Haiku 4.5 597 мс 78,9 60 ₽ / 1M токенов По умолчанию — самый быстрый TTFT при качестве уровня голоса
Gemini 2.5 Flash ~800 мс 146,5 5,6 ₽ / 1M токенов Длинные ответы, дёшево, мультимодальность
GPT-5 0,9–1,2 с ~60 Премиум Сложные рассуждения, многошаговый вызов функций
Groq (Llama 3.3 70B) ~250 мс ~300 44 ₽ / 1M токенов Низкая задержка при скромном бюджете, модели с открытым исходным кодом

Haiku 4.5 — наша модель по умолчанию для голосовых задач. Groq остаётся в шорт-листе для случаев, где важна задержка (например, исходящие продажи, NPC в играх), а качество рассуждений на уровне Llama достаточно. К GPT-5 обращайтесь только тогда, когда агент действительно рассуждает — многоступенчатые цепочки инструментов, жёсткие правила, дорогие последствия. Для повседневной беседы он слишком медленный.

TTS: ElevenLabs, Cartesia, Aura, Rime или Grok

TTS — это та часть, по которой пользователи в первую очередь судят о системе. При этом именно на этом этапе цены могут отличаться в 10 раз за разницу в качестве, которую большинство людей даже не замечают.

Провайдер TTFB Цена Сильная сторона
ElevenLabs Flash v2.5 75 мс 3,7 ₽ / 1000 символов Естественность, клонирование, 4000+ голосов
Cartesia Sonic-3 40–90 мс 0,45 ₽ / мин Дешевле и быстрее всех на SSM
Deepgram Aura-2 90 мс 2,2 ₽ / 1000 символов Лучшая цена за качество, оптимизирован под медицину и IVR
Rime Mist <200 мс 0,37 ₽ / мин Эмоция в разговоре, американские акценты
Grok TTS (xAI) стриминг 315 ₽ / 1 млн символов Переключение языков, плагин для LiveKit

Мы выбираем Cartesia Sonic-3, когда важны низкая задержка и низкая стоимость, а уникальный фирменный голос не нужен; Deepgram Aura-2 — за лучшее соотношение естественности и цены; ElevenLabs Flash — когда клиент использует лицензированный клонированный голос или голос знаменитости. Доплачивать стоит только там, где это реально влияет на бизнес. В B2B-агенте для записи на встречу люди не бронируют время из-за того, что у голоса лучше вибрато.

Определение конца реплики, VAD и аккуратное прерывание

Voice activity detection отвечает на вопрос «говорит ли кто-то прямо сейчас?». Определение конца реплики решает задачу сложнее: «он закончил говорить или просто сделал паузу?». Эта разница — между естественным разговором и тем, что звучит так, будто на каждую вторую фразу наступают.

LiveKit поставляет обученную модель определения конца реплики, которая на естественной речи с большим отрывом обходит VAD с фиксированным порогом. Она анализирует просодию, слова-паразиты и лексические подсказки — а не только громкость — и динамически подстраивает окно ожидания от 0 до 2 секунд. В связке с Background Voice Cancellation от Krisp она справляется и со сценарием «коллега разговаривает в офисе», на котором ломается любой наивный VAD.

Прерывание (barge-in) — вторая часть истории. Когда собеседник вмешивается, агент должен замолчать за 150 мс, сбросить буфер TTS и передать новую реплику обратно в STT. LiveKit делает это автоматически. Единственный частый баг — агент перебивает сам себя; обычно это означает, что шумный TTS-сигнал попадает в микрофон пользователя. Проблему решает акустическое эхоподавление на клиенте или BVC на стороне агента.

Шумоподавление и Krisp: теперь отдельная статья расходов

LiveKit Cloud поставляется с лицензированными моделями Krisp для двух задач: подавление фонового шума (вентиляторы, машины, клавиатура) и подавление посторонних голосов (например, разговор супруга по телефону или шум в open-space). Обе функции повышают точность распознавания речи (STT) на 10–20% в шумных условиях и значительно снижают количество ложных прерываний.

С 1 мая 2026 использование Krisp будет тарифицироваться дополнительно к базовой минуте агента. Планируйте расходы в размере 0,15–0,30 ₽ за минуту, если оставляете его включённым. Если работаете в тихих условиях (например, десктопные ассистенты в приложении или студийные микрофоны), лучше отключить Krisp, чтобы не платить за него. А для звонков по PSTN и мобильному трафику оставляйте включённым — затраты окупятся за счёт повышения точности распознавания речи.

Отключайте Krisp, когда…

Пользователи используют гарнитуры в контролируемой среде (рабочие места контакт-центров, студийные микрофоны, WebRTC из приложения на ноутбуке) или шумоподавление уже работает на стороне клиента как отдельная стадия.

Function calling, который реально доезжает до production

Голосовой агент, который ничего не умеет делать, — это чат-бот, умеющий говорить. Function calling — это разница между «спасибо за звонок» и «я записал вас на вторник на 14:00». Три правила удерживают его в работоспособном состоянии в production:

  • Повторите вслух всё, что собеседник продиктовал. «Я услышал четыре-один-пять, два-два-пять… верно?» STT распознаёт цифры с ошибками; AssemblyAI Universal-3 Pro заметно лучше других на сущностях, но идеала нет.
  • Вызывайте инструмент синхронно, рассказывайте об этом параллельно. Скажите «подождите секунду, проверю», пока инструмент работает. Не оставляйте две секунды тишины — собеседник подумает, что связь оборвалась.
  • Ограничьте число попыток и бюджет. Одна галлюцинирующая модель и один неисправный инструмент могут вызвать один и тот же API 40 раз за 10 секунд. Установите жёсткие лимиты на количество вызовов инструментов за ход и на стоимость сессии.

Claude и GPT-5 поддерживают параллельный вызов инструментов, поэтому грамотно описанная схема позволяет агенту одновременно запустить «проверь календарь», «найди клиента» и «подними условия полиса» и собрать ответ за один ход. Это самый крупный недооценённый выигрыш по задержке, который мы видим у команд.

Реальная стоимость минуты: всё включено, без сюрпризов

Каждая управляемая платформа предлагает привлекательную цену — Vapi за 3,7 ₽, Retell за 5,2 ₽, Bland за 6,7 ₽ — и учитывает только свою комиссию. Реальная сквозная стоимость с учётом STT, LLM, TTS и телефонии оказывается в диапазоне 8–18 ₽ за минуту. Вот как в 2026 году выглядят три типичных стека на LiveKit:

Стек STT LLM TTS Платформа Итого/мин
Бюджетный Deepgram Nova-3 Groq Llama 3.3 Cartesia Sonic-3 LiveKit Cloud ~3,7 ₽
Production Deepgram Nova-3 Claude Haiku 4.5 Deepgram Aura-2 LiveKit Cloud ~7,5 ₽
Премиум AssemblyAI Pro GPT-5 / Claude 4.5 ElevenLabs Flash LiveKit Cloud ~13–16 ₽

Умножьте на свой объём звонков. Исходящий дайлер на 50 000 минут в месяц на стеке Production обходится в 375 000 ₽ инфраструктуры — примерно столько же, сколько стоит один SDR со всеми сопутствующими расходами, и при этом система работает 24/7 на пятнадцати языках.

LiveKit против Vapi, Retell, Bland и Synthflow

На 10 000 минут в месяц (нагруженный кейс среднего бизнеса) платформы аккуратно сортируются по полной стоимости владения:

Платформа Полная стоимость Время до первого звонка Потолок
LiveKit (собственная сборка) 37 500–45 000 ₽ 2–4 недели Никакого open source
Retell AI ~86 000 ₽ 3 часа Кастомные инструменты ограничены
Bland AI ~90 000 ₽ 1 день Ориентирован на исходящий дайлер
Synthflow ~97 000 ₽ 1–2 дня No-Code, привязка к платформе
Vapi ~105 000 ₽ 1 день Гибкий API, самая высокая цена

Рисунок 2. Сравнение TCO на 10 000 минут в месяц по ставкам 2026 года.

Цифры говорят сами за себя: Retell или Vapi — хороший выбор для проверки гипотез и прототипов при нагрузке до 5000 минут. Как только кейс становится реальным, лучше переходить на LiveKit. Точка перелома — где-то между 10 000 и 20 000 минут в месяц: выше этой планки маржа от LiveKit окупает инженерные затраты уже за полгода.

LiveKit Cloud, self-hosted или Telnyx

Три способа запустить LiveKit Agents в продакшене — у каждого свой баланс плюсов и минусов:

  • LiveKit Cloud. 0,37 ₽/мин только за аудио, 0,75 ₽/мин с агентом. Управляемая диспетчеризация, наблюдаемость, региональные точки присутствия, SOC 2, BAA. Никакой операционной работы. Выбор по умолчанию.
  • Self-hosted. Платформенная комиссия — ноль, STT/LLM/ТTS платите напрямую. Окупается при нагрузке выше 50 000 минут в месяц, если DevOps уже настроен; ниже — выгоднее облако. Выбирайте этот вариант для регулируемых сценариев, где платформа не должна обрабатывать аудио.
  • LiveKit на Telnyx (апрель 2026). Telnyx размещает инфраструктуру LiveKit и предоставляет телефонию в комплекте. Стоимость STT/ТТС на 50% ниже, чем у LiveKit Cloud при использовании того же стека — имеет смысл рассмотреть, если вам нужна массовая интеграция с PSTN.

Один нюанс с февраля 2026: данные наблюдаемости LiveKit обрабатываются в США независимо от вашего медиарегиона. Если по GDPR запрещено обрабатывать метаданные звонков в США — отключайте проектную наблюдаемость и логируйте данные в свой стек. Само медиа (аудио и видео) остаётся в выбранном вами регионе.

Compliance: HIPAA, SOC 2, TCPA, GDPR

Голос затрагивает сразу три аспекта compliance — PHI (если пользователи обсуждают здоровье), PII (любые данные клиентов) и согласие на запись (в каждом штате, во многих — со штрафами). Платформы помогают, но ответственность за соблюдение требований остаётся на вас.

  • HIPAA. LiveKit подписывает BAA. То же делают OpenAI, Deepgram и ElevenLabs на корпоративном тарифе. Проверяйте каждого поставщика в стеке и храните подписанный обеими сторонами PDF — на каждый цикл пересмотра договора.
  • SOC 2 Type II. Сертифицированы LiveKit, OpenAI, Deepgram, AssemblyAI, ElevenLabs, Cartesia. Запросите отчёты для собственного аудита.
  • TCPA. С решения FCC от 8 февраля 2024 года для использования AI-генерируемого голоса в исходящих звонках требуется задокументированное предварительное письменное согласие. Храните его рядом с номером и предъявляйте при каждом звонке.
  • Согласие обеих сторон на запись. В Калифорнии, Флориде, Пенсильвании, Иллинойсе и ещё семи штатах требуется согласие всех участников разговора. В начале каждого записываемого звонка воспроизводите дисклеймер — и сам этот дисклеймер тоже записывайте.
  • GDPR. Согласие на запись по статье 6 должно быть явным, а не основано на «законном интересе». Заключите договоры об обработке данных с каждым провайдером в вашем стеке и привяжите хранение медиа к региону ЕС.

Наши настройки по умолчанию в продакшене: автоматическое удаление персональных данных (PII) из логов в реальном времени (удаляем email, телефоны и номера карт ещё до попадания в систему мониторинга), хранение метаданных согласия по каждому звонку, аудит-логи с минимальным сроком хранения 90 дней и ежегодная проверка границ промпта агента командой red team. Экономить на этих мерах — значит рисковать карьерой.

У вас в проекте HIPAA или GDPR?

Мы запускали голосовых агентов с полным стеком BAA для медицинского приёма и телемедицины. Если в звонке фигурирует PHI, одной галочкой от провайдера не обойтись — нужны pipeline, логи, политика хранения данных и red-team, способные пройти аудит.

Позвоните нам → Напишите нам →

Сценарии, которые действительно окупаются

Четыре паттерна возвращают вложения меньше чем за полгода. Всё остальное — экспериментирование:

Поддержка первой линии

Сброс паролей, статус заказа, проверка баланса, вопросы по полису — всё это голосовой агент решает без участия человека. Он закрывает 40–60% входящих обращений по стоимости 6–11 ₽ за звонок против 150–375 ₽ у живого оператора. Для линии поддержки с нагрузкой 100 000 звонков в месяц это экономия от 11 до 22 млн ₽ в месяц, которые возвращаются в P&L.

Исходящие продажи и квалификация лидов

Перезвон по входящим лидам ускоряется со «среднего времени ответа в 4 часа» до «30 секунд». Конверсия во встречи обычно удваивается или утраивается. У одного клиента из enterprise стоимость одной забронированной встречи в исходящей квалификации упала с 3 600 ₽ до 675 ₽.

Медицинский приём и подтверждение визитов

Крупные сети клиник используют голосовых агентов для предварительного сбора анамнеза и напоминаний о визитах за сутки до приёма. 70–80% таких звонков обрабатываются полностью автоматически, освобождая персонал ресепшна для приёма новых пациентов. Стек HIPAA обязателен — см. выше.

Голосовые тьюторы и встроенные ассистенты

Этот сценарий максимально соответствует портфолио Фора Софт. Мы разрабатывали голосовые обучающие платформы, приложения для коучинга в реальном времени и агентов на WebRTC прямо в браузере для образовательных клиентов, таких как Career Point. Схема у всех проектов одинакова: клиентский SDK LiveKit в браузере, воркер агента со стеком Haiku + Cartesia, кастомные инструменты для отслеживания состояния урока и сбора обратной связи, которая записывает взаимодействия для последующего педагогического анализа.

Семь сценариев отказа, которые мы видим в production

В порядке частоты, с которой они ломают демонстрации:

  • Холодный старт. Первый запрос после запуска — задержка 3–5 секунд. Проблему решает прогрев системы тестовыми запросами и предварительная настройка пула соединений при старте.
  • Ложные прерывания. Агент перебивает собеседника или говорит поверх него. Настройте VAD, включите BVC и протестируйте с 20 живыми пользователями перед запуском.
  • Галлюцинации фактов. Агент придумывает номер подтверждения. Заставьте его опираться на вызов функций для всего, что нужно процитировать; запретите свободные ответы на вопросы, требующие фактических данных.
  • Ошибки извлечения сущностей. «Мой email — john.doe» превращается в «johndough». Переключайтесь на AssemblyAI Universal-3 Pro для сценариев с большим количеством сущностей.
  • Каскадная межрегиональная задержка. STT в us-east, LLM в us-west, TTS во Франкфурте. Соберите всех провайдеров в одном регионе; платите за исходящий трафик, если нужно.
  • Неконтролируемые расходы. Цикл повторов генерирует 40 вызовов LLM за десять секунд после неудачного инструмента. Жёстко ограничьте количество вызовов инструментов за ход и стоимость сессии в рублях.
  • PII в логах. Полные транскрипты с СНИЛС попадают в CloudWatch. Удаляйте их на границе, ещё до отправки в систему мониторинга.

KPI: что измерять с первого дня

Голосовой агент без приборной панели — это демонстрация. Снимайте эти метрики с первого production-звонка:

  • Задержка хода P50 / P90 / P99. Среднее значение обманывает — именно задержки на уровне P99 заставляют пользователей бросать соединение.
  • Доля выполненных задач. Закрыл ли агент запрос клиента без передачи другому специалисту? 50–70% — реалистичный ориентир для хорошо настроенного бота поддержки.
  • Доля передач оператору. Количество эскалаций к оператору на один звонок. Если показатель растёт — значит, сломался инструмент или изменился промпт.
  • Стоимость одного успешного исхода. Не цена за минуту — цена за забронированную встречу, сброшенный пароль или подтверждённый визит.
  • Частота прерываний. Как часто собеседник перебивает агента? Если растёт — значит, голос слишком многословен.
  • WER транскрипции. Размечайте вручную выборку из 100 звонков в неделю. Дрейф здесь — индикатор для всех остальных метрик.

Когда НЕ стоит строить на LiveKit

Четыре случая, где управляемая платформа уверенно опережает LiveKit:

  • Детерминированный IVR. «Нажмите 1 — отдел продаж, 2 — поддержка». Берите Twilio Studio и вперёд.
  • Proof of concept в жёсткие сроки. Retell AI запускается за 3 часа, Vapi — за день. Если демонстрация нужна завтра — не разрабатывайте, покупайте.
  • Меньше 5000 минут в месяц — навсегда. Срок окупаемости инвестиций в инженерию уходит за год. Платформенная комиссия — это недорогая страховка.
  • Нетехническая команда без DevOps. No-ocode-конструктор Synthflow справится лучше, чем сломанный Python-агент, за которым некому ухаживать.

Честный вопрос звучит так: «насколько это важно, чтобы делать самому?». Если голосовой агент — основа продукта или экономия становится заметной уже при использовании больше десяти тысяч минут в месяц, ответ — да, и тогда LiveKit — правильный выбор. Во всех остальных случаях начните с управляемой платформы и перейдите на собственный хостинг позже.

FAQ

Сколько уходит у Фора Софт на запуск production-агента на LiveKit?

От трёх до шести недель на узкий сценарий (один процесс, один язык, один регуляторный режим). Наш конвейер Agent Engineering сокращает сроки с трёх месяцев вдвое — поэтому итоговая стоимость, как правило, ниже рыночной даже на премиум-стеке.

LiveKit умеет в звонки PSTN или это только WebRTC?

И то, и другое. LiveKit подключается к PSTN через Twilio или Telnyx по протоколу SIP. С апреля 2026 года Telnyx предлагает собственный продукт «LiveKit on Telnyx», который объединяет оба сервиса и снижает стоимость распознавания и синтеза речи примерно на 50% по сравнению с использованием только LiveKit Cloud.

Какая реалистичная задержка для агента — менее 700 мс?

Со стриминговым STT Deepgram Nova-3, стриминговым LLM Claude Haiku 4.5 и стриминговым TTS Cartesia Sonic-3 — все в одном регионе, с короткими системными промптами — мы регулярно фиксируем сквозную задержку 550–700 мс по P50 на WebRTC-клиентах. Хопы через PSTN добавляют 80–150 мс.

Может, лучше взять OpenAI Realtime API?

Если задержка — главный критерий, и вас устраивает использование GPT-5 в качестве LLM, то да: сквозная задержка в 200–300 мс пока неоспорима. LiveKit поддерживает Realtime через плагин, так что можно протестировать оба подхода без переписывания агента. Если важны соответствие требованиям, надёжность вызова функций или кастомные голоса — pipeline остаётся лучшим выбором.

Как остановить расход денег из-за неработающих вызовов инструментов?

Три жёстких лимита на сессию: максимум вызовов инструментов, максимум токенов LLM и максимальная общая длительность. При достижении любого из них агент говорит: «Давайте я переключу вас на оператора» — и направляет вызов по резервному маршруту. Кроме того, мы отслеживаем ежемесячные алерты по стоимости для каждого тенанта, чтобы аномалии замечались в течение минут, а не дней.

Может ли агент передать звонок оператору посреди разговора?

Да. Стандартный паттерн — инструмент transfer_to_agent: LLM решает (или собеседник просит) передать звонок, в комнату LiveKit добавляется человек-оператор, AI-агент выходит. Транскрипт и контекст передаются вместе с звонком, поэтому оператор подхватывает разговор, а не начинает с нуля.

Подходит ли LiveKit для многоязычных звонков?

Очень. Gladia Solaria-1 справляется с переключением языков в одном потоке (собеседник переходит между испанским и английским посреди фразы), Soniox лидирует на 30+ языках, а Grok TTS недавно выпустил многоязычные голоса с нативной интеграцией в LiveKit. Сам конвейер остаётся прежним — меняются только плагины STT и TTS.

Как нам прогнать бенчмарк агента до запуска?

Прогоните 50–100 заскриптованных диалогов по основным типам задач, замерьте задержку по P99, долю выполненных задач и долю галлюцинаций. Затем добавьте 20 живых проверяющих с непредсказуемыми звонками. Разрыв между двумя замерами покажет, не переобучен ли агент под промпты. В «Фора Софт» мы запускаем этот цикл на каждом релизе.

Углублённый разбор фреймворка

LiveKit AI Agents: руководство для инженера

Технический спутник этого плейбука — внутренности SDK, паттерны воркеров, деплой.

Видеостек

Создаём приложение для видеостриминга в 2026

VOD, прямые трансляции и видеоконференции на одном реальном времени — так работает транспортный протокол LiveKit.

Альтернативы вендорам

Альтернативы Agora.io для голосовой и видеосвязи в реальном времени

Сравнение, после которого многие команды начинают интересоваться LiveKit.

Кейс

Career Point: AI-коучинг на LiveKit + Oxford

Как Фора Софт запустила голосовую коучинг-платформу с задержкой меньше 800 мс.

Compliance

Безопасность приложений с realtime-медиа

Шифрование, согласие на запись и аудит-логи — паттерны, которые переносятся на голосовой ИИ.

Как мы работаем

Agent Engineering в Фора Софт

Почему сроки на проектах с упором на AI у нас короче и дешевле рынка.

Готовы запустить голосовой ИИ, который звучит как человек?

Расскажите про задачу. Мы назовём самый быстрый путь к production и честную цифру.

30-минутный созвон со старшим инженером, который уже запускал агентов на LiveKit. Без презентации, без NDA.

Позвоните нам → Напишите нам →

Последнее обновление — апрель 2026 года, актуальные данные по LiveKit Agents, моделям и ценам. Источники: документация LiveKit, бенчмарки Deepgram, ElevenLabs, Cartesia, AssemblyAI и production-деплои Форсофт.

  • Технологии
    Разработка
    Услуги