ИИ-агенты на WebRTC в 2026: архитектура, задержки, стоимость и соответствие требованиям

3/2/2026
·
Обновлено
8.11.2026

Главное

ИИ-агенты на WebRTC уже укладываются в 500 мс. Модели speech-to-speech, такие как OpenAI gpt-realtime и Gemini Live, обеспечивают общую задержку 150–300 мс; каскад STT→LLM→TTS — 500–800 мс. Оба варианта в разговоре воспринимаются естественно.

На рынке доминируют две архитектуры. Speech-to-speech — самый быстрый и простой вариант, но он привязывает вас к одному поставщику. Каскад (Deepgram + открытая LLM + ElevenLabs/Cartesia) обходится в 3–5 раз дешевле и позволяет менять модели от звонка к звонку.

Разрыв в стоимости огромен. OpenAI Realtime стоит около 15 ₽ за минуту; настроенный каскад на Deepgram Nova-3 + Llama 8B + Cartesia Sonic — 3–6,7 ₽ за минуту. Выбирайте архитектуру, исходя из юнит-экономики конкретного типа звонка.

Естественное ощущение создаётся не просто задержкой, а правильным управлением очередностью реплик. Один VAD не справляется с шумом и поддакиваниями. В продакшене агенты комбинируют VAD, ML-модель для определения конца реплики, AEC и мгновенное прерывание TTS, чтобы поддерживать перебивание (barge-in) за ~300 мс.

Комплаенс — это шлагбаум. Если вы работаете с медициной, финансами или пользователями из ЕС, стек должен с самого начала поддерживать HIPAA, SOC 2 Type II и хранение данных в соответствии с GDPR. Добавлять это после пилота — значит удвоить бюджет.

Почему этот плейбук написала Фора Софт

Мы разрабатываем продукты для видеосвязи и голосовой связи в реальном времени уже 21 год: за это время мы провели более 625 запусков. WebRTC — это технология, с которой мы работаем каждый день: от виртуального класса BrainCert (1 млн+ учеников, 500 млн+ минут обучения в 10 дата-центрах) до VOLO.live — нашей платформы синхронного ИИ-перевода, которая обслужила более 22 000 участников Black Hat Briefings 2025 и HIMSS.

Когда мы говорим «ИИ-агенты на WebRTC», мы имеем в виду реальную продакшен-ситуацию: пользователь подключается к SFU как обычный участник комнаты, слушает живой RTP-поток, модель обрабатывает запрос за 200 мс, а синтезированная речь возвращается ещё до того, как пользователь успевает вдохнуть. На первый взгляд это просто, но на деле — задача непростая. Этот гид — сводка того, что мы даём нашим архитекторам, когда клиент спрашивает: «Что мне на самом деле строить?» Здесь — четыре проверенные архитектуры, экономическая эффективность каждой и скрытые проблемы, которые могут тихо убить пилотный проект.

Читайте как CTO: переходите сразу к матрице сравнения, модели стоимости или фреймворку выбора, если вам это нужно. Или закажите 30-минутный архитектурный разбор — пройдёмся по вашему стеку в прямом эфире.

Выбираете между OpenAI Realtime и каскадом?

Прогоним обе архитектуры на профиле вашего трафика и подберём ту, что укладывается в бюджет задержек по минимальной стоимости минуты. Без презентаций — только цифры.

Позвоните нам → Напишите нам →

Что реально изменилось в 2024–2026

Три вещи помогли вывести связку ИИ + WebRTC из демо в реальный продукт. Во-первых, нативные модели speech-to-speech: OpenAI gpt-realtime и Google Gemini Live принимают аудио и возвращают аудио напрямую, без промежуточной расшифровки — это убирает два этапа задержки и сохраняет интонацию. Во-вторых, сверхбыстрый синтез речи: ElevenLabs Flash v2.5 выдаёт первый фрагмент звука за ~75 мс, Cartesia Sonic — за ~40 мс, и сигнал «я тебя слышу» приходит раньше, чем пользователь успевает раздражаться. В-третьих, агентные фреймворки поверх SFU: LiveKit Agents, Pipecat и Daily/ Vapi сократили шестинедельную интеграцию до готового каркаса за неделю.

В итоге мы получили разговорного ИИ, который подключается к WebRTC-комнате как участник, слышит аудио, ведёт диалог из 30 реплик с сохранением контекста, передаёт его человеку со всей информацией и обходится дешевле живого оператора. В 2023 году это было демонстрацией. К 2026 году — базовый стандарт в клиентской поддержке, подборе клиентов, телемедицине и онлайн-обучении.

WebRTC за 90 секунд — для владельцев продуктов

WebRTC — это открытый стандарт, по которому браузеры и мобильные приложения обмениваются аудио, видео и данными с задержкой меньше 200 мс. Полный гид — в нашей статье об архитектуре WebRTC; кратко это четыре составляющие:

  • Медиадорожки — аудио и видео, передаваемые поверх UDP/SRTP с встроенным DTLS-шифрованием.
  • Сигнализация — это ваш собственный сервер, через который участники обмениваются SDP-предложениями и ответами, чтобы найти друг друга.
  • ICE / STUN / TURN — технологии для обхода NAT, чтобы два участника за фаерволами могли реально соединиться.
  • Топология SFU или P2P — для двух участников подойдёт P2P; от трёх и больше почти всегда нужен Selective Forwarding Unit (LiveKit, mediasoup, Janus), который маршрутизирует медиа.

Для ИИ-агента точкой подключения служит SFU: агент заходит в комнату как обычный участник, подписывается на аудиодорожку каждого активного участника и публикует своё синтезированное аудио обратно. Никакого специального протокола — используется тот же WebRTC, что и в браузере. Именно эта симметрия и сделала интеграцию естественной.

Четыре архитектуры, которые реально используются в продакшене

Почти любая продакшен-система ИИ + WebRTC сводится к одному из четырёх паттернов. Выбирайте в зависимости от допустимой задержки, готовности к привязке к вендору и необходимого объёма звонков.

1. Speech-to-speech (OpenAI Realtime, Gemini Live)

Одна мультимодальная модель принимает аудио на вход и выдаёт аудио на выходе. Агент подключается через WebRTC (браузер) или WebSocket (сервер) напрямую к OpenAI или Google. Самая низкая сквозная задержка — 150–300 мс, лучшая интонация, самый простой код — но LLM нельзя заменить, «рассуждения» не проследить, а минута стоит дороже всех альтернатив на рынке.

Выбирайте speech-2-speech, когда: задержка должна быть меньше 400 мс, разговор короткий (до примерно 3 минут) и вы готовы платить 11–15 ₽ за минуту аудио. Sales-боты, голосовой онбординг, премиальный IVR.

2. Каскад STT → LLM → TTS

Классический стек: Deepgram или AssemblyAI стримят транскрипцию; LLM (GPT-4o, Claude, Llama 3 8B/70B) генерирует ответ; ElevenLabs или Cartesia синтезируют речь обратно. Оркестрацию обеспечивают LiveKit Agents или Pipecat. Полная задержка — 500–800 мс, зато каждый компонент можно быстро заменить, всё отслеживается в логах, а стоимость остаётся низкой. Большинство корпоративных решений работают именно на такой архитектуре.

Берите каскад, когда: нужно тестировать разные LLM, вести логирование транскриптов для соответствия требованиям или снизить стоимость минуты ниже 7,5 ₽ при больших объёмах. Контакт-центры, приём у врача, поддержка клиентов.

3. Мост SIP / PSTN к WebRTC-агенту

Для входящих и исходящих звонков. SIP-транк (Twilio, Telnyx) подключается к WebRTC SFU; агент работает по той же схеме, что и в паттерне 2. Телефония добавляет джиттер 100–300 мс, но обеспечивает доступ к PSTN и понятные регуляторные пути. Vapi и Retell AI — готовые решения с поддержкой; LiveKit, Pipecat и Plivo — варианты для самостоятельной сборки.

Берите SIP-мост, когда: звонок начинается с телефонного номера, а не из вашего приложения. Исходящие продажи, напоминания о встречах, страховые случаи, запись в автосервис.

4. Мультимодальный визуальный агент на живой видеодорожке

Агент подписывается и на аудио, и на видео, отправляет отдельные кадры в визуальную модель (GPT-4o, Gemini 2.5, мультимодальный Claude 4), сопоставляет их с речью и формирует ответ. Анализ по кадрам добавляет задержку 400–800 мс, поэтому частоту кадров для обработки снижают до 1–3 кадров в секунду, а аудио обрабатывается без ограничений. Такой подход используется в KYC-верификации, управляемом онбординге в приложении, контроле качества на производстве и удалённой поддержке на местах. Подробности о производственной реализации мы описали в материале о мультимодальных агентах на LiveKit.

Берите мультимодальную модель, когда: агент должен видеть то же, что и пользователь — документы, повреждённый товар, экран приложения, реальное рабочее место. Телемедицинский триаж, страховые претензии с фото повреждений, AR-поддержка в полях.

Матрица сравнения — четыре архитектуры рядом

Паттерн Сквозная задержка Стоимость / мин Вендор-лок Время запуска Когда подходит
Speech-to-speech (OpenAI / Gemini) 150–300 мс 11–15 ₽ Высокий ~1 день Голосовой онбординг, sales-боты
Каскад STT→LLM→TTS 500–800 мс 3–6,7 ₽ Низкий 2–3 недели Контакт-центры, медицинский приём
SIP/PSTN-мост 600 мс – 1,2 с 4,5–12 ₽ Средний 2–4 недели Входящие и исходящие телефонные звонки
Мультимодальный визуальный агент 700 мс – 2 с 7,5–22 ₽ Средний 4–6 недель KYC, телемедицинский триаж, полевой сервис
Open-source on-prem (Whisper + Llama + Coqui) 600–900 мс ~0 ₽ маржинальной (CapEx) Нет 6–10 недель Чувствительные данные, регулирование, edge

Бюджет задержек — куда уходит каждая миллисекунда

Человек начинает замечать паузу примерно с 250–300 мс тишины. На 500 мс это ощущается как «немного запоздало», на 800 мс пользователь думает, что связь оборвалась, на 1,5 с он кладёт трубку. Чтобы сохранить ощущение живого разговора, путь от «пользователь замолчал» до «агент начал говорить» должен укладываться в 800 мс, а лучше — в 500 мс.

В каскаде бюджет распределяется примерно так:

Этап Типично (мс) Агрессивно (мс)
Аудио пользователя → SFU (сеть) 40–100 30
Определение конца реплики (VAD + endpointing) 400–600 200–300
Стриминговый STT (Deepgram Nova-3, P50) 200–300 ~150
LLM до первого токена 200–400 100–150 (Llama 8B / Groq)
TTS до первого аудио 100–200 40–75 (Cartesia / EL Flash)
SFU → аудио пользователю 40–100 30

Доминируют два этапа: определение конца реплики и время до первого токена LLM. Если слишком жёстко настроить endpointing — агент начнёт перебивать собеседника; если выбрать медленную LLM — вся цепочка замедлится. Искусство в том, чтобы передавать первое предложение LLM в TTS, как только сгенерируется 8–15 токенов («спекулятивная речь»), чтобы аудио началось раньше, чем модель закончит думать.

Очерёдность реплик, перебивание и почему наивный VAD ломает демо

Задержка делает агента быстрым. Управление очередью реплик делает его вежливым. Большинство проваленных пилотов, которые мы проверяли, имели нормальный STT и адекватные LLM, но общались неестественно: агент перебивал пользователя, слишком долго молчал после поддакиваний или не давал перебить себя посередине фразы.

Продакшен-менеджер реплик нужен в четырёх слоях:

1. Непрерывный VAD — классификатор окна 30–50 мс (Silero VAD, WebRTC VAD), который определяет наличие голоса. Дёшево, работает на CPU, срабатывает на любой звук, включая кашель и стук клавиатуры.

2. Модель конца реплики — небольшая ML-модель (есть в LiveKit, у Pipecat это SmartTurn), которая по аудио и последнему частичному транскрипту определяет: «пользователь точно закончил говорить?». Уменьшает задержку с наивных 800 до примерно 300 миллисекунд и не делает речь рваной.

3. Эхокомпенсация (AEC) — обязательна, если голос агента, сгенерированный TTS, воспроизводится через колонки пользователя, а микрофон улавливает этот звук обратно. Без AEC агент будет «слышать сам себя» и отвечать на собственный голос. У браузеров AEC уже встроена; в нативных приложениях и headless-агентах её нужно подключать отдельно.

4. Мгновенное прерывание TTS — когда пользователь реально прерывает ответ (а не просто говорит «м-м-м»), система сбрасывает аудиобуфер, останавливает генерацию LLM, возвращает диалоговое состояние к частичному ответу, а STT начинает распознавать новую реплику. Цель — достичь тишины со стороны агента примерно за 300 мс с момента прерывания.

Слой инструментов — сначала фреймворк, потом провайдеры

Ниже — краткий список фреймворков, которые наша команда реально использует в продакшене. Ни один из них не «неправильный»: просто каждый оптимизирован под свои задачи.

Фреймворк Сильная сторона Компромисс Кому подходит
LiveKit Agents Лучший SFU; нативные VoicePipelineAgent и MultimodalAgent; облако с сертификациями SOC 2 и HIPAA Базовая цена выше, чем у self-hosted Корпоративные команды, которым нужен управляемый масштаб
Pipecat (Daily) Оркестрация под лицензией MIT; модульная, провайдеров легко заменить Деплой и наблюдаемость — на вас Команды, которым важна стоимость и есть DevOps
Vapi / Retell AI Сначала телефон; исходящий обзвон за несколько дней; управляемый комплаенс Меньше контроля; наценка на стоимость провайдеров Исходящие продажи, напоминания о встречах
OpenAI Agents SDK + Realtime Минимум подвижных частей; лучшая интонация Один вендор; самая высокая цена за минуту Премиальные голосовые продукты, MVP
mediasoup + свой оркестратор Полный контроль над кодом; развёртывается on-prem и на edge Месяцы разработки, а не недели Регулируемые отрасли, on-prem, суверенное облако

Из STT мы обычно используем Deepgram Nova-3 (минимальная задержка, около 0,32 ₽ за минуту) или AssemblyAI Universal-2 (выше точность на акцентном английском, около 0,14 ₽ за минуту). Из TTS — Cartesia Sonic, когда важна низкая задержка, и ElevenLabs Flash v2.5, когда голос должен звучать убедительно. С LLM ситуация меняется: Llama 3.1 8B на Groq — для дешёвых сценариев, GPT-4o или Claude 4 — для сложных tool-цепочек, а собственный fine-tune — для доменов, которые нельзя передавать сторонним вендорам.

Застряли между LiveKit, Pipecat и Vapi?

Мы поставляли продукты на всех трёх. Дайте профиль звонков и бюджет — порекомендуем фреймворк, который укладывается и в то, и в другое, а также подходящих провайдеров.

Позвоните нам → Напишите нам →

Эталонная архитектура, которую можно скопировать

Чистый каскад для голосового агента поддержки B2B SaaS выглядит так:

  Browser / Mobile (WebRTC client)
        |  audio + video tracks
        v
  LiveKit / mediasoup SFU  ────────►  Recording & transcript store (S3 + Postgres)
        |  audio track subscribed
        v
  Agent worker (Python / Node)
   ├─ VAD (Silero)
   ├─ End-of-turn model
   ├─ Streaming STT (Deepgram Nova-3)
   ├─ LLM orchestrator (LangGraph / Pipecat)
   │   ├─ tool calls → CRM / KB / payments
   │   └─ guardrails + PII redaction
   ├─ Streaming TTS (Cartesia Sonic)
   └─ Barge-in / pre-emption controller
        |  publishes synthesized audio
        v
  SFU → user
        |
        └─► Observability (OpenTelemetry → Datadog / Grafana)

Каждый блок справа в пилотной версии опционален, в продакшене — обязателен: запись для QA, наблюдаемость для SLO по задержкам, guardrails для защиты PII, tool calls — чтобы агент реально что-то делал (бронировал встречу, оформлял возврат, обращался к базе знаний). Любопытный архитектурный выбор — где хранить состояние: историю диалога держим в Redis с TTL 24 часа, а полные транскрипты сессий сохраняем в Postgres для аналитики на долгосрочной дистанции.

Расчёт стоимости — 100 000 минут звонков в месяц

Цифры решают архитектурные споры быстрее любых диаграмм. Возьмём типичное внедрение поддержки клиентов в среднем сегменте: 100 000 пользовательских минут в месяц, средняя продолжительность звонка — 3,5 минуты, агент говорит около 40% времени. Ниже — месячный счёт по трём архитектурам, которые мы поставляем чаще всего.

Статья расходов OpenAI Realtime Каскад (управляемый) Каскад (self-hosted)
Маршрутизация медиа в SFU 30 000 ₽ (LiveKit Cloud) 30 000 ₽ (LiveKit Cloud) 22 500 ₽ (кластер Hetzner AX52)
STT входит в стоимость 32 250 ₽ (Deepgram Nova-3) 14 250 ₽ (Whisper.cpp on-prem)
LLM входит в ₽/мин 135 000 ₽ (GPT-4o-mini) 52 500 ₽ (Llama 3.1 8B / Groq)
TTS входит в стоимость 180 000 ₽ (ElevenLabs Flash) 90 000 ₽ (Cartesia Sonic API)
Аудио-модели в реальном времени 1 350 000 ₽ (~13,5 ₽/мин в среднем)
Итого в месяц (приблизительно) ~1,3 млн ₽ ~377 тыс. ₽ ~179 тыс. ₽

Разрыв в 3,6 раза между самым простым решением и самым дешёвым каскадом достаточен, чтобы профинансировать небольшую инженерную команду. На первые 6–12 месяцев мы обычно рекомендуем управляемый каскад — он быстрее всего запускается, и команда успевает набрать операционный опыт; затем, когда объём оправдает миграцию, слои LLM и TTS переводятся на self-hosted. Цифры иллюстративные: реальный счёт зависит от структуры звонков, стоимости клонирования голосов и скидок за объём.

Мини-кейс — как VOLO.live ведёт ИИ в реальном времени для 22 000 участников

Контекст. Продукту синхронного перевода для конференций требовались распознавание речи и озвучка перевода в реальном времени для глобальных мероприятий — HIMSS, Black Hat Briefings, GDC. Задержка должна была быть почти незаметной, аудио — синхронным со спикером на сцене, а любая техническая ошибка сразу бросилась бы в глаза тысячам платных участников.

Что мы построили. WebRTC-инжест с площадки, аудио уходит в Speechmatics и Google Cloud Speech для стримингового STT, ИИ-слой перевода выдаёт и субтитры, и закадровый голос на 25+ языках, NestJS-бэкенд оркеструет переключение языка, а Next.js-приложение участника открывается по QR-коду на месте. У спикеров и организаторов — админпанели для включения и выключения языков на лету; участник выбирает язык в два касания.

Результат. Развёрнуто на Black Hat Briefings 2025 (более 22 000 участников), HIMSS, GDC и других крупных конференциях. Перевод в реальном времени с задержкой субтитров менее секунды, естественно звучащий закадровый голос и удобный с точки зрения лицензий мультивендорный стек STT/перевода, который заказчик может масштабировать. Хотите такой же разбор своего ИИ-стека в реальном времени?

Безопасность и комплаенс — что закладывать с первого дня

WebRTC по умолчанию шифрует медиа в транзите (DTLS-SRTP). Вся остальная работа по обеспечению соответствия требованиям — вне этого процесса: на SFU (он завершает шифрование, чтобы маршрутизировать трафик), у LLM-провайдера (ему доступны транскрипты), на стороне хранилища (где хранятся записи и транскрипты) и на уровне согласия (в большинстве юрисдикций вы обязаны информировать пользователя, что с ним общается ИИ).

1. HIPAA (медицина в США). С каждым поставщиком, который работает с защищённой медицинской информацией — SFU, STT, LLM, TTS, хранилищем — нужен подписанный BAA. LiveKit Cloud, Deepgram и OpenAI предоставляют BAA на корпоративных тарифах, ElevenLabs — только на enterprise-плане. PHI в транскриптах должна быть зашифрована при хранении и сопровождаться логами доступа.

2. GDPR (пользователи из ЕС). Ловушка — хранение данных: SFU и LLM должны находиться в ЕС, если через них проходят данные пользователей. У OpenAI в enterprise-версии есть возможность размещения в ЕС; многие open-source решения с самохостингом оказываются проще, чем оформление всей документации.

3. SOC 2 Type II. Требуется при большинстве корпоративных закупок. Аудит проверяет безопасность, доступность и конфиденциальность всей системы. Выбирайте поставщиков, у которых сертификат уже есть (LiveKit, Deepgram, AssemblyAI, OpenAI, Cartesia) — цепочка доверия останется целой.

4. PCI-ДSS. Если агенту понадобится хотя бы раз принять номер карты, передавайте этот фрагмент аудио через токенизирующего вендора (Cresta, AudioCodes), чтобы LLM никогда не видела исходный PAN. Не позволяйте GPT-4 транскрибировать номер карты — ни при каких обстоятельствах.

5. Согласие и раскрытие ИИ. В Калифорнии, Иллинойсе, Колорадо и по AI Act ЕС требуется чётко сообщать, что собеседник — искусственный интеллект. Убедитесь, что информация о том, что вы общаетесь с ИИ, звучит в первые 5 секунд каждого звонка, и фиксируйте подтверждение пользователя.

Пять подводных камней, которые тихо хоронят продакшен-агентов

1. Холодный старт LLM. Если контейнер с LLM масштабируется до нуля, первый запрос после простоя будет ждать загрузки модели 2–5 секунд. Держите хотя бы две «тёплые» реплики, подавая им синтетический пинг раз в 30 секунд — или используйте управляемый эндпоинт, который сам сохраняет модель в памяти (например, Groq, OpenAI, Anthropic).

2. Раздувание контекста. Диалог из 30 реплик легко превышает 10 000 токенов; стоимость работы LLM растёт линейно, а задержка — быстрее. Каждые 8–10 реплик сжимайте в скользящее состояние и удаляйте исходный текст из промпта; полный диалог храните отдельно для проверки и анализа.

3. Многословный TTS. Поскольку TTS тарифицируется посимвольно, болтливая модель — это дорогая модель. Ограничивайте ответы примерно 80 словами, давайте LLM инструкцию говорить кратко и отдавайте предпочтение экстрактивным ответам («ваш последний счёт — 6 525 ₽») вместо генеративных («отличный вопрос, давайте я объясню…»).

4. Нет пути передачи человеку. Агент ошибётся. Стек должен передать звонок оператору с полной транскрипцией, кратким резюме и чётко определённым намерением пользователя — а не «холодным» переводом, после которого клиент вынужден всё повторять с начала. Делайте долю успешных передач ключевым KPI высшего уровня.

5. Отношение к SFU как к «просто трубам». География задержек зависит от местоположения SFU: американский сервер, обслуживающий пользователя из APAC, добавляет 200–300 мс ещё до начала разговора. Выбирайте поставщика SFU с edge-узлами в нужных регионах или разверните свои на Hetzner / OVH / Equinix в ключевых точках.

KPI — что измерять, когда вы уже в продакшене

KPI качества. P50 и P95 задержки туда-обратно (цель: P50 < 600 мс, P95 < 1 с), ошибка распознавания слов в STT (< 8% для поддержки), доля ложных перебиваний (< 5%), частота самосрабатывания AEC (~0).

KPI бизнеса. Containment rate / отклонение звонков (доля звонков, полностью обработанных ИИ; цель — 50–75% в поддержке, 80%+ в self-service), CSAT по звонкам, обработанным ИИ (в пределах 0,3 от базового уровня людей), стоимость одного решённого обращения (цель — ниже 25% от стоимости при работе с людьми), доля апселлов или квалифицированных лидов по исходящим звонкам.

KPI надёжности. Время работы агента (не менее 99,9%), доля обрывов звонков (менее 0,5%), передача оператора с полным контекстом (более 98%), доля обнаружения PII или небезопасного контента по guardrails (точность и полнота рассчитываются отдельно).

Когда ИИ-агента на WebRTC не запускать

Три сценария, где ответ — нет или пока нет. Сильно эмоциональные звонки и звонки на грани жизни: телефоны доверия по суициду, посттравматическая поддержка, разговоры о конце жизни. ИИ не должен первым брать трубку; направляйте такие звонки людям, а ИИ используйте для бэкенд-поддержки и составления отчётов после разговора. Сферы, где ошибка дороже выгоды от ускорения: юридические консультации, выписка рецептов на контролируемые препараты, регулируемые финансовые советы. Одна ошибка может стоить больше, чем экономия трёх месяцев времени. Объёмы ниже ~5000 минут в месяц: затраты на интеграцию, мониторинг и соблюдение норм не окупятся. Пока не достигнете этого порога, используйте чат-бота или живого оператора.

Фреймворк выбора — пять вопросов перед архитектурой

В1. Какой жёсткий потолок задержки? Меньше 400 мс — speech-to-speech (OpenAI Realtime, Gemini Live). 500–800 мс — управляемый каскад. Выше — подойдёт что угодно.

В2. Какой потолок стоимости одного звонка? Ниже 7,5 ₽ за минуту — только каскад на дешёвых провайдерах (Deepgram + Llama 8B + Cartesia). Бюджет от 15 ₽ за минуту открывает более простые готовые решения.

В3. Откуда приходят звонки? Из вашего приложения — чистый WebRTC. С телефонных номеров — SIP-мост через Vapi, Retell или LiveKit Telephony. И то, и другое: соберите каскад один раз и подключите оба транспорта.

В4. Какой режим комплаенса? HIPAA + GDPR ЕС + PCI вместе толкают вас к LiveKit Cloud + AssemblyAI + Anthropic Claude на AWS Bedrock с резидентностью в ЕС — или к полностью self-hosted open-source.

В5. Нужен ли агенту глаз? Если да (KYC, телемедицина, выездной сервис), используйте MultimodalAgent в LiveKit Agents или Pipecat с визуальной моделью на 1–3 fps. Если нет — оставайтесь на чистом аудио: зрение втрое повышает стоимость и задержку.

Нужно второе мнение по вашему голосовому ИИ-стеку?

30-минутный разбор с нашими архитекторами голосового ИИ: бюджет задержек, стоимость минуты, сбои в комплаенсе и план запуска в продакшен за 12 недель.

Позвоните нам → Напишите нам →

Сценарии, которые уже окупаются в 2026

Поддержка клиентов уровня tier-0. Голосовой агент решает вопросы с сбросом паролей, проверяет статус заказа, отвечает на частые вопросы по оплате и перенаправляет всё остальное — с полным контекстом. Практика в отрасли показывает, что 50–80% таких обращений закрываются автоматически; стоимость одного решённого запроса снижается примерно до четверти от стоимости работы человека.

Discovery и квалификация в продажах. Агент совершает первый звонок, задаёт вопросы по ICP, оценивает лида и бронирует встречу в календаре менеджера по продажам. Такой подход полезен при большом количестве входящих заявок, когда SDR не успевают справляться. Подробнее — в нашей статье об ИИ-ассистентах для звонков.

Приём в телемедицине и наблюдение после визита. Искусственный интеллект собирает симптомы, список принимаемых лекарств и согласие пациента до подключения врача, а затем занимается рутинными повторными приёмами. Такой подход естественно вписывается в нашу работу над платформами телемедицины — с использованием HIPAA-уровня WebRTC и ИИ-агента с защитой персональных медицинских данных (PHI).

Онлайн-репетиторство и онбординг. Агент заходит на занятие, наблюдает за уроком, отвечает на вопросы ученика и готовит краткое резюме для преподавателя. Если делать это качественно, такой подход повышает вовлечённость, не заменяя при этом самого преподавателя — аналогичный принцип использует BrainCert с более чем 1 млн учеников.

Real-тайм копилоты для встреч. Прямая транскрипция, задачи и итоги — на почту уже через несколько минут. Используем ту же инфраструктуру, что и у голосового агента: WebRTC SFU + STT + LLM, но без синтеза речи. Про смежную тему — синхронный перевод встреч — мы подробно писали в отдельном обзоре.

12-недельный план от нуля до живого агента

Недели 1–2 — discovery и анализ звонков. Подберите 200 репрезентативных записей звонков. Отметьте намерения, триггеры эскалации, паттерны PII и режимы отказа, которые агент обязан отрабатывать. На основе описанного фреймворка выберите архитектуру.

Недели 3–6 — пилотная сборка. Соберите SFU + STT + LLM + TTS для одной задачи (например, проверка статуса заказа). Сначала запустите для внутренних пользователей, собирайте данные по задержкам и уровню удовлетворённости (CSAT).

Недели 7–9 — закрытая бета. 5–10% реального трафика, A/B-тестирование против базовой версии с участием человека. Подключите передачу оператора с контекстом. Настройте endpointing, AEC и промпты.

Недели 10–12 — продакшен-раскатка. Расширьте охват до 100% выбранного намерения, добавьте дашборды для отслеживания состояния системы, определите SLO и спланируйте второе намерение. К концу 12-й недели у вас должна быть обоснованная оценка стоимости решения и чёткий план миграции для следующего сценария.

Нативные мультимодальные модели вытесняют каскады. Одна модель принимает аудио, видео и текст и выдаёт речь (а скоро и видео), заменяя трёхвендорные стеки одним API-вызовом. Ожидайте меньшую задержку и более тесное взаимодействие между модальностями — ценой ещё большей зависимости от вендоров.

Edge-инференс становится нормой. Открытые языковые модели на 7–13 млрд параметров, работающие на NVIDIA Jetson или локальных GPU AMD, обеспечивают задержку менее 200 мс и не передают данные за пределы устройства. Первые пользователи — регулируемые отрасли (оборона, медицина, госсектор); вслед за ними перейдут ритейл и полевые сервисы.

Звонки агента к агенту. Два ИИ договариваются о возврате средств, согласовывают встречи по календарям или завершают онбординг поставщика. Пока это эксперимент: модели предотвращения зацикливания и распределения полномочий ещё не до конца проработаны, но техническая работа уже ведётся в LiveKit, Daily и новых рабочих группах W3C по агентам.

Голосовая биометрия внутри WebRTC. Идентификация по голосу пользователя прямо во время звонка — без необходимости отдельного шага. Снижает неудобства в банкинге и медицине и требует нового подхода к защите приватности.

FAQ

Достаточно ли WebRTC безопасен для ИИ-агентов в чувствительных разговорах?

Медиа в WebRTC по умолчанию шифруется с помощью DTLS-SRTP, что обеспечивает защищённый канал. Точки риска — SFU (он расшифровывает данные для маршрутизации пакетов), LLM-провайдер (имеет доступ к транскриптам) и ваше хранилище данных. При соблюдении требований HIPAA, GDPR или SOC 2 вам необходимо заключить BAA или DPA с каждым поставщиком услуг на этом пути, а также обеспечить контроль доступа и вести аудит логов для хранилища.

Нужно ли переписывать WebRTC-продукт, чтобы добавить ИИ-агента?

Почти никогда. Агент подключается к существующему SFU как обычный участник: подписывается на аудиодорожки других участников в комнате и транслирует своё синтезированное аудио. Если ваш SFU — LiveKit, mediasoup или Janus, интеграция займёт несколько дней, а не недель. Время уходит на настройку промптов, защиту от ошибок, мониторинг и передачу управления человеку, а не на реализацию самого WebRTC-слоя.

Сколько на самом деле занимает развёртывание в продакшене?

Сфокусированный пилот с одним намерением реализуется за 4–6 недель. Полноценный запуск в продакшен с мониторингом, соблюдением требований, передачей оператору и минимум двумя намерениями обычно занимает 12 недель. Мультимодальные визуальные агенты требуют дополнительно 2–4 недели на настройку визуального пайплайна.

Какой самый дешёвый адекватный стек для голосового агента в продакшене?

Self-hosted Pipecat на сервере Hetzner, mediasoup в роли SFU, Whisper.cpp для распознавания речи, Llama 3.1 8B на Groq или локальной GPU и Cartesia Sonic для синтеза речи. При умеренных нагрузках маржинальная стоимость минуты падает ниже 3,7 ₽. Компромисс — вы сами отвечаете за эксплуатацию, мониторинг и безопасность.

Заменит ли агент нашу команду живой поддержки?

Почти ни одно успешное внедрение, что мы видели, не заменяет людей полностью. Рабочий паттерн — ИИ берёт на себя основную массу рутинных запросов (50–80% containment), а люди сосредоточены на сложных, эмоциональных и важных для выручки разговорах. Численность команды обычно остаётся прежней, а нагрузка на одного сотрудника удваивается.

Как измерять успех ИИ-агента в продакшене?

Три ведра: качество (P95 задержки, WER, точность срабатывания на перебивание), бизнес (containment, CSAT относительно человеческой базы, стоимость одного решения), надёжность (аптайм, drop rate, успешность передачи оператору с полным контекстом). Выберите один основной KPI на тип звонка — обычно это containment или конверсия, — и держите остальные как guardrails.

Speech-to-speech (OpenAI Realtime) или каскад — с чего начать?

Если нужно быстро запустить за несколько дней, а диалог короткий — начните с OpenAI Realtime: вы проверите продукт раньше, чем будете оптимизировать архитектуру. Если с самого начала важна юнит-экономика или комплаенс требует контроля над каждым слоем — выбирайте каскад на основе LiveKit Agents или Pipecat. Многие наши клиенты сначала прототипируют на Realtime, а затем переносят сложные сценарии в каскад, как только объём общения оправдывает переход.

Справится ли агент с не-английскими языками и акцентами?

Да, но провайдеров нужно выбирать. AssemblyAI Universal-2 и Deepgram Nova-3 поддерживают 30–100 языков с измеримой точностью на английском с акцентом. Cartesia и ElevenLabs предлагают мультиязычные голоса; для языков за пределами топ-30 потребуется дообучение модели. И задержка, и точность вне английского снижаются — закладывайте дополнительное время на проверку качества.

Гид по сборке

Сборка и развёртывание голосовых ИИ-агентов на LiveKit

Пошаговый бизнес-гид по запуску агента на LiveKit.

Мультимодальность

Мультимодальные ИИ-агенты на LiveKit

Голос + зрение: продакшен-обвязка для камероориентированных агентов.

Архитектура

Гид по архитектуре WebRTC в 2026

P2P, SFU, MCU и гибридные топологии — для владельцев продуктов.

Голосовой ИИ

Разработка голосового ИИ-ассистента в 2026

Полный гид для владельцев продуктов, которые заказывают голосовой ИИ.

Выбор вендора

Альтернативы Agora.io для собственного WebRTC

LiveKit, mediasoup, Jitsi и Janus в сравнении в продакшене.

Готовы внедрить ИИ-агента поверх вашего WebRTC-стека?

За два года ИИ-агенты на WebRTC прошли путь от демонстрации до полноценного использования в продакшене. Модели speech-to-speech обеспечивают задержку менее 300 мс для премиальных голосовых сценариев. Каскадные пайплайны на базе LiveKit или Pipecat снижают стоимость минуты в 3–5 раз и обеспечивают полную прозрачность работы. В обоих случаях слой SFU, который уже используется вашей командой, становится точкой подключения: интеграция занимает несколько дней кода вместо месяцев настройки, проверки соответствия требованиям и тестирования.

Если у вас есть продукт в реальном времени, а вы ещё не используете хотя бы одного ИИ-агента — ваши конкуренты уже это делают. Главное — построить архитектуру, которая подходит под вашу юнит-экономику, а не просто следует трендам. И не экономить на «скучных», но важных вещах: очередность реплик, AEC, передача оператора, комплаенс. Именно от них зависит, будет ли агент восприниматься как живой.

Запустить ИИ-агента в реальном времени за 12 недель?

Принесите профиль звонков, бюджет задержек и требования по комплаенсу. По итогам звонка вы получите рекомендованный стек технологий, 12-недельный план реализации и обоснованную стоимость одного звонка.

Позвоните нам → Напишите нам →

  • Разработка
    Технологии