ИИ-агенты на WebRTC в 2026: архитектура, задержки, стоимость и соответствие требованиям
Главное
• ИИ-агенты на WebRTC уже укладываются в 500 мс. Модели speech-to-speech, такие как OpenAI gpt-realtime и Gemini Live, обеспечивают общую задержку 150–300 мс; каскад STT→LLM→TTS — 500–800 мс. Оба варианта в разговоре воспринимаются естественно.
• На рынке доминируют две архитектуры. Speech-to-speech — самый быстрый и простой вариант, но он привязывает вас к одному поставщику. Каскад (Deepgram + открытая LLM + ElevenLabs/Cartesia) обходится в 3–5 раз дешевле и позволяет менять модели от звонка к звонку.
• Разрыв в стоимости огромен. OpenAI Realtime стоит около 15 ₽ за минуту; настроенный каскад на Deepgram Nova-3 + Llama 8B + Cartesia Sonic — 3–6,7 ₽ за минуту. Выбирайте архитектуру, исходя из юнит-экономики конкретного типа звонка.
• Естественное ощущение создаётся не просто задержкой, а правильным управлением очередностью реплик. Один VAD не справляется с шумом и поддакиваниями. В продакшене агенты комбинируют VAD, ML-модель для определения конца реплики, AEC и мгновенное прерывание TTS, чтобы поддерживать перебивание (barge-in) за ~300 мс.
• Комплаенс — это шлагбаум. Если вы работаете с медициной, финансами или пользователями из ЕС, стек должен с самого начала поддерживать HIPAA, SOC 2 Type II и хранение данных в соответствии с GDPR. Добавлять это после пилота — значит удвоить бюджет.
Почему этот плейбук написала Фора Софт
Мы разрабатываем продукты для видеосвязи и голосовой связи в реальном времени уже 21 год: за это время мы провели более 625 запусков. WebRTC — это технология, с которой мы работаем каждый день: от виртуального класса BrainCert (1 млн+ учеников, 500 млн+ минут обучения в 10 дата-центрах) до VOLO.live — нашей платформы синхронного ИИ-перевода, которая обслужила более 22 000 участников Black Hat Briefings 2025 и HIMSS.
Когда мы говорим «ИИ-агенты на WebRTC», мы имеем в виду реальную продакшен-ситуацию: пользователь подключается к SFU как обычный участник комнаты, слушает живой RTP-поток, модель обрабатывает запрос за 200 мс, а синтезированная речь возвращается ещё до того, как пользователь успевает вдохнуть. На первый взгляд это просто, но на деле — задача непростая. Этот гид — сводка того, что мы даём нашим архитекторам, когда клиент спрашивает: «Что мне на самом деле строить?» Здесь — четыре проверенные архитектуры, экономическая эффективность каждой и скрытые проблемы, которые могут тихо убить пилотный проект.
Читайте как CTO: переходите сразу к матрице сравнения, модели стоимости или фреймворку выбора, если вам это нужно. Или закажите 30-минутный архитектурный разбор — пройдёмся по вашему стеку в прямом эфире.
Выбираете между OpenAI Realtime и каскадом?
Прогоним обе архитектуры на профиле вашего трафика и подберём ту, что укладывается в бюджет задержек по минимальной стоимости минуты. Без презентаций — только цифры.
Что реально изменилось в 2024–2026
Три вещи помогли вывести связку ИИ + WebRTC из демо в реальный продукт. Во-первых, нативные модели speech-to-speech: OpenAI gpt-realtime и Google Gemini Live принимают аудио и возвращают аудио напрямую, без промежуточной расшифровки — это убирает два этапа задержки и сохраняет интонацию. Во-вторых, сверхбыстрый синтез речи: ElevenLabs Flash v2.5 выдаёт первый фрагмент звука за ~75 мс, Cartesia Sonic — за ~40 мс, и сигнал «я тебя слышу» приходит раньше, чем пользователь успевает раздражаться. В-третьих, агентные фреймворки поверх SFU: LiveKit Agents, Pipecat и Daily/ Vapi сократили шестинедельную интеграцию до готового каркаса за неделю.
В итоге мы получили разговорного ИИ, который подключается к WebRTC-комнате как участник, слышит аудио, ведёт диалог из 30 реплик с сохранением контекста, передаёт его человеку со всей информацией и обходится дешевле живого оператора. В 2023 году это было демонстрацией. К 2026 году — базовый стандарт в клиентской поддержке, подборе клиентов, телемедицине и онлайн-обучении.
WebRTC за 90 секунд — для владельцев продуктов
WebRTC — это открытый стандарт, по которому браузеры и мобильные приложения обмениваются аудио, видео и данными с задержкой меньше 200 мс. Полный гид — в нашей статье об архитектуре WebRTC; кратко это четыре составляющие:
- Медиадорожки — аудио и видео, передаваемые поверх UDP/SRTP с встроенным DTLS-шифрованием.
- Сигнализация — это ваш собственный сервер, через который участники обмениваются SDP-предложениями и ответами, чтобы найти друг друга.
- ICE / STUN / TURN — технологии для обхода NAT, чтобы два участника за фаерволами могли реально соединиться.
- Топология SFU или P2P — для двух участников подойдёт P2P; от трёх и больше почти всегда нужен Selective Forwarding Unit (LiveKit, mediasoup, Janus), который маршрутизирует медиа.
Для ИИ-агента точкой подключения служит SFU: агент заходит в комнату как обычный участник, подписывается на аудиодорожку каждого активного участника и публикует своё синтезированное аудио обратно. Никакого специального протокола — используется тот же WebRTC, что и в браузере. Именно эта симметрия и сделала интеграцию естественной.
Четыре архитектуры, которые реально используются в продакшене
Почти любая продакшен-система ИИ + WebRTC сводится к одному из четырёх паттернов. Выбирайте в зависимости от допустимой задержки, готовности к привязке к вендору и необходимого объёма звонков.
1. Speech-to-speech (OpenAI Realtime, Gemini Live)
Одна мультимодальная модель принимает аудио на вход и выдаёт аудио на выходе. Агент подключается через WebRTC (браузер) или WebSocket (сервер) напрямую к OpenAI или Google. Самая низкая сквозная задержка — 150–300 мс, лучшая интонация, самый простой код — но LLM нельзя заменить, «рассуждения» не проследить, а минута стоит дороже всех альтернатив на рынке.
Выбирайте speech-2-speech, когда: задержка должна быть меньше 400 мс, разговор короткий (до примерно 3 минут) и вы готовы платить 11–15 ₽ за минуту аудио. Sales-боты, голосовой онбординг, премиальный IVR.
2. Каскад STT → LLM → TTS
Классический стек: Deepgram или AssemblyAI стримят транскрипцию; LLM (GPT-4o, Claude, Llama 3 8B/70B) генерирует ответ; ElevenLabs или Cartesia синтезируют речь обратно. Оркестрацию обеспечивают LiveKit Agents или Pipecat. Полная задержка — 500–800 мс, зато каждый компонент можно быстро заменить, всё отслеживается в логах, а стоимость остаётся низкой. Большинство корпоративных решений работают именно на такой архитектуре.
Берите каскад, когда: нужно тестировать разные LLM, вести логирование транскриптов для соответствия требованиям или снизить стоимость минуты ниже 7,5 ₽ при больших объёмах. Контакт-центры, приём у врача, поддержка клиентов.
3. Мост SIP / PSTN к WebRTC-агенту
Для входящих и исходящих звонков. SIP-транк (Twilio, Telnyx) подключается к WebRTC SFU; агент работает по той же схеме, что и в паттерне 2. Телефония добавляет джиттер 100–300 мс, но обеспечивает доступ к PSTN и понятные регуляторные пути. Vapi и Retell AI — готовые решения с поддержкой; LiveKit, Pipecat и Plivo — варианты для самостоятельной сборки.
Берите SIP-мост, когда: звонок начинается с телефонного номера, а не из вашего приложения. Исходящие продажи, напоминания о встречах, страховые случаи, запись в автосервис.
4. Мультимодальный визуальный агент на живой видеодорожке
Агент подписывается и на аудио, и на видео, отправляет отдельные кадры в визуальную модель (GPT-4o, Gemini 2.5, мультимодальный Claude 4), сопоставляет их с речью и формирует ответ. Анализ по кадрам добавляет задержку 400–800 мс, поэтому частоту кадров для обработки снижают до 1–3 кадров в секунду, а аудио обрабатывается без ограничений. Такой подход используется в KYC-верификации, управляемом онбординге в приложении, контроле качества на производстве и удалённой поддержке на местах. Подробности о производственной реализации мы описали в материале о мультимодальных агентах на LiveKit.
Берите мультимодальную модель, когда: агент должен видеть то же, что и пользователь — документы, повреждённый товар, экран приложения, реальное рабочее место. Телемедицинский триаж, страховые претензии с фото повреждений, AR-поддержка в полях.
Матрица сравнения — четыре архитектуры рядом
| Паттерн | Сквозная задержка | Стоимость / мин | Вендор-лок | Время запуска | Когда подходит |
|---|---|---|---|---|---|
| Speech-to-speech (OpenAI / Gemini) | 150–300 мс | 11–15 ₽ | Высокий | ~1 день | Голосовой онбординг, sales-боты |
| Каскад STT→LLM→TTS | 500–800 мс | 3–6,7 ₽ | Низкий | 2–3 недели | Контакт-центры, медицинский приём |
| SIP/PSTN-мост | 600 мс – 1,2 с | 4,5–12 ₽ | Средний | 2–4 недели | Входящие и исходящие телефонные звонки |
| Мультимодальный визуальный агент | 700 мс – 2 с | 7,5–22 ₽ | Средний | 4–6 недель | KYC, телемедицинский триаж, полевой сервис |
| Open-source on-prem (Whisper + Llama + Coqui) | 600–900 мс | ~0 ₽ маржинальной (CapEx) | Нет | 6–10 недель | Чувствительные данные, регулирование, edge |
Бюджет задержек — куда уходит каждая миллисекунда
Человек начинает замечать паузу примерно с 250–300 мс тишины. На 500 мс это ощущается как «немного запоздало», на 800 мс пользователь думает, что связь оборвалась, на 1,5 с он кладёт трубку. Чтобы сохранить ощущение живого разговора, путь от «пользователь замолчал» до «агент начал говорить» должен укладываться в 800 мс, а лучше — в 500 мс.
В каскаде бюджет распределяется примерно так:
| Этап | Типично (мс) | Агрессивно (мс) |
|---|---|---|
| Аудио пользователя → SFU (сеть) | 40–100 | 30 |
| Определение конца реплики (VAD + endpointing) | 400–600 | 200–300 |
| Стриминговый STT (Deepgram Nova-3, P50) | 200–300 | ~150 |
| LLM до первого токена | 200–400 | 100–150 (Llama 8B / Groq) |
| TTS до первого аудио | 100–200 | 40–75 (Cartesia / EL Flash) |
| SFU → аудио пользователю | 40–100 | 30 |
Доминируют два этапа: определение конца реплики и время до первого токена LLM. Если слишком жёстко настроить endpointing — агент начнёт перебивать собеседника; если выбрать медленную LLM — вся цепочка замедлится. Искусство в том, чтобы передавать первое предложение LLM в TTS, как только сгенерируется 8–15 токенов («спекулятивная речь»), чтобы аудио началось раньше, чем модель закончит думать.
Очерёдность реплик, перебивание и почему наивный VAD ломает демо
Задержка делает агента быстрым. Управление очередью реплик делает его вежливым. Большинство проваленных пилотов, которые мы проверяли, имели нормальный STT и адекватные LLM, но общались неестественно: агент перебивал пользователя, слишком долго молчал после поддакиваний или не давал перебить себя посередине фразы.
Продакшен-менеджер реплик нужен в четырёх слоях:
1. Непрерывный VAD — классификатор окна 30–50 мс (Silero VAD, WebRTC VAD), который определяет наличие голоса. Дёшево, работает на CPU, срабатывает на любой звук, включая кашель и стук клавиатуры.
2. Модель конца реплики — небольшая ML-модель (есть в LiveKit, у Pipecat это SmartTurn), которая по аудио и последнему частичному транскрипту определяет: «пользователь точно закончил говорить?». Уменьшает задержку с наивных 800 до примерно 300 миллисекунд и не делает речь рваной.
3. Эхокомпенсация (AEC) — обязательна, если голос агента, сгенерированный TTS, воспроизводится через колонки пользователя, а микрофон улавливает этот звук обратно. Без AEC агент будет «слышать сам себя» и отвечать на собственный голос. У браузеров AEC уже встроена; в нативных приложениях и headless-агентах её нужно подключать отдельно.
4. Мгновенное прерывание TTS — когда пользователь реально прерывает ответ (а не просто говорит «м-м-м»), система сбрасывает аудиобуфер, останавливает генерацию LLM, возвращает диалоговое состояние к частичному ответу, а STT начинает распознавать новую реплику. Цель — достичь тишины со стороны агента примерно за 300 мс с момента прерывания.
Слой инструментов — сначала фреймворк, потом провайдеры
Ниже — краткий список фреймворков, которые наша команда реально использует в продакшене. Ни один из них не «неправильный»: просто каждый оптимизирован под свои задачи.
| Фреймворк | Сильная сторона | Компромисс | Кому подходит |
|---|---|---|---|
| LiveKit Agents | Лучший SFU; нативные VoicePipelineAgent и MultimodalAgent; облако с сертификациями SOC 2 и HIPAA | Базовая цена выше, чем у self-hosted | Корпоративные команды, которым нужен управляемый масштаб |
| Pipecat (Daily) | Оркестрация под лицензией MIT; модульная, провайдеров легко заменить | Деплой и наблюдаемость — на вас | Команды, которым важна стоимость и есть DevOps |
| Vapi / Retell AI | Сначала телефон; исходящий обзвон за несколько дней; управляемый комплаенс | Меньше контроля; наценка на стоимость провайдеров | Исходящие продажи, напоминания о встречах |
| OpenAI Agents SDK + Realtime | Минимум подвижных частей; лучшая интонация | Один вендор; самая высокая цена за минуту | Премиальные голосовые продукты, MVP |
| mediasoup + свой оркестратор | Полный контроль над кодом; развёртывается on-prem и на edge | Месяцы разработки, а не недели | Регулируемые отрасли, on-prem, суверенное облако |
Из STT мы обычно используем Deepgram Nova-3 (минимальная задержка, около 0,32 ₽ за минуту) или AssemblyAI Universal-2 (выше точность на акцентном английском, около 0,14 ₽ за минуту). Из TTS — Cartesia Sonic, когда важна низкая задержка, и ElevenLabs Flash v2.5, когда голос должен звучать убедительно. С LLM ситуация меняется: Llama 3.1 8B на Groq — для дешёвых сценариев, GPT-4o или Claude 4 — для сложных tool-цепочек, а собственный fine-tune — для доменов, которые нельзя передавать сторонним вендорам.
Застряли между LiveKit, Pipecat и Vapi?
Мы поставляли продукты на всех трёх. Дайте профиль звонков и бюджет — порекомендуем фреймворк, который укладывается и в то, и в другое, а также подходящих провайдеров.
Эталонная архитектура, которую можно скопировать
Чистый каскад для голосового агента поддержки B2B SaaS выглядит так:
Browser / Mobile (WebRTC client)
| audio + video tracks
v
LiveKit / mediasoup SFU ────────► Recording & transcript store (S3 + Postgres)
| audio track subscribed
v
Agent worker (Python / Node)
├─ VAD (Silero)
├─ End-of-turn model
├─ Streaming STT (Deepgram Nova-3)
├─ LLM orchestrator (LangGraph / Pipecat)
│ ├─ tool calls → CRM / KB / payments
│ └─ guardrails + PII redaction
├─ Streaming TTS (Cartesia Sonic)
└─ Barge-in / pre-emption controller
| publishes synthesized audio
v
SFU → user
|
└─► Observability (OpenTelemetry → Datadog / Grafana)
Каждый блок справа в пилотной версии опционален, в продакшене — обязателен: запись для QA, наблюдаемость для SLO по задержкам, guardrails для защиты PII, tool calls — чтобы агент реально что-то делал (бронировал встречу, оформлял возврат, обращался к базе знаний). Любопытный архитектурный выбор — где хранить состояние: историю диалога держим в Redis с TTL 24 часа, а полные транскрипты сессий сохраняем в Postgres для аналитики на долгосрочной дистанции.
Расчёт стоимости — 100 000 минут звонков в месяц
Цифры решают архитектурные споры быстрее любых диаграмм. Возьмём типичное внедрение поддержки клиентов в среднем сегменте: 100 000 пользовательских минут в месяц, средняя продолжительность звонка — 3,5 минуты, агент говорит около 40% времени. Ниже — месячный счёт по трём архитектурам, которые мы поставляем чаще всего.
| Статья расходов | OpenAI Realtime | Каскад (управляемый) | Каскад (self-hosted) |
|---|---|---|---|
| Маршрутизация медиа в SFU | 30 000 ₽ (LiveKit Cloud) | 30 000 ₽ (LiveKit Cloud) | 22 500 ₽ (кластер Hetzner AX52) |
| STT | входит в стоимость | 32 250 ₽ (Deepgram Nova-3) | 14 250 ₽ (Whisper.cpp on-prem) |
| LLM | входит в ₽/мин | 135 000 ₽ (GPT-4o-mini) | 52 500 ₽ (Llama 3.1 8B / Groq) |
| TTS | входит в стоимость | 180 000 ₽ (ElevenLabs Flash) | 90 000 ₽ (Cartesia Sonic API) |
| Аудио-модели в реальном времени | 1 350 000 ₽ (~13,5 ₽/мин в среднем) | — | — |
| Итого в месяц (приблизительно) | ~1,3 млн ₽ | ~377 тыс. ₽ | ~179 тыс. ₽ |
Разрыв в 3,6 раза между самым простым решением и самым дешёвым каскадом достаточен, чтобы профинансировать небольшую инженерную команду. На первые 6–12 месяцев мы обычно рекомендуем управляемый каскад — он быстрее всего запускается, и команда успевает набрать операционный опыт; затем, когда объём оправдает миграцию, слои LLM и TTS переводятся на self-hosted. Цифры иллюстративные: реальный счёт зависит от структуры звонков, стоимости клонирования голосов и скидок за объём.
Мини-кейс — как VOLO.live ведёт ИИ в реальном времени для 22 000 участников
Контекст. Продукту синхронного перевода для конференций требовались распознавание речи и озвучка перевода в реальном времени для глобальных мероприятий — HIMSS, Black Hat Briefings, GDC. Задержка должна была быть почти незаметной, аудио — синхронным со спикером на сцене, а любая техническая ошибка сразу бросилась бы в глаза тысячам платных участников.
Что мы построили. WebRTC-инжест с площадки, аудио уходит в Speechmatics и Google Cloud Speech для стримингового STT, ИИ-слой перевода выдаёт и субтитры, и закадровый голос на 25+ языках, NestJS-бэкенд оркеструет переключение языка, а Next.js-приложение участника открывается по QR-коду на месте. У спикеров и организаторов — админпанели для включения и выключения языков на лету; участник выбирает язык в два касания.
Результат. Развёрнуто на Black Hat Briefings 2025 (более 22 000 участников), HIMSS, GDC и других крупных конференциях. Перевод в реальном времени с задержкой субтитров менее секунды, естественно звучащий закадровый голос и удобный с точки зрения лицензий мультивендорный стек STT/перевода, который заказчик может масштабировать. Хотите такой же разбор своего ИИ-стека в реальном времени?
Безопасность и комплаенс — что закладывать с первого дня
WebRTC по умолчанию шифрует медиа в транзите (DTLS-SRTP). Вся остальная работа по обеспечению соответствия требованиям — вне этого процесса: на SFU (он завершает шифрование, чтобы маршрутизировать трафик), у LLM-провайдера (ему доступны транскрипты), на стороне хранилища (где хранятся записи и транскрипты) и на уровне согласия (в большинстве юрисдикций вы обязаны информировать пользователя, что с ним общается ИИ).
1. HIPAA (медицина в США). С каждым поставщиком, который работает с защищённой медицинской информацией — SFU, STT, LLM, TTS, хранилищем — нужен подписанный BAA. LiveKit Cloud, Deepgram и OpenAI предоставляют BAA на корпоративных тарифах, ElevenLabs — только на enterprise-плане. PHI в транскриптах должна быть зашифрована при хранении и сопровождаться логами доступа.
2. GDPR (пользователи из ЕС). Ловушка — хранение данных: SFU и LLM должны находиться в ЕС, если через них проходят данные пользователей. У OpenAI в enterprise-версии есть возможность размещения в ЕС; многие open-source решения с самохостингом оказываются проще, чем оформление всей документации.
3. SOC 2 Type II. Требуется при большинстве корпоративных закупок. Аудит проверяет безопасность, доступность и конфиденциальность всей системы. Выбирайте поставщиков, у которых сертификат уже есть (LiveKit, Deepgram, AssemblyAI, OpenAI, Cartesia) — цепочка доверия останется целой.
4. PCI-ДSS. Если агенту понадобится хотя бы раз принять номер карты, передавайте этот фрагмент аудио через токенизирующего вендора (Cresta, AudioCodes), чтобы LLM никогда не видела исходный PAN. Не позволяйте GPT-4 транскрибировать номер карты — ни при каких обстоятельствах.
5. Согласие и раскрытие ИИ. В Калифорнии, Иллинойсе, Колорадо и по AI Act ЕС требуется чётко сообщать, что собеседник — искусственный интеллект. Убедитесь, что информация о том, что вы общаетесь с ИИ, звучит в первые 5 секунд каждого звонка, и фиксируйте подтверждение пользователя.
Пять подводных камней, которые тихо хоронят продакшен-агентов
1. Холодный старт LLM. Если контейнер с LLM масштабируется до нуля, первый запрос после простоя будет ждать загрузки модели 2–5 секунд. Держите хотя бы две «тёплые» реплики, подавая им синтетический пинг раз в 30 секунд — или используйте управляемый эндпоинт, который сам сохраняет модель в памяти (например, Groq, OpenAI, Anthropic).
2. Раздувание контекста. Диалог из 30 реплик легко превышает 10 000 токенов; стоимость работы LLM растёт линейно, а задержка — быстрее. Каждые 8–10 реплик сжимайте в скользящее состояние и удаляйте исходный текст из промпта; полный диалог храните отдельно для проверки и анализа.
3. Многословный TTS. Поскольку TTS тарифицируется посимвольно, болтливая модель — это дорогая модель. Ограничивайте ответы примерно 80 словами, давайте LLM инструкцию говорить кратко и отдавайте предпочтение экстрактивным ответам («ваш последний счёт — 6 525 ₽») вместо генеративных («отличный вопрос, давайте я объясню…»).
4. Нет пути передачи человеку. Агент ошибётся. Стек должен передать звонок оператору с полной транскрипцией, кратким резюме и чётко определённым намерением пользователя — а не «холодным» переводом, после которого клиент вынужден всё повторять с начала. Делайте долю успешных передач ключевым KPI высшего уровня.
5. Отношение к SFU как к «просто трубам». География задержек зависит от местоположения SFU: американский сервер, обслуживающий пользователя из APAC, добавляет 200–300 мс ещё до начала разговора. Выбирайте поставщика SFU с edge-узлами в нужных регионах или разверните свои на Hetzner / OVH / Equinix в ключевых точках.
KPI — что измерять, когда вы уже в продакшене
KPI качества. P50 и P95 задержки туда-обратно (цель: P50 < 600 мс, P95 < 1 с), ошибка распознавания слов в STT (< 8% для поддержки), доля ложных перебиваний (< 5%), частота самосрабатывания AEC (~0).
KPI бизнеса. Containment rate / отклонение звонков (доля звонков, полностью обработанных ИИ; цель — 50–75% в поддержке, 80%+ в self-service), CSAT по звонкам, обработанным ИИ (в пределах 0,3 от базового уровня людей), стоимость одного решённого обращения (цель — ниже 25% от стоимости при работе с людьми), доля апселлов или квалифицированных лидов по исходящим звонкам.
KPI надёжности. Время работы агента (не менее 99,9%), доля обрывов звонков (менее 0,5%), передача оператора с полным контекстом (более 98%), доля обнаружения PII или небезопасного контента по guardrails (точность и полнота рассчитываются отдельно).
Когда ИИ-агента на WebRTC не запускать
Три сценария, где ответ — нет или пока нет. Сильно эмоциональные звонки и звонки на грани жизни: телефоны доверия по суициду, посттравматическая поддержка, разговоры о конце жизни. ИИ не должен первым брать трубку; направляйте такие звонки людям, а ИИ используйте для бэкенд-поддержки и составления отчётов после разговора. Сферы, где ошибка дороже выгоды от ускорения: юридические консультации, выписка рецептов на контролируемые препараты, регулируемые финансовые советы. Одна ошибка может стоить больше, чем экономия трёх месяцев времени. Объёмы ниже ~5000 минут в месяц: затраты на интеграцию, мониторинг и соблюдение норм не окупятся. Пока не достигнете этого порога, используйте чат-бота или живого оператора.
Фреймворк выбора — пять вопросов перед архитектурой
В1. Какой жёсткий потолок задержки? Меньше 400 мс — speech-to-speech (OpenAI Realtime, Gemini Live). 500–800 мс — управляемый каскад. Выше — подойдёт что угодно.
В2. Какой потолок стоимости одного звонка? Ниже 7,5 ₽ за минуту — только каскад на дешёвых провайдерах (Deepgram + Llama 8B + Cartesia). Бюджет от 15 ₽ за минуту открывает более простые готовые решения.
В3. Откуда приходят звонки? Из вашего приложения — чистый WebRTC. С телефонных номеров — SIP-мост через Vapi, Retell или LiveKit Telephony. И то, и другое: соберите каскад один раз и подключите оба транспорта.
В4. Какой режим комплаенса? HIPAA + GDPR ЕС + PCI вместе толкают вас к LiveKit Cloud + AssemblyAI + Anthropic Claude на AWS Bedrock с резидентностью в ЕС — или к полностью self-hosted open-source.
В5. Нужен ли агенту глаз? Если да (KYC, телемедицина, выездной сервис), используйте MultimodalAgent в LiveKit Agents или Pipecat с визуальной моделью на 1–3 fps. Если нет — оставайтесь на чистом аудио: зрение втрое повышает стоимость и задержку.
Нужно второе мнение по вашему голосовому ИИ-стеку?
30-минутный разбор с нашими архитекторами голосового ИИ: бюджет задержек, стоимость минуты, сбои в комплаенсе и план запуска в продакшен за 12 недель.
Сценарии, которые уже окупаются в 2026
Поддержка клиентов уровня tier-0. Голосовой агент решает вопросы с сбросом паролей, проверяет статус заказа, отвечает на частые вопросы по оплате и перенаправляет всё остальное — с полным контекстом. Практика в отрасли показывает, что 50–80% таких обращений закрываются автоматически; стоимость одного решённого запроса снижается примерно до четверти от стоимости работы человека.
Discovery и квалификация в продажах. Агент совершает первый звонок, задаёт вопросы по ICP, оценивает лида и бронирует встречу в календаре менеджера по продажам. Такой подход полезен при большом количестве входящих заявок, когда SDR не успевают справляться. Подробнее — в нашей статье об ИИ-ассистентах для звонков.
Приём в телемедицине и наблюдение после визита. Искусственный интеллект собирает симптомы, список принимаемых лекарств и согласие пациента до подключения врача, а затем занимается рутинными повторными приёмами. Такой подход естественно вписывается в нашу работу над платформами телемедицины — с использованием HIPAA-уровня WebRTC и ИИ-агента с защитой персональных медицинских данных (PHI).
Онлайн-репетиторство и онбординг. Агент заходит на занятие, наблюдает за уроком, отвечает на вопросы ученика и готовит краткое резюме для преподавателя. Если делать это качественно, такой подход повышает вовлечённость, не заменяя при этом самого преподавателя — аналогичный принцип использует BrainCert с более чем 1 млн учеников.
Real-тайм копилоты для встреч. Прямая транскрипция, задачи и итоги — на почту уже через несколько минут. Используем ту же инфраструктуру, что и у голосового агента: WebRTC SFU + STT + LLM, но без синтеза речи. Про смежную тему — синхронный перевод встреч — мы подробно писали в отдельном обзоре.
12-недельный план от нуля до живого агента
Недели 1–2 — discovery и анализ звонков. Подберите 200 репрезентативных записей звонков. Отметьте намерения, триггеры эскалации, паттерны PII и режимы отказа, которые агент обязан отрабатывать. На основе описанного фреймворка выберите архитектуру.
Недели 3–6 — пилотная сборка. Соберите SFU + STT + LLM + TTS для одной задачи (например, проверка статуса заказа). Сначала запустите для внутренних пользователей, собирайте данные по задержкам и уровню удовлетворённости (CSAT).
Недели 7–9 — закрытая бета. 5–10% реального трафика, A/B-тестирование против базовой версии с участием человека. Подключите передачу оператора с контекстом. Настройте endpointing, AEC и промпты.
Недели 10–12 — продакшен-раскатка. Расширьте охват до 100% выбранного намерения, добавьте дашборды для отслеживания состояния системы, определите SLO и спланируйте второе намерение. К концу 12-й недели у вас должна быть обоснованная оценка стоимости решения и чёткий план миграции для следующего сценария.
Что дальше — тренды, на которые стоит закладывать бюджет в 2026–2027
Нативные мультимодальные модели вытесняют каскады. Одна модель принимает аудио, видео и текст и выдаёт речь (а скоро и видео), заменяя трёхвендорные стеки одним API-вызовом. Ожидайте меньшую задержку и более тесное взаимодействие между модальностями — ценой ещё большей зависимости от вендоров.
Edge-инференс становится нормой. Открытые языковые модели на 7–13 млрд параметров, работающие на NVIDIA Jetson или локальных GPU AMD, обеспечивают задержку менее 200 мс и не передают данные за пределы устройства. Первые пользователи — регулируемые отрасли (оборона, медицина, госсектор); вслед за ними перейдут ритейл и полевые сервисы.
Звонки агента к агенту. Два ИИ договариваются о возврате средств, согласовывают встречи по календарям или завершают онбординг поставщика. Пока это эксперимент: модели предотвращения зацикливания и распределения полномочий ещё не до конца проработаны, но техническая работа уже ведётся в LiveKit, Daily и новых рабочих группах W3C по агентам.
Голосовая биометрия внутри WebRTC. Идентификация по голосу пользователя прямо во время звонка — без необходимости отдельного шага. Снижает неудобства в банкинге и медицине и требует нового подхода к защите приватности.
FAQ
Достаточно ли WebRTC безопасен для ИИ-агентов в чувствительных разговорах?
Медиа в WebRTC по умолчанию шифруется с помощью DTLS-SRTP, что обеспечивает защищённый канал. Точки риска — SFU (он расшифровывает данные для маршрутизации пакетов), LLM-провайдер (имеет доступ к транскриптам) и ваше хранилище данных. При соблюдении требований HIPAA, GDPR или SOC 2 вам необходимо заключить BAA или DPA с каждым поставщиком услуг на этом пути, а также обеспечить контроль доступа и вести аудит логов для хранилища.
Нужно ли переписывать WebRTC-продукт, чтобы добавить ИИ-агента?
Почти никогда. Агент подключается к существующему SFU как обычный участник: подписывается на аудиодорожки других участников в комнате и транслирует своё синтезированное аудио. Если ваш SFU — LiveKit, mediasoup или Janus, интеграция займёт несколько дней, а не недель. Время уходит на настройку промптов, защиту от ошибок, мониторинг и передачу управления человеку, а не на реализацию самого WebRTC-слоя.
Сколько на самом деле занимает развёртывание в продакшене?
Сфокусированный пилот с одним намерением реализуется за 4–6 недель. Полноценный запуск в продакшен с мониторингом, соблюдением требований, передачей оператору и минимум двумя намерениями обычно занимает 12 недель. Мультимодальные визуальные агенты требуют дополнительно 2–4 недели на настройку визуального пайплайна.
Какой самый дешёвый адекватный стек для голосового агента в продакшене?
Self-hosted Pipecat на сервере Hetzner, mediasoup в роли SFU, Whisper.cpp для распознавания речи, Llama 3.1 8B на Groq или локальной GPU и Cartesia Sonic для синтеза речи. При умеренных нагрузках маржинальная стоимость минуты падает ниже 3,7 ₽. Компромисс — вы сами отвечаете за эксплуатацию, мониторинг и безопасность.
Заменит ли агент нашу команду живой поддержки?
Почти ни одно успешное внедрение, что мы видели, не заменяет людей полностью. Рабочий паттерн — ИИ берёт на себя основную массу рутинных запросов (50–80% containment), а люди сосредоточены на сложных, эмоциональных и важных для выручки разговорах. Численность команды обычно остаётся прежней, а нагрузка на одного сотрудника удваивается.
Как измерять успех ИИ-агента в продакшене?
Три ведра: качество (P95 задержки, WER, точность срабатывания на перебивание), бизнес (containment, CSAT относительно человеческой базы, стоимость одного решения), надёжность (аптайм, drop rate, успешность передачи оператору с полным контекстом). Выберите один основной KPI на тип звонка — обычно это containment или конверсия, — и держите остальные как guardrails.
Speech-to-speech (OpenAI Realtime) или каскад — с чего начать?
Если нужно быстро запустить за несколько дней, а диалог короткий — начните с OpenAI Realtime: вы проверите продукт раньше, чем будете оптимизировать архитектуру. Если с самого начала важна юнит-экономика или комплаенс требует контроля над каждым слоем — выбирайте каскад на основе LiveKit Agents или Pipecat. Многие наши клиенты сначала прототипируют на Realtime, а затем переносят сложные сценарии в каскад, как только объём общения оправдывает переход.
Справится ли агент с не-английскими языками и акцентами?
Да, но провайдеров нужно выбирать. AssemblyAI Universal-2 и Deepgram Nova-3 поддерживают 30–100 языков с измеримой точностью на английском с акцентом. Cartesia и ElevenLabs предлагают мультиязычные голоса; для языков за пределами топ-30 потребуется дообучение модели. И задержка, и точность вне английского снижаются — закладывайте дополнительное время на проверку качества.
Что почитать дальше
Гид по сборке
Сборка и развёртывание голосовых ИИ-агентов на LiveKit
Пошаговый бизнес-гид по запуску агента на LiveKit.
Мультимодальность
Мультимодальные ИИ-агенты на LiveKit
Голос + зрение: продакшен-обвязка для камероориентированных агентов.
Архитектура
Гид по архитектуре WebRTC в 2026
P2P, SFU, MCU и гибридные топологии — для владельцев продуктов.
Голосовой ИИ
Разработка голосового ИИ-ассистента в 2026
Полный гид для владельцев продуктов, которые заказывают голосовой ИИ.
Выбор вендора
Альтернативы Agora.io для собственного WebRTC
LiveKit, mediasoup, Jitsi и Janus в сравнении в продакшене.
Готовы внедрить ИИ-агента поверх вашего WebRTC-стека?
За два года ИИ-агенты на WebRTC прошли путь от демонстрации до полноценного использования в продакшене. Модели speech-to-speech обеспечивают задержку менее 300 мс для премиальных голосовых сценариев. Каскадные пайплайны на базе LiveKit или Pipecat снижают стоимость минуты в 3–5 раз и обеспечивают полную прозрачность работы. В обоих случаях слой SFU, который уже используется вашей командой, становится точкой подключения: интеграция занимает несколько дней кода вместо месяцев настройки, проверки соответствия требованиям и тестирования.
Если у вас есть продукт в реальном времени, а вы ещё не используете хотя бы одного ИИ-агента — ваши конкуренты уже это делают. Главное — построить архитектуру, которая подходит под вашу юнит-экономику, а не просто следует трендам. И не экономить на «скучных», но важных вещах: очередность реплик, AEC, передача оператора, комплаенс. Именно от них зависит, будет ли агент восприниматься как живой.
Запустить ИИ-агента в реальном времени за 12 недель?
Принесите профиль звонков, бюджет задержек и требования по комплаенсу. По итогам звонка вы получите рекомендованный стек технологий, 12-недельный план реализации и обоснованную стоимость одного звонка.

