AI-ассистенты для звонков в 2026: как выбрать голосовые API, платформы и соблюсти требования

4/12/2025
·
Обновлено
8.11.2026

AI-ассистент звонков — это голосовой агент, который принимает или совершает телефонные вызовы: слушает речь на линии, генерирует короткую реплику с помощью языковой модели и отвечает голосом — всё это происходит за доли секунды. К 2026 году рынок сконцентрировался вокруг нескольких крупных платформ, стоимость использования упала ниже 18,7 ₽/минуту, а регуляторная база уже действует (правила FCC по TCPA для AI-голосов и требования к раскрытию информации из статьи 50 EU AI Act, вступающие в силу 2 августа 2026 года). Это руководство — практическое пособие для покупателя: что выбрать, как построить архитектуру, где могут возникнуть проблемы в продакшене, сколько это стоит и где обязательно нужен человек.

Фора Софт разрабатывала голосовых ассистентов и чат-ботов для LMS, финтеха, здравоохранения и телекоммуникаций с самого начала эпохи GPT-3.5. Мы внедрили в продакшен Deepgram, ElevenLabs, OpenAI, Dialogflow, LiveKit, Twilio и Azure Communication Services и собрали собственный playbook — с тем, о чём обычные статьи умалчивают: эхо в PSTN, ложные бронирования, аттестация STIR/SHAKEN и бюджет задержки в 300 мс, который вы теряете при каждом дополнительном вызове инструмента. Прочитайте текст до конца — и узнаете, какие API стоит включить в шорт-лист, как правильно спроектировать архитектуру и где работа специализированной инженерной команды всё ещё окупается.

Главное

Стек модульный, а не монолитный. Телефония, STT, LLM, TTS и оркестрация — отдельные слои; «платформа», которую вы выбираете, в основном определяет, какие из них нельзя заменить.

Критерий покупки в 2026 году — задержка, а не качество. Время «голос в голос» должно укладываться в 800 мс, чтобы разговор казался естественным. Всё остальное — донастройка.

Полная стоимость — 9,7–24,7 ₽ за минуту. Заявленные «3,7 ₽/мин» от вендоров за оркестрацию не включают STT, LLM и TTS. Рассчитывайте бюджет исходя из 15 ₽/минуту.

Compliance — это скрытая переделка проекта. Решение FCC от февраля 2024 года по TCPA делает использование AI-голосов в робозвонках без согласия абонента незаконным; раскрытие информации по статье 50 EU AI Act станет обязательным 2 августа 2026 года; HIPAA и законы штатов о двустороннем согласии добавляют региональные требования.

Платформу выбирайте в последнюю очередь. Сначала определите сценарий использования, объём, языки и требования по комплаенсу — из этих условий естественно выберется решение: Vapi, Retell, Deepgram Voice Agent, LiveKit с собственным стеком или enterprise-путь (Twilio, Azure, Google CCaaS).

Зачем Фора Софт написала этот playbook

Мы запускали голосовой AI в трёх сложных условиях с минимальным запасом на ошибки: телемедицинские консультации (с аудитом по HIPAA), колл-центры финансовых сервисов (в штатах с обязательным двусторонним согласием) и многоязычные службы поддержки (с переключением между RU, EN и DE прямо во время звонка). По всем этим проектам вели рабочий журнал реальных сбоев в продакшене: сбой barge-in на G.711, потеря DTMF-сигналов между транскодерами, вызовы LLM, блокирующие TTS, и европейские регуляторы, которые спустя полгода после запуска требуют предоставить запись с подтверждением согласия.

Этот гид — краткая выжимка из журнала. Мы предполагаем, что вы уже определились с бизнес-задачей (поддержка клиентов, квалификация лидов, замена IVR, запись на приём или помощь агенту в режиме копилота) и хотите получить техническую карту выбора — какой стек технологий использовать, чтобы он оставался актуальным ещё 18 месяцев. Если вам интереснее сразу обсудить архитектуру, минуя сравнения, напишите нам — наш руководитель направления голосовых AI-агентов организует технический разбор по звонку.

Нужен независимый второй взгляд на Vapi, Retell или собственный стек?

За 30 минут разберём ваш сценарий звонка, бюджет задержки и требования по комплаенсу и подберём подходящий стек. Без продающих презентаций.

Позвоните нам → Напишите нам →

Что такое AI-ассистент звонков в 2026 году

AI-ассистент звонков — это диалоговый агент в реальном времени, который может инициировать или принимать аудиосессию по протоколам PSTN или SIP. Он преобразует речь в текст, передаёт нарастающий транскрипт в языковую модель с доступом к инструментам, озвучивает ответ модели и возвращает звук собеседнику. Весь цикл занимает около 800 мс от начала до конца. Новое поколение решений (OpenAI Realtime, Gemini Live, Azure Voice Live) объединяет распознавание речи, логические рассуждения и синтез речи в единую модель speech-to-speech. Время до первого звука составляет около 300 мс при работе с узлов в США. Задержка теперь смещается из вашего оркестрационного кода в инфраструктуру провайдера модели.

На практике покупатели выбирают один из трёх форматов продукта. Входящие агенты-ответчики снимают нагрузку с поддержки и передают разговор человеку при необходимости эскалации. Исходящие кампанийные агенты работают с лидами — квалифицируют их, бронируют встречи или собирают задолженность. FCC изменила правила по TCPA в феврале 2024 года: AI-голоса теперь считаются «искусственными или предварительно записанными» и запрещены для роботозвонков без согласия абонента. Агент-ассист в режиме копилота слушает разговор живого оператора и тихо подсказывает — это сценарий с минимальным риском и часто используется как стартовая точка для внедрения.

Если вы знакомы только с IVR-ботами 2023 года, разница впечатляет: задержка ответа упала в 5–10 раз, ошибка распознавания речи (WER) на шумной линии у Deepgram Nova-3 уже ниже 6%, а эмоционально насыщенные TTS (ElevenLabs v3, Hume EVI) преодолели uncanny valley даже на коротких фразах. Компании, которые строили решения на стеках 2023 года и теперь переходят на 2026-й, как правило, выбрасывают половину оркестрационного кода — это побочный эффект апгрейда.

Срез рынка: размер, рост и реальные развертывания

По данным Precedence Research, рынок ИИ для контакт-центров в 2024 году оценивался в 242 млрд ₽, в 2025-м — в 298 млрд ₽, а к 2034 году он должен достичь 1,9 трлн ₽ при годовом темпе роста 23,11%. Gartner прогнозирует, что разговорный ИИ в контакт-центрах сэкономит 6 трлн ₽ на заработной плате к 2026 году. Эти «крупнокалиберные» прогнозы стоит воспринимать скорее как проверку здравого смысла: они показывают, что вы не вкладываете средства в умирающую отрасль — наоборот, она активно развивается.

Цифра, на которую мы обращаем внимание покупателей, — публикация Klarna в начале 2024 года: их AI-ассистент за первый месяц обработал 2,3 миллиона обращений в поддержку — около двух третей всего объёма; время решения сократилось с 11 минут до менее чем 2, повторные обращения уменьшились на 25%. Klarna оценила эффект от агента примерно в 700 FTE и 4,5 млрд ₽ годовой экономии. Это та форма внедрения, которая работает у среднего и крупного бизнеса, и поэтому каждый шорт-лист, который мы формируем в 2026 году, начинается с вопроса: «потянет ли этот стек 70% объёма звонков с равным или лучшим CSAT».

Если смотреть только на голосовую часть, сегмент «платформа» (Vapi, Retell, Bland, Synthflow, ElevenLabs Conversational AI) занял нишу шаблонов и прототипов. Голос на стороне модельного провайдера (OpenAI Realtime, Gemini Live, Azure Voice Live) набирает популярность у команд, которые и так работают в этих облаках. А enterprise-стек CCaaS (Twilio + Autopilot, Amazon Connect + Lex, Google Dialogflow CX + Gemini, Microsoft Azure Communication Services) по-прежнему удерживает регулируемые отрасли, где важны SLA и понятная процедура закупок — даже если задержка в 150 мс кажется большой.

Шорт-лист API на 2026 год

В 2026 году нас будут использовать двенадцать API и платформ. Ниже — шорт-лист, с которым мы начинаем работу над проектом.

Платформы голосовых агентов (оркестрация + телефония в одном пакете)

1. Vapi. Платформа с акцентом на оркестрацию: визуальный конструктор сценариев, возможность подключить свой STT/LLM/ТTS и надёжная поддержка barge-in. Тариф «3,7 ₽/мин» — только за оркестрацию; полная стоимость с компонентами — 9,7–23,2 ₽/мин. Хороший выбор, если нужна гибкость и вы сами собираете компоненты.

2. Retell AI. Более плотный «коробочный» бандл — около 5,2 ₽/мин all-in (3,7 ₽ для enterprise), с собственным слоем маршрутизации LLM и сильными шаблонами для исходящих сценариев. Если Vapi кажется слишком «сделай сам» — Retell следующий шаг.

3. Bland AI. Платформа-бандл примерно 6,7 ₽/мин плюс ежемесячные минимумы, ориентированная на массовые исходящие звонки в США. Хорошая очередь вызовов; европейские голоса хуже.

4. Synthflow. No-Code конструктор для тех, кто не пишет код. Мы используем его для внутренних инструментов и разовых тестов; не подходит для работы с большими объёмами в продакшене.

5. ElevenLabs Conversational AI. Готовое решение, построенное на голосах ElevenLabs. Стоимость — от 6 до 18 ₽ за минуту, в зависимости от выбранного уровня голоса. Используйте, если главное — высокое качество голоса (например, для брендового голоса или замены IVR в премиум-сегменте).

Speech- to-speech API от модельных провайдеров

6. OpenAI Realtime API. Голос GPT-4o / GPT-5 с задержкой до первого байта около 500 мс с американских серверов; медианная задержка ответа на 30-репликовых звонках по независимым тестам — около 2,2 с. Оплата идёт за аудио-токены; поддержка телефонии не включена — её нужно подключать отдельно через LiveKit или Twilio Media Streams.

7. Google Gemini Live. Мультимодальная speech-to-speech модель в Google Cloud. Нативно интегрирована в Dialogflow CX для сценариев CCaaS; хорошо справляется с мультиязычными задачами.

8. Deepgram Voice Agent API. Бандл ASR + LLM + TTS на собственных Deepgram Nova-3 (5,26% batch WER) и Aura TTS — без скрытых наценок за проброс. Любимый выбор enterprise, когда нужна предсказуемая тарификация.

9. Azure Voice Live. Speech-to-speech от Microsoft, тесно интегрированный с Azure Communication Services и Azure OpenAI. Логичный выбор, если вы уже используете продукты Microsoft или нужна интеграция с Teams.

Enterprise-платформы для контакт-центров

10. Twilio (Voice + Autopilot / Conversational Intelligence). Полный телефонный стек: зрелый SIP, STIR/SHAKEN и операторские SLA. Эффективная стоимость на сценариях с AI-агентом — около 10,5 ₽/мин при нагрузке 10 тыс. минут.

11. Amazon Connect + Lex + Bedrock. Нативный CCaaS на AWS: оплата за минуту PSTN плюс сервисная комиссия. Отлично подходит командам, уже использующим AWS и работающим с регулируемыми данными.

12. PolyAI и Cognigy. Это чисто enterprise-платформы разговорного ИИ с собственными командами дизайнеров. Их выбирают, когда закупка требует одного поставщика, который гарантирует выполнение SLA на всех этапах.

Берите платформу (Vapi / Retell), когда: хотите запустить проект за 4–8 недель, готовы использовать одну точку интеграции и ваш объём звонков не превышает 1 млн минут в месяц.

Берите speech-2-speech от модельного провайдера (OpenAI / Gemini / Azure Voice Live), когда: задержка — главный показатель, нужно меньше сетевых переходов и вы уже используете облако этого провайдера.

Берите enterprise-CCaaS (Twilio / Amazon Connect / Azure ACS), когда: вы работаете в регулируемой отрасли, вам нужны SLA от оператора и поддержка STIR/SHAKEN, а закупки не согласуют контракт со стартапом.

Соберите свой стек (LiveKit + Deepgram + OpenAI + ElevenLabs), когда: ни одна из готовых платформ не укладывается в ваши требования по задержке или не даёт нужной гибкости — например, в здравоохранении, оборонной сфере, финансах или любом проекте, где требуется on-pret.

Матрица сравнения — что вы реально платите и выпускаете

Все цифры ниже — эффективная полная стоимость, которую мы видим в реальных деплоях (телефония + STT + LLM + TTS + оркестрация), а не заявленный тариф вендора. Задержка «голос-в-голос» — медиана на тёплом подключении из США.

Платформа Полная стоимость, ₽/мин Задержка Лучше всего для На что смотреть
Vapi 9,7–23,2 ₽ ~900 мс Свой стек, быстрые прототипы Цена зависит от компонентов
Retell AI 5,2 ₽ (enterprise — 3,7 ₽) ~800 мс Исходящие, плотный готовый сценарий Менее гибкий, чем Vapi
ElevenLabs Conversational AI 6–18 ₽ ~850 мс Брендовый голос, потребительский IVR Стоимость голоса на премиум-уровне
OpenAI Realtime 11,2–30 ₽ ~500 мс TTFB Низкая задержка, много вызовов инструментов Нужно подключить свою телефонию
Deepgram Voice Agent 9–16,5 ₽ ~700 мс Предсказуемая тарификация, точный STT Меньше вариантов голосов TTS
Twilio Voice + Autopilot ~10,5 ₽ ~1100 мс Операторский SLA, STIR/SHAKEN Медленный цикл итераций
Свой стек на LiveKit 11,2–18,7 ₽ ~600 мс On-prem, кастомные инструменты, HIPAA Самые высокие инженерные затраты

Эталонная архитектура (шесть слоёв, один бюджет задержки)

Каждый продакшен AI-ассистент звонков, который мы выпускаем, проходит по одному и тому же пайплайну — независимо от выбранного вендора:

Caller PSTN/SIP → Tier-1 carrier (Twilio / Telnyx / Vonage / SignalWire)
                → Media server (LiveKit Cloud / FreeSWITCH / Asterisk)
                → STT stream (Deepgram Nova-3 / Whisper-v3 / AssemblyAI Universal-2)
                → LLM turn (GPT-5 / Gemini 2.5 / Claude 4.5 + tool-calling)
                → TTS stream (ElevenLabs v3 / Cartesia Sonic / OpenAI TTS / Aura-2)
                → Back to PSTN/SIP

Latency budget (voice-to-voice target = 800 ms):
  STT first-partial          120 ms
  LLM turn (with tools)      450 ms
  TTS first chunk            130 ms
  Network / media server     100 ms
                             =====
                             ~800 ms

В этой архитектуре доминируют два проектных решения. Первое — стримим всё, не буферизуем: не ждите полной реплики перед отправкой, отправляйте частичные результаты STT в LLM и токены LLM в TTS по мере их появления. Второе — один медиасервер: не создавайте два WebRTC-пира и не транскодируйте дважды; каждый дополнительный хоп добавляет 40–80 мс и повышает риск появления аудиоартефактов.

Если нужна готовая реализация, где SIP-транкинг, буфер задержки и функция barge-in уже работают «из коробки» — наша команда использует LiveKit с 2024 года. В нашем гайде по созданию мультимодальных AI-агентов на базе LiveKit описана та же архитектура для агентов, которые помимо голоса поддерживают видео и трансляцию экрана.

Бюджет задержки — куда уходят 800 миллисекунд

1. Speech-to-text (~120 мс). На стриминговом Deepgram Nova-3 первые частичные результаты приходят за 100–140 мс. Whisper-3 работает медленнее — 200–300 мс, но точнее распознаёт чистую речь. Nova-3 multilingual поддерживает переключение между десятью языками в одном звонке — это реальное требование для развёртываний в Европе и Азиатско-Тихоокеанском регионе.

2. Реплика LLM (~450 мс). Большая часть времени уходит на работу модели. Одноразовый запрос без вызова инструментов обрабатывается за 250–400 мс на GPT-4o или Gemini 2.5. Один вызов инструмента добавляет 150–300 мс. Два вызова — и лимит превышен. Проектируйте систему так, чтобы использовать не более одного вызова, или подгружайте контекст заранее, ещё до того, как пользователь закончит говорить.

3. Text-to-speech (~130 мс). ElevenLabs v3 в стриминге отдаёт первый фрагмент за 120–160 мс; Cartesia Sonic — за 90–120; OpenAI TTS — около 200. Ещё 50 мс можно сэкономить, загрузив первое слово заранее, до того как LLM закончит реплику.

4. Сеть, медиасервер, jitter buffer (~100 мс). Налог на реальное аудио в реальном времени. LiveKit Cloud в большинстве регионов укладывается в 100 мс; собственный FreeSWITCH в одной VPC с приложением — в 60.

5. Детект barge-ин. Не входит в бюджет ответа, но именно это отличает естественный разговор от общения с роботом. Нужен VAD (детектор голосовой активности) на входящем аудио, способный прервать синтез речи прямо посреди фразы, как только заговорит собеседник. У LiveKit он есть; Vapi, Retell и Deepgram Voice Agent реализуют это на уровне платформы.

Задержка выше 1,2 секунды? Найдём 400 мс, которые вы теряете.

Пришлите запись звонка и трассировку — наша команда голосовой инженерии за 48 часов подготовит письменный диагноз.

Позвоните нам → Напишите нам →

Лидеры STT и арифметика word error rate

Deepgram опубликовала бенчмарк на 2 703 файлах из девяти доменов (подкасты, встречи, телефонные разговоры, финансы, медицина, drive-thru, авиадиспетчеры, голосовая почта), где Nova-3 показывает 5,26% batch WER и на 54% более низкий streaming WER по сравнению с предыдущим лучшим открытым решением. На телефонной речи — а это наш реальный кейс — Nova-3 multilingual снижает batch WER на 34% и streaming WER на 21% по сравнению с Nova-2 и поддерживает code-switching между 10 языками в рамках одного звонка.

OpenAI Whisper-3 хорошо справляется с чистой американской речью, но заметно хуже работает с акцентированной или шумной телефонной речью. AssemblyAI Universal-2 по качеству распознавания английского языка сопоставим с Nova-3, но уступает в поддержке нескольких языков. Soniox — хороший выбор для сильно акцентированной или шумной телефонной связи, но это скорее узкоспециализированное решение.

Наше правило большого пальца: если среди звонящих есть носители английского как второго языка или люди с региональными акцентами — переключайтесь на Nova-3 multilingual. Разница в WER на аудиозаписях с акцентами достаточно велика, чтобы заметно повлиять на CSAT, а разница в цене минимальна.

Лидеры TTS и тест на uncanny valley

ElevenLabs v3 лидирует в публичных тестах по точности произношения (около 82%) и просодии (около 65%), поддерживает более 70 языков. На коротких фразах большинство слушателей не отличают синтезированную речь от человеческой. Минус — высокая стоимость: премиум-голоса стоят 11,2–18 ₽ за минуту.

Cartesia Sonic быстрее (первый фрагмент — за 90–120 мс) и чуть хуже передаёт эмоции. Лучший выбор, если задержка критична.

OpenAI TTS (gpt-4o-mini- tts / голос gpt-realtime) — используется по умолчанию, если вы уже работаете с OpenAI Realtime: подходит для большинства задач поддержки, но на эмоциональных фразах звучит заметно плосче, чем у ElevenLabs.

Deepgram Aura-2 и PlayHT замыкают шорт-лист. Aura-2 выигрывает за счёт понятной фиксированной цены за пакет. У PlayHT — сильные эмоциональные и нейтральные голоса, это хороший выбор, если важен узнаваемый брендовый голос и нужен контроль над тембром.

Если вы работаете в регулируемой отрасли, где требуется обязательное раскрытие (а к 2 августа 2026 года это будет весь Евросоюз) — оставляйте голос узнаваемо синтетическим. Статья 50 EU AI Act обязывает информировать пользователя о том, что он общается с ИИ-системой; узнаваемый, но приятный голос помогает выполнить это требование и снижает риск судебных исков.

Выбор LLM — задержка, вызовы инструментов и grounding

Голосовые агенты зависят от трёх ключевых возможностей LLM: задержки между репликами, надёжности вызова инструментов и способности опираться на короткие фрагменты из поиска (grounding). По состоянию на апрель 2026 года наш основной кластер включает GPT-5 (OpenAI), Gemini 2.5 Flash/Pro и Claude 4.5. У каждой модели — свой уровень стоимости и собственный подход к вызову инструментов.

GPT-5 работает быстрее всех в сценариях с большим количеством инструментов (параллельные вызовы функций) и предлагает самый продвинутый инструментарий для разработчиков. Это и самая дорогая модель по стоимости за минуту; для больших объёмов запросов мы переключаемся на GPT-4o-mini или Gemini 2.5 Flash.

Gemini 2.5 Flash — лучший выбор по соотношению цены и производительности для простых задач и работы с несколькими языками. Если вы уже используете Google Cloud — выбирайте его по умолчанию.

Claude 4.5 реже ошибается в сложных вопросах бизнес-логики «длинного хвоста» — мы используем её, когда агент создаёт или подтверждает нестандартные брони, корректирует биллинг или меняет медицинское расписание. Работает чуть медленнее, но надёжнее.

Телефония — SIP-транки, STIR/SHAKEN и почему это важно

Телефонный слой — самое слабое звено в самосборных проектах. Проблемы обычно одни и те же: на транке выбран неподходящий кодек (из-за этого возникает эхо), на исходящих линиях указан неверный caller-ID (из-за чего падает процент принятых звонков) или вообще отсутствует аттестация STIR/SHAKEN (и звонки помечаются как «возможно, спам» ещё до подключения).

STIR/SHAKEN — американский стандарт проверки подлинности номера звонящего, который FCC теперь требует для всех исходящих вызовов в сеть PSTN. Если ваш провайдер транка не может подтвердить номер звонящего, вероятность ответа на ваш звонок может упасть на 30–60%. Tier-1 операторы (Twilio, Telnyx, Vonage, SignalWire) поддерживают аттестацию по умолчанию, а универсальные VoIP-перепродавцы — зачастую нет. Эта техническая деталь ломает больше исходящих проектов, чем любой выбор бизнес-модели.

По кодеку: по умолчанию на американском PSTN используется G.711 μ-law с частотой 8 кГц. Широкополосные кодеки (Opus/G.722, 16 кГц) заметно повышают точность распознавания речи, но работают только при условии, что оба конца звонка поддерживают широкополосную передачу — на практике это возможно только в SIP-вызовах между SIP-устройствами.

Compliance — TCPA, EU AI Act, HIPAA, двустороннее согласие

США — TCPA и STIR/SHAKEN. Декларативное решение FCC от февраля 2024 года классифицировало голоса, созданные с помощью ИИ, как «искусственные или предварительно записанные» в рамках TCPA. То есть: использовать клонированный голос для исходящих автоматических звонков без чёткого письменного согласия — незаконно, и за каждый такой звонок грозит штраф. В план кампании обязательно должны входить подтверждение согласия и ограничения на частоту звонков. STIR/SHAKEN требуется для проверки подлинности исходящего номера.

ЕС — статья 50 AI Act. Вступает в силу с 2 августа 2026 года. Если звонок адресован гражданину ЕС, с самого начала разговора вызывающий должен узнать, что общается с ИИ-системой. Штрафы — до €20 млн или 4% от глобального годового оборота, в зависимости от того, что больше. Убедитесь, что информация о раскрытии включена в стартовый промпт, и сохраняйте запись разговора.

Здравоохранение — HIPAA. Требуется подписанное соглашение о обработке данных (BAA) с поставщиком платформы, шифрование данных при передаче и в состоянии покоя для записей и транскриптов, проверяемые меры контроля доступа и задокументированные пути передачи данных в системы электронных медицинских карт (Epic / Cerner). Retell, Deepgram Voice Agent, Twilio и AWS Connect поддерживают BAA; Vapi и топовые провайдеры LLM требуют отдельных переговоров.

Штаты США — двустороннее согласие на запись. Одиннадцать штатов (CA, CT, FL, IL, MD, MA, MT, NV, NH, PA, WA) требуют согласия всех участников записи. Практический подход: в начале каждого звонка сообщайте о записи и получайте согласие — вне зависимости от штата — и фиксируйте таймкод аудиофрагмента с подтверждением.

GDPR. Голос — это персональные данные. Минимизируйте срок хранения исходных аудиофайлов (обычно мы удаляем их в течение 30 дней, если иное не оговорено), храните транскрипты и персональные данные отдельно с соответствующей классификацией и заранее реализуйте в админке эндпоинт для обработки запросов субъектов данных (DSR) — с самого начала.

Модель стоимости — сколько реально стоят 30 000 минут в месяц

Типичный mid-market деплой — 10 000 звонков × по 3 минуты в среднем = 30 000 минут в месяц. На стандартном самосборном стеке (LiveKit + Deepgram Nova-3 + GPT-5 + ElevenLabs v3) стоимость одной минуты по компонентам выглядит так:

Компонент ₽/мин Месяц при 30 тыс. мин
PSTN / SIP (Twilio) 0,75 ₽ 22 500 ₽
LiveKit (медиа) 0,37 ₽ 11 200 ₽
Deepgram STT 0,97 ₽ 29 200 ₽
Реплика GPT-5 4,5 ₽ 135 000 ₽
ElevenLabs TTS 6,7 ₽ 202 500 ₽
Итого all-in 13,3 ₽ 400 500 ₽

На enterprise-тарифе Retell по 3,7 ₽ тот же объём обойдётся примерно в 157 500 ₽ в месяц — экономия около 60% за счёт гибкости стека. Vapi на all-in по 10,8 ₽ выходит на 324 000 ₽. Сценарии типа Twilio Autopilot по 10,5 ₽ — около 315 000 ₽. Разница между самым дешёвым и самым дорогим решением — порядка 225 000 ₽ в месяц на каждые 30 тыс. минут — почти всегда исчезает, как только дорогой вариант экономит вам две инженерные недели на оркестрации.

Мини-кейс — телемедицина с HIPAA, план на 12 недель, до и после

Ситуация. Американская телемедицинская платформа со 120 клиницистами обрабатывала напоминания о приёме и сбор предварительной информации через колл-центр с живыми операторами. Стоимость одного исходящего напоминания — 90 ₽, при этом 38% звонков обрывались: пациенты вешали трубку на IVR. Клиенту нужен был AI-ассистент, который сам будет напоминать о приёме, переносить запись по просьбе пациента и передавать сложные вопросы человеку — например, если речь идёт о клинике.

План на 12 недель. Недели 1–2: подписан BAA с Deepgram Voice Agent и Twilio, определён объём аудита HIPAA. Недели 3–6: интеграция с Epic через FHIR, реализованы сценарии напоминаний, подтверждений и переноса вызовов, настроена эскалация на существующий операторский стол. Недели 7–9: запуск пилота на 5% нагрузки, доработка ASR под акцентированные голоса и оптимизация тайминга barge-in. Недели 10–12: полномасштабный запуск, получение двустороннего согласия в начале каждого звонка, редактирование PHI в сохранённых транскриптах.

Результат. Стоимость одного напоминания снизилась с 90 ₽ до 25 ₽ — на 72%. Доля звонков, доведённых до конца, выросла с 62% до 87%, потому что AI-агент мог ответить на вопрос «О чём этот звонок?», а старый IVR — нет. Доля повторных записей увеличилась на 19 п. п. На первом аудите замечаний по HIPAA не было. Хотите аналогичную оценку под ваш стек? Напишите нам — проведём 30-минутный разбор.

Фреймворк решения — выбираем стек за пять вопросов

Вопрос 1. Какой у вас объём звонков? До 100 тыс. минут в месяц вас уверенно тянет платформа (Vapi, Retell, Synthflow). Выше — инженерная стоимость самосборного стека быстро окупается.

Вопрос 2. Входящие, исходящие или агент-ассист? Объёмные исходящие звонки автоматически попадают под требования STIR/SHAKEN, проверку согласия и риски по TCPA. Агент-ассист позволяет обойти почти все эти ограничения. Входящие — это золотая середина.

Вопрос 3. Языки и акценты? Если вы работаете с носителями не родного языка или с переключением между языками, по умолчанию используйте Deepgram Nova-3 Multilingual; Whisper-3 подойдёт для чистых языков с большим количеством данных. Моноязычный английский даёт наибольший выбор моделей.

Вопрос 4. Регулирование? HIPAA, PCI, GDPR, EU AI Act, законы штатов о двустороннем согласии — каждое из них ограничивает выбор поставщиков. Поставщиков с BAA — небольшое подмножество. Сначала определите требования, потом выбирайте платформу.

Вопрос 5. Speech- to-speech или классический пайплайн? Speech-to-speech (OpenAI Realtime, Gemini Live, Azure Voice Live) работает быстрее, но сложнее контролировать. Классический пайплайн (STT → LLM → TTS) проще отлаживать, заменять компоненты и вести логи — именно он остаётся у нас стандартом для регулируемых продакшен-сред.

Пять ловушек, которые убивают деплои AI-звонков

1. Эхо на PSTN. G.711 μ-law передаёт звук с дальней стороны обратно в микрофон на ближней стороне. Без активного подавления эха LLM слышит собственный голос и начинает зацикливаться. Решение: включите AEC на медиасервере и проверяйте каждый новый SIP-транк — не полагайтесь на заводские настройки вендора.

2. Галлюцинированные брони. Агент подтверждает «вторник, 15:00», хотя такой записи в календаре нет. Решение: никогда не позволяйте LLM завершать транзакцию самостоятельно. Всегда вызывайте инструмент, дождитесь ответа 2xx и сообщайте звонящему только реальное подтверждение.

3. Таймауты вызовов инструментов. Внешние API (CRM, календарь, биллинг) работают медленно; из-за этого LLM зависает, а TTS останавливается. Решение: установить жёсткий таймаут 700 мс на каждый вызов и заранее подготовить реплику-наполнитель («секундочку, проверяю»), которую агент произносит во время ожидания.

4. Плохая передача на эскалации. Живой оператор подключается «холодным», без контекста. Решение: при эскалации генерируйте краткое однопредложное резюме, передавайте его вместе с переводом и проигрывайте оператору запись последней реплики клиента в его софтфоне.

5. Отсутствующее согласие и раскрытие. Первый иск по статье 50 EU AI Act будет именно за приветствие, в котором не упомянут ИИ. Решение: включите информацию о ИИ в первую реплику TTS, логируйте транскрипт с таймкодом и храните его столько, сколько требует ваш регулятор.

KPI — что измерять с первого дня

KPI качества. Word error rate на корпусе ваших звонков (цель — < 8%), доля удержанных звонков (% решённых без оператора), CSAT по SMS-опросу после звонка (цель — ≥ 4,3 / 5), доля галлюцинаций в забронированных действиях (цель — 0%). Раз в неделю прогоняйте 200 случайных звонков с ручной разметкой.

Бизнес-метрики. Стоимость обработанного звонка (по сравнению с человеческим стандартом), доля брошенных звонков по сравнению с традиционным IVR (цель — снижение на 30%), конверсия при исходящих звонках (сравнение с живыми операторами), доля апсейла при входящих звонках (в сегменте mid-market ИИ часто превосходит человека).

KPI надёжности. p50 и p95 задержки «голос-в-голос» (цели — ≤ 800 мс и ≤ 1,4 с), p95 задержки вызовов инструментов, лаг детектирования barge-in (цель — ≤ 150 мс), частота ошибок PSTN (SIP 5xx). Это те самые метрики, из-за которых вас будят в три часа ночи.

Build vs buy — единственный полезный чек-лист

Берите платформу (Vapi, Retell, Synthflow, ElevenLabs Conversational AI, Bland), если сценарий звонка типовой для отрасли, объём — до ~500 тыс. минут в месяц, до запуска в продакшен осталось меньше четырёх недель, вы готовы мириться с зависимостью от вендора в оркестрации, а требования к комплаенсу невысокие (без HIPAA, PCI и on-prem).

Стройте сами (LiveKit + Deepgram + OpenAI/Claude/Gemini + ElevenLabs/Cartesia), если вы вышли за рамки типовых решений, работаете в регулируемой отрасли, нужны кастомные инструменты для интеграции с внутренними системами (EHR, ядро банка, диспетчерская), требуется собственная система мониторинга, возможность замены моделей или ваш допустимый бюджет задержки «голос-в-голос» — менее 700 мс.

Берите enterprise-CCaaS (Twilio + Autopilot, Amazon Connect + Lex, Dialogflow CX + Gemini, Azure Communication Services + OpenAI), когда закупки требуют единого вендора уровня Tier-1, вы уже используете их облако или ваша служба поддержки уже работает на их платформе, а искусственный интеллект нужно просто подключить, а не создавать с нуля.

Когда AI-ассистента звонков лучше не разворачивать

Не ставьте ИИ там, где звонок — самое ценное взаимодействие с клиентом. Hi-touch B2B-продажи, клиническая диагностика, психологическая помощь и работа с крупными клиентами по-прежнему превосходят ИИ по удержанию и NPS, а репутационные риски ошибки сильно перевешивают возможную экономию. Под такие задачи оптимальный формат — копилот в режиме агент-ассист.

Не ставьте ИИ там, где не сможете его оценить. Если вы не отслеживаете еженедельно долю удержанных звонков, CSAT и количество галлюцинаций — агент незаметно «уплывёт», и вы узнаете об этом только из жалобы клиента в Твиттере через шесть недель. Сначала — наблюдаемость, потом — запуск.

Не используйте AI там, где регулятор ещё не определил правила. В некоторых юрисдикциях нормы для голосового ИИ до сих пор разрабатываются; если ваш комплаенс не может сослаться на конкретную статью или руководство — начните с пилота агента-ассистента и отложите запуск, ориентированный на клиентов.

Планируете запустить голосового агента в регулируемой отрасли?

Фора Софт делает голосовые деплои с соблюдением HIPAA, GDPR и TCPA с 2023 года. За один созвон разберём ваш комплаенс-контур и стек.

Позвоните нам → Напишите нам →

Отрасли, где AI-ассистенты звонков приносят пользу в 2026 году

Здравоохранение. Напоминания о приёме, предварительный сбор данных, контроль после визита, проверка страхового покрытия. Только поставщики с аудитом по HIPAA; BAA — обязательно. Телемедицинские платформы позволяют сократить стоимость звонка на 60–70%.

Финансовые сервисы. Входящие запросы по статусу счёта, сбор задолженности (жёстко регулируемый), сбор данных по ипотеке, первое уведомление об убытке в страховании. Правила обработки данных, требования PCI для информации о картах, дополнительные меры защиты потребителей на уровне штата.

EdTech и LMS. Запись на обучение, академические консультации, расписание экзаменов, посещаемость. Низкая регуляторная нагрузка, высокий спрос на мультиязычность. Хорошо работает с Vapi или Retell при умеренных объёмах.

Логистика и выездное обслуживание. Подтверждение диспетчеризации, временные окна для выездов, переносы и отмены. Большое количество вызовов инструментов по сравнению с диспетчерскими системами; календарь в реальном времени — критически важная интеграция.

Недвижимость. Квалификация потенциальных клиентов, запись на просмотры, проверка арендаторов. Много исходящих звонков, поэтому риски по TCPA здесь выше, чем в большинстве других направлений.

Ритейл и e-commerce. Статус заказа, возвраты, продажи после покупки. Часто реализуется через омниканальные каналы (голос, SMS, чат) — поэтому платформы с поддержкой нескольких каналов (Twilio, Intercom Fin, AI-агенты Zendesk) выигрывают в этом сегменте.

Playbook деплоя на 12 недель

Недели 1–2. Определение требований по комплаенсу (HIPAA, GDPR, TCPA, согласие штатов), подписание BAA / DPA с вендором, выбор одного сценария звонка, согласование KPI с бизнесом.

Недели 3–5. Интеграция с одной бэкенд-системой (CRM или календарь), приветственное сообщение на всех языках, финальная схема вызовов инструментов, настроенный barge-in.

Недели 6–8. Пилот на 5–10% объёма, ежедневная калибровка по 50 размеченным вручную звонкам, замер p95 задержки, отлаженная передача при эскалации.

Недели 9–11. Масштабирование до 50% объёма, добавление второго сценария звонка, редактирование персональных данных в сохранённых транскриптах, первый «сухой» комплаенс-прогон.

Неделя 12. Полный раскат, KPI-дашборд в продакшене, запущена еженедельная калибровка, проведён постмортем по пилотному проекту, определена дорожная карта для двух следующих сценариев.

FAQ

Что такое AI-ассистент звонков в 2026 году?

Голосовой агент в реальном времени принимает звонки по PSTN или SIP, распознаёт речь с помощью модели speech-to-text, обрабатывает запрос с помощью языковой модели (часто с вызовом дополнительных инструментов) и озвучивает ответ через text-to-speech — всё это происходит за время менее 800 мс от начала до конца. Современные системы также поддерживают перебивание собеседника, передачу звонка живому оператору и переключение между языками в рамках одного разговора.

Какой API выбрать — Vapi, Retell или OpenAI Realtime?

Vapi — если нужна гибкость и свой стек. Retell — если важен готовый сценарий с низкой стоимостью. OpenAI Realtime — если нужна минимальная задержка и вы готовы сами подключить телефонию (например, LiveKit или Twilio Media Streams). Для регулируемых отраслей или больших объёмов по умолчанию используем стек: LiveKit + Deepgram + Claude 4.5 + ElevenLabs.

Сколько реально стоит AI-ассистент звонков в пересчёте на минуту?

Заявленные тарифы вендоров — 3,7–7,5 ₽/минуту, но это только за оркестрацию. Полная стоимость (с STT, LLM, TTS и телефонией) реально лежит в диапазоне 9,7–24,7 ₽/мин в зависимости от выбора моделей. Наша стандартная сборка (LiveKit + Nova-3 + GPT-5 + ElevenLabs v3) выходит на ~13,5 ₽/мин.

Можно ли использовать AI-голоса на исходящих звонках в США?

После декларативного решения FCC от февраля 2024 года AI-генерируемые голоса теперь считаются «искусственными или предварительно записанными» в рамках TCPA. Это означает, что для исходящих AI-звонков потребителям требуется явное предварительное письменное согласие, а также аттестация STIR/SHAKEN на транке. Без этих условий вы рискуете получить штраф за каждый такой звонок.

Распространяется ли EU AI Act на мой голосовой бот?

Если звонок касается гражданина ЕС — да. Статья 50 вступает в силу 2 августа 2026 года и требует чётко сообщать пользователю, что он общается с ИИ-системой. Штрафы — до 20 млн евро или 4% глобального годового оборота. Уведомляйте об этом в приветствии, сохраняйте транскрипт и запись разговора.

Как AI-ассистенты звонков работают с несколькими языками?

Deepgram Nova-3 Multilingual справляется с code-switching между 10 языками в одном звонке и показывает примерно на 34% более низкий batch WER по сравнению с предыдущей версией. Whisper-3 поддерживает больше языков, но работает медленнее и хуже распознаёт телефонную речь. Большинство LLM (GPT-5, Gemini 2.5, Claude 4.5) корректно отвечают на тексте, распознанном на любом языке, без дополнительной настройки.

Может ли AI-ассистент звонков перевести разговор на живого оператора?

Да, и тёплый перевод — по умолчанию. AI передаёт оператору краткое резюме контекста и последнюю реплику клиента в софтфон ещё до завершения перевода. Это сохраняет контекст и решает проблему «расскажите всё заново», которая снижает CSAT в устаревших IVR-системах.

Сколько занимает проект по AI-ассистенту звонков?

Базовый платформенный пилот выпускается за 2–4 недели. Продакшен-сборка на собственном стеке с интеграцией одной бизнес-системы и поддержкой одного языка — 8–12 недель. Многоязычные деплои в регулируемых отраслях с несколькими сценариями эскалации — 3–5 месяцев.

Архитектура

Сборка мультимодальных AI-агентов на LiveKit

Эталонная архитектура для голосовых и видеоагентов, которую мы представим в 2026 году.

STT

Точность распознавания речи в шумной среде

Как снизить WER ниже 8% на телефонном аудио в реальных проектах.

AI Видео

Разработка приложений для AI-видеостриминга в 2026 году

Протоколы, кодеки и рекомендательные движки для стриминга на основе ИИ.

Услуги

Разработка AI-чат-ботов и голосовых ассистентов

Как Фора Софт создаёт голосовых и текстовых агентов end-to-end — обзор услуг.

Готовы запустить AI-ассистента для звонков, который реально повышает конверсию?

Стек 2026 года уже зрелый: задержка ниже 800 мс достижима на любой серьёзной платформе, мультиязычный ASR на Deepgram Nova-3 справляется с реальным телефонным шумом, а пути по комплаенсу для HIPAA, TCPA, GDPR и EU AI Act хорошо проработаны. Остались всего четыре ключевых решения: сценарий использования, объём данных, регулируемый контур и то, что выгоднее в бизнесе — скорость выхода на рынок или контроль над стеком.

Если в этом квартале вы запускаете пилот на платформе — используйте Vapi или Retell, подключите Deepgram Nova-3 для распознавания речи и ElevenLabs v3 для синтеза голоса, поставьте цель по задержке p50 в 800 мс и проведите пилот на 5% трафика против человеческого бенчмарка. Если вы работаете в регулируемой отрасли или планируете использовать более миллиона минут в месяц — закладывайте 10–12 недель на разработку с LiveKit, с собственным выбором STT, LLM и TTS, а также с полноценной системой мониторинга с самого начала. Оба подхода ведут в продакшен; разница лишь в том, будете ли вы арендовать инфраструктуру через 18 месяцев или будете ею владеть.

В любом случае Фора Софт уже выпускала тот паттерн, который вы планируете реализовать. Принесите запись звонка, схему сценария и контур комплаенса — мы подготовим шорт-лист технологий, модель стоимости и план доставки на 12 недель.

Спроектируем вашего AI-ассистента для звонков end-to-end.

30 минут с руководителем направления голосовой инженерии: стек технологий, комплаенс, модель стоимости и 12-недельный план поставок.

Позвоните нам → Напишите нам →

  • Услуги
    Разработка
    Технологии