Как создать голосового ИИ-ассистента в 2026: практическое руководство для продуктовых менеджеров
Главное
• Промышленный голосовой ИИ-ассистент в 2026 году — это система из четырёх компонентов: VAD, ASR, LLM/НLU, TTS, объединённых оркестрацией (LiveKit, Pipecat, Vapi или Retell). Выбирайте решения исходя из требований к задержкам, поддерживаемым языкам и нормам соответствия, а не по названию бренда.
• Целевая задержка от речи до речи — 700–1 200 мс для естественного диалога. При задержке выше 1 500 мс пользователи начинают перебивать. Ниже 500 мс вы тратите вычислительные ресурсы впустую — разница уже не ощущается.
• Word Error Rate (WER), устойчивость к акцентам, обработка перебиваний и определение конца реплики — четыре метрики качества, которые связаны с удержанием пользователей. Субъективную оценку, подобную VMAF, стоит проводить раз в квартал.
• HIPAA, PCI DSS, GDPR и EU AI Act влияют на выбор поставщика сильнее, чем тесты производительности. В здравоохранении, финтехе и госсекторе инференс должен выполняться локально или привязываться к конкретному региону.
• Практика Agent Engineering в Форсофт позволяет запустить промышленного голосового агента за 8–12 недель командой из 2–3 человек — на 30–50% быстрее, чем при классическом подходе. Это достигается за счёт того, что оркестрационный код, телеметрию и тестовый каркас пишут ИИ-агенты под контролем сеньоров.
Почему этот гайд написала Фора Софт
Мы разрабатываем решения для общения в реальном времени и видео с использованием ИИ уже более 20 лет. Голосовые ассистенты, живые субтитры, перевод речи, ИИ-ассистенты для продаж, голосовые гиды для людей с нарушениями зрения — всё это было частью нашей работы задолго до того, как «голосовой агент» стал отдельной инвестиционной категорией.
В рамках проекта Meetric мы создали ИИ-ассистента для продаж, который транскрибирует, анализирует и даёт подсказки в ходе звонков в Zoom, Google Meet и Teams — с выводом структурированных данных в CRM. В TransLinguist запустили перевод в реальном времени на 75+ языков для маркетплейса, которому доверяет, в том числе, NHS в Великобритании. А в VOLO.live — браузерный переводчик с доступом по QR-коду, который выводит живые субтитры и закадровый перевод на офлайн-мероприятиях.
Этот гайд — то, что мы рассказываем руководителям продукта на первом созвоне: рабочий стек 2026 года, цифры, о которых спросит финансовый директор, ловушки комплаенса, из-за которых пилот проваливается ещё на этапе закупок, и последовательность запуска, которая доводит проект до продаж без потерь.
Планируете добавить голосового агента в свой продукт?
Получасовой созвон — разберём вендоров, бюджет задержек и требования по комплаенсу под ваш сценарий и подскажем, где можно сократить объём без потерь.
Четыре слоя стека голосового ассистента в 2026 году
Любой промышленный голосовой агент состоит из одних и тех же четырёх блоков, но с разными поставщиками внутри. Если правильно собрать эти блоки, выбор поставщика превращается в задачу, которую можно решить с помощью таблицы.
1. Voice Activity Detection (VAD) — входной шлюз
До любой транскрипции нужно определить: говорит пользователь или нет. Silero VAD и WebRTC VAD — открытые базовые решения. LiveKit Agents добавляет поверх них модель распознавания конца реплики, которая снижает количество ложных перебиваний: она учитывает не только громкость, но и вероятность того, что фраза завершена. Бюджет — 5–20 мс на одно решение.
2. Automatic Speech Recognition (ASR / STT)
Открытые модели: OpenAI Whisper, Parakeet и Canary из NVIDIA NeMo. Облачные вендоры: Deepgram Nova-3, Soniox v4, AssemblyAI Universal, Google Chirp 3, Azure Speech, Amazon Nova Sonic. Четыре оси сравнения — работа в потоковом режиме в реальном времени, временные метки на уровне слов, диаризация, переключение языков и возможность развёртывания на локальных серверах. Бюджет: 150–400 мс до первого частичного распознавания и 500–900 мс до финальной реплики.
3. LLM / NLU / оркестрация
Это «мозг». Gemini 2.5 Flash и Pro, GPT-4.1 и GPT-4o-Realtime, Claude Sonnet 4.6 и Haiku 4.5, Llama 4, Mistral Large 3 — выбор по балансу глубины рассуждений, задержки, стоимости и места хранения данных. Структурированный вывод и строгие JSON-схемы для вызова инструментов — основа предсказуемого поведения голосового агента. Бюджет — 200–800 мс до первого токена потокового ответа.
4. Text-to-Speech (TTS)
ElevenLabs Flash, Cartesia Sonic-3, Rime, OpenAI TTS, Azure Neural, Google Neural2, Amazon Polly Neural, NVIDIA Riva TTS, открытые модели вроде Kokoro и XTTS. Четыре критерия — поддержка нескольких языков, управление эмоциями, клонирование голоса с согласия пользователя и задержка до первого фрагмента аудио в потоке (цель — не более 120 мс). Для здравоохранения и финтеха безопасный выбор — Cartesia с сертификацией HIPAA/PCI Level 1 или Riva в локальной установке.
Якорь по задержкам: полный круговой обход «речь—речь» = VAD (~10 мс) + частичный ASR (~300 мс) + первый токен LLM (~400 мс) + первое аудио TTS (~120 мс) + сеть (~60 мс). Цель — медиана ниже 900 мс; следить нужно за P95, а не за P50.
Сравнение вендоров — кто в чём выигрывает
Упрощённая матрица по слоям, которые сильнее всего влияют на стоимость и соответствие требованиям. У каждого вендора есть лендинг, обещающий лучшее во всём. Прежде чем подписывать контракт, прогоните свои 50 эталонных клипов через каждое решение.
| Вендор / стек | Сильная сторона | Слабая сторона | Типичный сценарий |
|---|---|---|---|
| Deepgram Nova-3 | Низкая задержка потокового ASR, поддержка 36+ языков, точная диаризация | Облако — в первую очередь; on-prem — только в тарифе Enterprise | B2B-колл-центры, ИИ для продаж, инструменты для встреч |
| Soniox v4 | 60+ языков, переключение языков, определение спикеров | Меньшая экосистема, чем у Deepgram | Мультиязычные агенты, перевод в реальном времени |
| AssemblyAI Universal | Лидирующий WER на английском, поддержка 99+ языков, встроенная суммаризация | Потоковая задержка немного выше, чем у Deepgram | Постколл-аналитика, комплаенс-транскрипция |
| NVIDIA Riva | On-prem, ускорение на GPU, ASR + TTS + NMT в одном SDK | Нужен парк RTX / Hopper / Blackwell | Здравоохранение, оборона, изолированные контуры |
| OpenAI Realtime / GPT-4o | Единый speech-to-speech, лучшие рассуждения в классе, низкая задержка до первого аудио | Контроль над регионом хранения слабее, чем в Azure или при локальном развертывании | Потребительские агенты, профессиональные инструменты, быстрые пилоты |
| Google Gemini Live | Мультимодальность: речь и зрение, длинный контекст, хостинг в ЕС | Эргономика вызова инструментов всё ещё развивается | Продукты под регулирование ЕС, мультимодальные агенты |
| ElevenLabs Flash | ~75 мс до первого аудио, поддержка 70+ языков, клонирование голоса | Только облако; стоимость растёт с объёмом данных | Потребительские голосовые продукты, медиа, брендированные ассистенты |
| Cartesia Sonic-3 | Задержка модели — менее 100 мс, соответствие стандартам HIPAA и PCI Level 1, поддержка 40+ языков | Меньшая библиотека голосов, чем у ElevenLabs | Здравоохранение, финтех, регулируемый голосовой ИИ |
| LiveKit Agents | Открытая оркестрация, зрелый WebRTC-транспорт, определение конца реплики | Эксплуатация, наблюдаемость и каркас оценки — на вашей стороне | Собственные стеки, on-prem, точная настройка задержек |
| Vapi | 100+ языков, 40+ интеграций, управляемая телефония | Привязка к SaaS, поминутный тариф | Исходящие и входящие голосовые агенты в масштабе |
| Retell AI | ~600 мс задержки, сценарии перетаскивания, глубокая интеграция с телефонией | Меньше гибкости в пользовательских цепочках инструментов | Голосовые агенты для здравоохранения, страхования, логистики |
Бюджет задержек — что значит «звучит как человек»
Естественная пауза между репликами в человеческом телефонном разговоре — около 200–300 мс. Если попасть в это окно, в слепом тесте агента не отличить. Современные голосовые агенты в облаке не дотягивают до этой отметки, но в зону «достаточно естественно» вполне укладываются.
Менее 700 мс по медиане «речь—речь». Звучит естественно; пользователи перестают замечать задержку. Нужны потоковый частичный ASR, потоковый вывод LLM и TTS, который начинает воспроизведение с первого токена.
700–1 200 мс. Приемлемо. Пользователи иногда перебивают друг друга, поэтому система должна надёжно обрабатывать перебивания.
1 200–1 800 мс. Ощущается как устаревшее голосовое меню. Пользователи повторяют себя, переходят к набору текста или просто уходят.
Выше 1 800 мс. Зона срыва. Удержание снижается более чем на 30%.
Реальная метрика — это P95. Медианная задержка скрывает холодные старты, медленные токены LLM и джиттер очереди TTS. Алерт нужен при P95 > 1 500 мс, а не при P50.
Метрики качества, которые связаны с удержанием пользователей
Word Error Rate (WER). Главный показатель качества ASR. Цель — менее 5% на чистом английском, менее 10% на речи с акцентом и менее 15% на шумном телефонном аудио. Рассчитывайте отдельно по языку, кластеру акцентов и уровню отношения сигнал/шум.
Точность смены реплик. Ложные перебивания, пропущенные реплики пользователя, преждевременное завершение реплики. Считается на размеченном эталонном датасете из 200 диалогов; цель — менее 3% ложных перебиваний.
Естественность TTS (MOS / CMOS). Запускайте оценку Mean Opinion Score по 5-балльной шкале с 20 слушателями каждый раз при обновлении голосовой модели. Ниже 3,8 пользователи начинают замечать искусственность. Ниже 3,5 — отказываются использовать.
Доля решённых задач. Сквозная: пользователь дошёл до результата (записался, получил возврат, попал на нужного специалиста)? Прямо коррелирует с LTV; всё остальное теряет смысл, если эта метрика низкая.
Срыв до первого ответа. Если между подключением и первым звуком проходит больше 2 секунд, до 25% звонков теряются. Измеряйте задержку на уровне транспорта, а не приложения.
Правило эталонного датасета: запишите 200 реальных диалогов (с согласия пользователей), чтобы охватить все кластеры акцентов, языковые пары и типы задач в продукте. Протестируйте на них каждое изменение модели перед запуском. Регресс в одном из кластеров — частая причина незаметного падения качества.
Эталонная архитектура голосового агента 2026 года
Стек, который мы по умолчанию используем в промышленных проектах с голосовыми агентами.
Клиент и транспорт. LiveKit SDK (веб, iOS, Android, Unity) использует WebRTC для работы в браузерах и приложениях; Twilio Voice и SIP-транк интегрированы в LiveKit для телефонной связи. Эхоподавление, автоматическая регулировка громкости и шумоподавление реализованы на стороне захвата звука.
Оркестрация. LiveKit Agents или Pipecat на выделенных нодах с GPU. Гибрид конечного автомата и LLM: детерминированные сценарии для регулируемых шагов (аутентификация, оплата) и сценарии под управлением LLM для свободного диалога.
Линия ASR. Deepgram Nova-3 или Soniox v4 для потоковой обработки; Whisper-large-v3-turbo — для офлайн-обработки. При превышении лимита или сбое в регионе используется резервный маршрут.
Линия LLM. Gemini 2.5 Flash — для быстрых ответов, где важна скорость; Claude Sonnet 4.6 или GPT-4.1 — для сложных задач, требующих глубокого анализа. Вызов инструментов происходит по строгим JSON-схемам; каждый вызов фиксируется с хешами запроса и ответа.
Линия TTS. ElevenLabs Flash — для потребительских продуктов, Cartesia Sonic-3 — для регулируемых сред, Riva TTS on-prem — для изолированных систем. Кэширование голоса для часто используемых фраз (приветствия, дисклеймеры) устраняет задержку при воспроизведении этих фрагментов.
Наблюдаемость. Телеметрия по каждой реплике: решение VAD, частичный и финальный ASR, поток токенов LLM, первое аудио TTS, события перебивания, успех реплики. Трейсы OpenTelemetry в колоночное хранилище (ClickHouse или DuckDB); дашборды в Grafana.
Комплаенс — это рамки, которые сам поставщик выбирает для вас
HIPAA (здравоохранение в США). Защищённые медицинские данные не должны покидать инфраструктуру, охваченную соглашением о бизнес-ассоциации (BAA). Разрешённые решения: Cartesia, Deepgram Enterprise, NVIDIA Riva on-prem и Azure Speech (с BAA). Облачные потребительские API без BAA использовать нельзя.
PCI DSS (оплата голосом). Не передавайте данные карты напрямую в ASR. Используйте DTMF или паузу-возобновление записи для ввода цифр на этапе оплаты; ASR применяйте только для общения, не связанного с вводом данных карты.
GDPR (ЕС). Действуют требования к месту хранения данных, ведению журналов согласия и праву на удаление информации. Используйте эндпоинты в ЕС (Gemini Live EU, регионы Azure в ЕС) и установите короткий срок хранения; 30 дней для записей разговоров — разумный срок по умолчанию.
EU AI Act. Голосовые агенты обычно попадают в категории ограниченного или низкого риска; обязательно сообщайте пользователю, что он общается с ИИ. Использование биометрической классификации или распознавания эмоций резко повышает уровень риска; такие функции должны быть отключены по умолчанию.
Клонирование голоса и защита от синтетического голосового мошенничества. Перед клонированием голоса всегда получайте чёткое письменное согласие. Там, где риск мошенничества высок, добавляйте слышимые или скрытые метки происхождения для синтезированной речи. Стандарт C2PA для аудио пока находится в разработке, но развивается быстро.
Акценты, диалекты и переключение языков — самый сложный средний слой
В большинстве лидербордов ASR публикуют одно число для английского. Реальные пользователи говорят не на «лидербордовом» английском. WER 4% на Hugging Face Open ASR Leaderboard превращается в 12% на индийском английском, 18% на ярком региональном британском и 25% на спанглише или хинглише с постоянным переключением языка.
Решение — ансамбль из нескольких моделей. Основная модель (Deepgram или Soniox) с резервной для определённых акцентов; маршрутизация по локали, профилю пользователя и уровню уверенности в первой реплике.
Используйте подсказки по словарю. Все крупные вендоры ASR поддерживают пользовательские словари. Подгружайте глоссарий продукта, имена собственные и терминологию своей предметной области — ошибка распознавания (WER) на этих словах снижается на 30–60%.
Проектируйте с учётом переключения языков. Используйте режим «авто» (Soniox, Google Chirp 3) и подавайте в промпт LLM примеры нужной языковой пары. Пользователь, который в одном звонке переключается между испанским и английским, в 2026 году — обычное требование, а не редкий случай.
Мини-кейс — сократили время обработки звонка голосового агента на 28% за 10 недель
Ситуация. Финтех среднего размера запускал исходящего агента-сборщика долгов на устаревшем стеке в духе Vapi. Медианная задержка «речь—речь» — 1 600 мс, доля решённых задач — 42%, среднее время обработки звонка — 7,2 минуты, доля передач оператору — 34%.
План на 10 недель. Недели 1–2: эталонный датасет из 200 звонков и базовая телеметрия. Недели 3–5: переход на LiveKit Agents с потоковой обработкой через Deepgram Nova-3, Gemini 2.5 Flash и Cartesia Sonic-3; создание каркаса оценки. Недели 6–7: настройка определения смены реплик, добавление подсказок по платежным терминам, реализация PCI-совместимого захвата DTMF. Недели 8–10: запуск на 20% трафика, затем на 100%; мониторинг и итерации.
Результат. Медиана задержки — 720 мс (P95 — 1 350 мс). Доля решённых задач — 58%. Среднее время обработки звонка — 5,2 минуты (на 28% меньше). Доля передач оператору — 22%. Хотите такой же разбор по своему стеку? Позвоните или напишите — подготовим 30-минутный обзор голосового агента под ваш сценарий.
Дотачиваете задержки и выбор вендоров?
Сравним ваш текущий стек с эталонным промышленным и за 30 минут разберём все компромиссы.
Дорожная карта запуска — это план на 12 недель, который мы используем чаще всего
Не меняйте все слои сразу. Это план по слотам, который стабильно доходит до продакшена в проектах для здравоохранения, финтеха и SaaS.
| Недели | Поток работ | Результат | Критерий выхода |
|---|---|---|---|
| 1–2 | Эталонный датасет и телеметрия | 200 записанных диалогов, базовые задержки по слоям | Измеримая стартовая точка по каждой метрике |
| 3–4 | Спайк ядра стека | Сквозной прототип LiveKit Agents + ASR + LLM + TTS | P50 задержки < 1 000 мс на 10 эталонных клипах |
| 5–6 | Сценарии и вызов инструментов | Конечный автомат, JSON-схемы инструментов, интеграции с CRM | Доля решённых задач — более 80% на 50 скриптовых звонках |
| 6–8 | Комплаенс и доступность | Платёжный путь через DTMF, маскировка персональных данных, сценарии получения согласия, элементы доступности по стандарту WCAG | Пройден внешний аудит безопасности |
| 8–10 | Устойчивость к акцентам и языкам | Подсказки по словарю, маршрутизация по локалям, резервные модели | Ни на одном языковом кластере WER не превышает 12% на эталонном датасете |
| 10–11 | Постепенная выкатка | Сдвиг трафика: 5% → 20% → 50% с автоматическим откатом | Без P1-регрессов в течение 72 часов прогрева |
| 11–12 | GA и наблюдаемость | Дашборды, алерты, ночной регресс-прогон | Ноль незаметных регрессов качества за 14 дней |
Каркас решения — выбираем стек за пять вопросов
1. Какая рамка по комплаенсу? HIPAA / PCI / GDPR / on-prem — это отсекает больше поставщиков, чем любой другой фактор. Отвечайте на этот вопрос в первую очередь; всё остальное — уже следствие.
2. Какой бюджет задержек? Потребительский диалог — до 900 мс; замена голосового меню — до 1 500 мс; пакетная транскрипция нечувствительна к задержкам. Выбирайте поставщиков по показателю P95, а не по P50.
3. Какие языки и акценты? Только английский — просто; 30+ языков с переключением сужают выбор до Soniox v4, Deepgram Nova-3 или потокового Google Chirp 3.
4. Свой стек или SaaS? LiveKit + ваши вендоры дают полный контроль, прозрачность и выгодную стоимость при масштабировании; Vapi / Retell / Bland — самый быстрый способ запустить первый звонок. Точка окупаемости — примерно 20 тыс. звонков в месяц.
5. Что если вендор пропадёт? Держите Whisper, Kokoro/XTTS, Llama 4 и Riva на тестировании; если основной поставщик удвоит цены или его поглотят, у вас должен быть запасной вариант, который можно внедрить за один спринт.
Пять ловушек, которые мы видим в проектах с голосовыми ИИ-ассистентами
1. Оптимизация медианной задержки и игнорирование P95. Медиана хорошо выглядит на демонстрациях, а P95 — это то, что реально чувствуют пользователи. Собирайте метрики и настраивайте алерты на P95.
2. Привязка к одному вендору ASR или TTS. Удвоение цен, сбои в регионе, смена руководства — риски со стороны вендора вполне реальны. Держите запасной вариант, который можно развернуть за два спринта.
3. Допуск PCI-данных в ASR. Сырые номера карт в логах ASR — семизначный счёт на устранение последствий. Заложите DTMF и паузу-возобновление с первого дня.
4. Плоский набор тестов. Один общий корпус для английского языка маскирует проблемы с акцентами, шумом и переключением языков. Разделите данные по кластерам и отслеживайте регресс именно по каждому кластеру, а не в среднем по всем.
5. Чрезмерная ставка на рассуждения LLM. Лучшие голосовые агенты держат LLM на коротком поводке: детерминированные сценарии для регулируемых шагов и LLM — только для свободного диалога. Чисто LLM-агенты на масштабе уплывают в сторону и галлюцинируют.
KPI, которые стоит отслеживать
KPI качества. WER по языковым кластерам, точность смены реплик, MOS у TTS, доля решённых задач. Дашборд — раз в неделю, человеческие ревью — раз в квартал.
KPI задержек. P50 и P95 «речь—речь», задержка до первого аудио, время до первого частичного распознавания. Алерты — по P95.
KPI бизнеса. Среднее время обработки звонка, доля звонков, переданных оператору, количество срывов до первого ответа, стоимость решения одной задачи, NPS / CSAT по завершённым звонкам.
KPI надёжности. Доля полностью успешных диалогов (без сбоев в транспорте или сервисах), дрейф версий моделей, ежедневная доля успешных тестов регрессионного прогона на эталонном датасете.
Agent Engineering — как мы сократили время сборки голосового агента на 30–50%
Раньше на 12-недельную выкатку голосового агента уходило 4–5 сеньоров. С нашей практикой Agent Engineering тот же объём работы выполняет команда из 2–3 человек: оркестрационный шаблон, схемы вызова инструментов, каркас эталонного датасета, тестовый каркас и дашборды наблюдаемости пишут ИИ-агенты под контролем инженеров.
Где работают агенты. Шаблоны LiveKit Agents, сборка пайплайнов Pipecat, обвязка вокруг вендорских SDK, тестовые каркасы для WER и MOS, дашборды Grafana, каталоги регулярных выражений для маскировки персональных данных, CI/CD-пайплайны для развёртывания голосовых моделей, нагрузочные тесты, 70–80% тестовых фикстур.
Что это значит коммерчески. Промышленный голосовой агент, который раньше готовился к запуску на 16–20 неделе, теперь готов уже к 10–12 неделе — экономия распределяется между сокращением сроков и фиксированной стоимостью проекта.
Что не меняется. Архитектурные решения, проверка поставщиков (due diligence), ревью комплаенса, проектирование доступности и создание эталонного датасета остаются задачей сеньоров. Агенты усиливают команду, но не заменяют ключевые решения.
Проверка по цене: если подрядчик по голосовому агенту берёт оплату за неделю работы сеньора и при этом не использует Agent Engineering, вы переплачиваете 30–50% за работу, которую уже не нужно делать вручную. Узнайте, какую часть стека их агенты пишут самостоятельно.
Доступность как функция первого класса
Голосовые агенты, которые работают для всех, охватывают больший рынок и проходят госзакупки. Доступность закладывайте как часть продуктовой работы с первой недели — а не дотягивайте до десятой.
Режим медленной речи. Пользователи со слуховыми аппаратами, иностранцы и пожилые люди часто просят агента говорить медленнее. Сделайте скорость TTS основным параметром управления и сохраняйте её в профиль пользователя.
Паритет «текст ↔ голос». Дайте пользователю возможность в любой момент переключиться на ввод с клавиатуры и видеть текстовую расшифровку рядом с аудио. Это базовая доступность и одновременно способ повысить вовлечённость в шумной обстановке.
Совместимость со скринридерами. Каждый элемент соответствует стандарту WCAG 2.2 AA; статус агента (слушает / думает / говорит) отображается через ARIA live regions, чтобы скринридер озвучивал изменения состояния.
Автоопределение языка с ручным выбором. Автоопределение работает хорошо, пока не ошибается. Всегда оставляйте возможность вручную выбрать язык и сохраняйте этот выбор между сессиями.
Когда не стоит делать голосового ассистента
Менее 5 000 голосовых взаимодействий в месяц. Накладные расходы на инфраструктуру, оценку и эксплуатацию не окупятся. Сделайте чат-продукт, а голос добавьте на втором году.
Высокие ставки при отсутствии надёжной подстраховки. Медицинская сортировка, юридические консультации, крупные финансовые решения — голосовые агенты могут принимать и направлять запросы, но не должны принимать окончательные решения. Спроектируйте систему так, чтобы человек был всегда на расстоянии одной реплики.
Продукты с полным сквозным шифрованием. Облачным ASR/ТTS нужен расшифрованный поток на сервере. Если вы обещаете E2EE, либо запускайте модели на устройстве и миритесь с потерей качества, либо вообще отказывайтесь от голосовых функций.
Ниши с сильным предпочтением к тексту. Юриспруденция, корпоративные закупки, длинные исследования — в этих сферах пользователи чаще всего выбирают ввод текста. Сначала проверьте спрос с помощью текстового агента.
Архитектура данных — что хранить, а что отбрасывать
Сырое аудио. Храните только при наличии согласия, требований комплаенса или необходимости доказать мошенничество. Срок хранения по умолчанию: 30 дней для записей, 180 дней для транскриптов.
Структурированная телеметрия по репликам. Метрики VAD, ASR, LLM и TTS по каждой реплике — в колоночное хранилище. Около 200 байт на реплику; многолетнее хранение обходится дёшево и решает все вопросы при отладке.
Эталонный датасет. 200–500 вручную отобранных диалогов по всем языковым кластерам и типам задач, хранятся в WORM-хранилище. Проводится ночной регресс-прогон; при регрессе на отдельных кластерах срабатывают алерты.
Каталог версий моделей. Каждая реплика фиксируется с хешем модели ASR, версией LLM, хешем модели TTS и версией шаблона промпта. Это требование EU AI Act по ведению документации, а также инструмент для выявления незаметных регрессий.
Реальная картина стоимости в 2026 году
Потоковый ASR. 0,37–1,12 ₽ за минуту — зависит от вендора, тарифа и языка. На 100 тыс. минут в месяц выходит 37 500–112 500 ₽.
Инференс LLM. На одну реплику закладывайте 200–400 токенов на вход и 80–200 — на выход. Модели вроде Gemini 2.5 Flash и Claude Haiku 4.5 обычно обходятся в доли копейки; уровень GPT-4.1 — примерно в 3–8 раз дороже.
TTS. ElevenLabs Flash и Cartesia Sonic-3 тарифицируют по количеству символов. Одна минута речи — примерно 1000 символов; в стабильной работе стоимость составляет 0,75–3 рубля за минуту.
Транспорт. WebRTC через LiveKit Cloud или self-hosted добавляет 0,07–0,37 ₽ за минуту на участника. Телефония (Twilio, Vonage) добавляет поминутную плату, которую можно регулировать.
Итоговый ориентир. Голосовой агент средней сложности в стабильном режиме работает за 4,5–13,5 ₽ в минуту. Сравните с 56–135 ₽ за минуту полностью загруженного оператора-человека — окупаемость наступает быстро даже при небольших объёмах.
Якорь по стоимости: не оценивайте голосового агента только по формуле «стоимость инференса × минуты». Половина реальной цены — это транспорт, телефония, мониторинг и инфраструктура оценки. Перед тем как рассчитывать юнит-экономику, проанализируйте весь стек.
Хотите получить фиксированную оценку голосового агента для вашего сценария?
Соберём план на 10–12 недель: подбор вендоров, контур комплаенса и честный прогноз стоимости минуты разговора. 30 минут, без презентации.
FAQ
Какая реалистичная цель по задержкам у промышленного голосового агента?
Менее 900 мс по медиане «речь—речь» для потребительского диалога; порог алерта по P95 — 1 500 мс. Выше 1 800 мс удержание резко падает. Снимайте P95 на каждом звонке — медиана скрывает всё важное.
Брать открытый оркестратор (LiveKit, Pipecat) или управляемую платформу (Vapi, Retell)?
Граница окупаемости — около 20 000 звонков в месяц. Ниже этой отметки управляемые платформы быстрее и дешевле в общей сумме. Выше — поминутная оплата управляемой платформы начинает превышать затраты на разработку, и комбинация «открытый стек + прямые контракты с вендорами» становится выгодной. Сегодня LiveKit Agents — наш открытый стек по умолчанию.
Можно ли развернуть весь стек локально для соответствия HIPAA или изолированных сред?
Да. NVIDIA Riva закрывает ASR + TTS on-prem; открытые LLM (Llama 4, Mistral) — слой рассуждений; LiveKit self-hosted — транспорт. Ожидайте задержку 10–50 мс по сравнению с облаком и реальные обязательства по парку GPU. Cartesia Sonic-3 — второй сильный вариант, если on-prem-развёртывание прописано в контракте.
Как закрыть акценты и переключение языков, не создавая собственную языковую модель?
Берите вендоров с хорошей поддержкой мультиязычного потокового распознавания (Soniox v4, Deepgram Nova-3, Google Chirp 3); включайте автоопределение языка с возможностью ручного переключения; загружайте список ключевых слов вместе с глоссарием продукта; сложные акцентные кластеры направляйте на специализированную резервную модель. Реальный бенчмарк — это WER на самом трудном для вас кластере, а не цифра с лидерборда.
Что с PCI DSS — может ли голосовой ИИ-агент принимать платёж?
Не через захват цифр карты в ASR. Совместимый паттерн — передавать момент ввода карты на путь DTMF или паузу-возобновление записи, чтобы номер не попадал в логи и транскрипты, а затем возвращаться к голосу для подтверждения. ASR остаётся в области применения только для разговора без ввода карты.
Нужно ли сообщать пользователям, что они общаются с ИИ?
Да — этого требует EU AI Act и аналогичные законы штатов США (Калифорния, Колорадо, Юта — список растёт). Делайте сообщение коротким и сразу в начале, фиксируйте согласие, давайте короткий путь к человеку. Скрытая ИИ-природа агента — это и юридический риск, и удар по доверию.
Как защититься от клонирования голоса и мошенничества с синтетическими голосами на платформе?
Требуйте явного письменного согласия с подтверждением личности перед клонированием любого голоса; используйте водяные знаки или теги C2PA для маркировки синтезированного аудио там, где велик риск мошенничества; применяйте антиспуфинг-обработку входящего аудио, если в системе используется голосовая биометрическая аутентификация. Эти меры достаточны для большинства продуктовых рисков; специализированные команды по борьбе с мошенничеством добавляют дополнительные уровни защиты.
Какова реальная стоимость минуты у промышленного голосового агента в 2026 году?
4,5–13,5 ₽ за минуту разговора с агентом средней сложности — в зависимости от стека. Сравните с 56–135 ₽ за минуту полностью загруженного оператора-человека — и станет ясно, почему бюджеты в 2026 году смещаются в эту сторону. Главный рычаг — объём: стоимость минуты снижается примерно на 30–40% при росте числа звонков с 10 до 500 тысяч в месяц.
Как тестировать голосового агента, чтобы незаметные регрессии не попадали в продакшн?
Три уровня. Ночной автоматический регресс на эталонном датасете из 200–500 клипов с порогами по WER, доле решённых задач и задержкам по каждому кластеру. Еженедельный разбор 30 реальных звонков — человек-рецензент оценивает выборку. Раз в квартал — полная оценка людьми (MOS, симуляция CSAT). Версии моделей фиксируются между тестом и продом; любое обновление версии требует обязательного полного прогона перед выкаткой.
Что почитать дальше
Видео и голос
ИИ-функции в видеоконференциях, которые будут важны в 2026
Двенадцать возможностей ИИ, меняющих формат встреч, — рядом с вашим голосовым помощником.
Кодеки и ИИ
Тренды ИИ в обработке видео: 9 изменений, влияющих на реальную экономику
Где кодирование, генеративное видео и инференс на edge экономят реальные деньги в 2026.
Качество стриминга
Улучшение качества видео с ИИ: 6 прорывных функций
Супер-разрешение, шумоподавление, HDR, интерполяция кадров — с планом внедрения на основе VMAF.
Кейс
Meetric — ИИ-ассистент для продаж в Zoom, Meet и Teams
Анализ вовлечённости в реальном времени, автоматический коучинг, сбор данных для CRM.
Кейс
TransLinguist — перевод в реальном времени на 75+ языках
Маркетплейс с доверием NHS, более 30 000 сертифицированных переводчиков и живой ASR.
Готовы запустить голосового агента, который реально работает в 2026?
В 2024 голосовые ассистенты перестали быть научным проектом. В 2026 это решение по стеку — четыре слоя, рамка комплаенса, бюджет задержек и план выкатки. Команды, которые подбирают вендоров под реальные тестовые наборы и идут постепенной 12-недельной выкаткой, доезжают до продакшена чисто; команды, которые показывают прототип и сразу отправляют его в продакшн, — нет.
Мы уже два десятилетия разрабатываем голосовые и ориентированные на голос продукты. Если вам нужен выбор стека, эталонные 200 клипов, карта соответствия требованиям и честный план на 10–12 недель — всё это можно обсудить за получасовой созвон.
Начните с получасового плана, а не с презентации
Подберём поставщиков, согласуем бюджет задержек, определим сроки запуска — на 10–12 недель. После одного созвона заметки пришлём вам на почту.

