Распознавание речи в шуме: 3 стратегии и WER в 2026

12/6/2025
·
Обновлено
8.20.2026
3 ключевые стратегии распознавания речи в шумной среде в 2026 году (бенчмарки WER + стек) — обложка

Ключевые выводы

• Три слоя, а не один. Шумоподавление, устойчивая к шуму модель и дообучение под отрасль. Пропустите любой, и потеряете 10-20 пунктов WER.

• Nova-3 лидирует в реальном времени, Whisper v3 в open-source. Deepgram Nova-3 показывает 6,84% WER на чистом аудио и 11-15% на шумном при задержке менее 300 мс. Whisper Large v3 Turbo: лучший вариант для офлайн-распознавания.

• Keyterm-биасинг превосходит дообучение для большинства задач со словарём. Современные API поддерживают до 1000 пользовательских терминов прямо во время работы: это бесплатное повышение точности для имён собственных, названий препаратов, артикулов.

• Фронтенд важнее, чем кажется. Одно только качественное шумоподавление снижает WER в шуме на 20-40%, ещё до того, как заработает сама модель.

• Измеряйте WER на своём аудио, а не на чужом. Публичные рейтинги не учитывают, как звучит ваш склад, сканер штрихкодов или набор акцентов.

Распознавание речи в шумной среде: решённая задача 2026 года, если правильно собрать три уровня. Нейросетевой фронтенд для шумоподавления, акустическая модель, устойчивая к шуму, и дообучение под отрасль с keyterm-биасингом на вашем реальном словаре. Соберите все три, и ошибка распознавания (Word Error Rate, WER) в шумных условиях снизится с 25-40% до 8-12%. Это почти такой же результат, как несколько лет назад на чистом аудио.

Соберите только один из трёх, и получите продукт, который отлично выглядит в офисе, но ломается на складе, в окне автораздачи, в колл-центре или в больничном коридоре. Мы это знаем, потому что внедряли ASR во все эти среды. Фора Софт с 2005 года выпустила 250+ проектов для коммуникаций в реальном времени, и распознавание речи с обработкой на базе ИИ: одна из наших глубоких специализаций, от медицинских видеоплатформ, где важно правильно распознавать каждый клинический термин, до приложений для live-стриминга, где субтитры в реальном времени работают поверх шума толпы и музыки.

Это руководство: рабочая методичка, которую мы используем сами. Три стратегии, которые действительно работают, ландшафт моделей 2026 года с реальными цифрами, референсный пайплайн, пригодный для продакшена, и честное сравнение облачных API и self-hosted решений. Если вы выбираете между Deepgram, Whisper, Riva или AssemblyAI для продукта, где люди не всегда будут в тихой комнате, этот документ для вас.

Почему распознавание речи в шуме всё ещё сложно в 2026 году

ASR на трансформерах вытеснил всех с бенчмарков. На чистом студийном английском лучшие модели 2026 года показывают WER 5-7%: уровень, сравнимый с человеческим восприятием на большинстве материалов. Но продакшен-аудио редко бывает чистым. Реальные пользователи говорят в микрофоны ноутбуков в опен-спейсе, где гудит вентиляция и переговариваются коллеги, на уровне 60-80 дБ, через автомобильную громкую связь на скорости 70 км/ч, где гул дороги накладывается на основные мужские частоты, по VoIP от операторов колл-центра на одном этаже с 200 другими сотрудниками, в сканеры на складе под писк погрузчиков и удары металла о металл, в клинические гарнитуры в реанимации, где мониторы пищат каждые две секунды, а также через Bluetooth-наушники, которые агрессивно подавляют шум ещё до того, как сигнал дойдёт до сервиса, иногда вместе с шумом удаляя фонемы.

Запустите модель мирового уровня в любой из этих сред, и WER утроится. Сам Deepgram в своей документации признаёт, что шумные условия добавляют 5-10 пунктов WER даже у Nova-3. Whisper, обученный на широком распределении интернет-аудио, деградирует более плавно, но всё равно теряет 8-15 пунктов на тяжёлом шуме. Разрыв между «бенчмарком модели» и «WER продукта»: это то место, где тихо умирает большинство ASR-проектов.

Хорошая новость: три стратегии из этого руководства, применённые вместе, закрывают большую часть этого разрыва. Плохая новость: они требуют инженерной работы, о которой маркетинговые страницы облачных API обычно умалчивают. Именно эту часть закрывает разработка ИИ под задачу, когда готовый API упирается в потолок на вашем реальном аудио.

Бенчмарки WER в 2026: как выглядит хороший результат

Прежде чем ставить цель, поймите, что реально умеет фронтир. Это цифры, которые мы используем как точки отсчёта в 2026 году, собранные из публичных лидербордов и из наших собственных внутренних оценок на клиентском аудио.

Сценарий Целевой WER (английский) Что нужно для такого результата
Чистая студия или гарнитура, носитель языка 5-7% Любая фронтирная модель «из коробки»
Видеоконференция, тихая комната 7-10% Фронтирная модель и базовый VAD
Опен-спейс, фоновая болтовня 10-14% Добавить нейросетевое шумоподавление
Колл-центр или контакт-центр 12-16% Шумоподавление и keyterm-биасинг
В машине, окно автораздачи, торговый зал 14-20% Все три стратегии и дообучение под отрасль
Промышленность, склад, клиника 16-24% Все три стратегии и кастомная акустическая модель
Акцент, неносители языка +3-8 пунктов WER к носителям Мультиязычные модели и сбалансированные обучающие данные

Если ваш текущий пайплайн отстаёт от эталонной строки более чем на 5 пунктов WER, есть потенциал для улучшения, обычно за счёт добавления слоя, а не смены модели.

Три стратегии, которые реально работают

Каждая устойчивая к шуму ASR-система, которую мы внедряли или аудировали, строится из трёх слоёв. Пропустите один, и будете пытаться компенсировать его за счёт других, но в итоге упрётесь в потолок.

Очистите аудио до того, как его увидит модель. Нейросетевой фронтенд убирает стационарные шумы, нестационарные шумы и конкурирующую речь. Это вмешательство с самым высоким эффектом в 2026 году, потому что современные шумоподавители достаточно быстры, чтобы работать в реальном времени на обычном железе, а улучшение умножается на всё, что идёт дальше.

Используйте модель, обученную на шуме. Современные ASR-модели в 2026 году стали не просто крупнее: их обучают на специально ухудшённом аудио с помощью SpecAugment, свёртки с импульсной характеристикой помещения и аддитивного шума при заданном уровне SNR. Выбирайте модель, чьё обучающее распределение соответствует условиям реальной эксплуатации.

Научите модель вашему словарю. Даже идеальная универсальная модель ошибётся на названиях ваших продуктов, препаратов, медицинских кодах или артикулах. Keyterm-биасинг на этапе инференса или лёгкое дообучение на предметных данных быстро и недорого устранят эти ошибки.

Три стратегии дополняют друг друга. Если отраслевой словарь пересекается с общеупотребительным более чем на 90 процентов, кастомное обучение можно пропустить: фронтирная модель справится из коробки.

Стратегия 1: нейросетевой фронтенд, подавление шума до ASR

В 2026 году нет оправданий для отправки необработанного аудио с микрофона напрямую в ASR-модель. Нейросетевой шумоподавитель размещается между микрофоном и распознавателем и очищает сигнал в реальном времени.

Krisp SDK. Один из самых массово развёрнутых нейросетевых шумоподавителей в индустрии, интегрированный в сотни коммуникационных продуктов, включая шумоподавление у Zoom (сервис Zoom для конечного пользователя в России недоступен напрямую, но лицензированная им технология шумоподавления используется и в других продуктах). Работает быстрее 15 мс на одном ядре CPU, эффективно убирает стационарный и нестационарный шум и сохраняет естественность речи лучше, чем классический DSP. Наша рекомендация по умолчанию для продакшен-приложений, где допустима стоимость лицензии.

NVIDIA Maxine Audio Effects. Шумоподавление с ускорением на GPU, подавление эха помещения и суперразрешение. На сложных примерах качество выше, чем у Krisp, но требуется железо NVIDIA: подходит для серверных пайплайнов, а не для массовых мобильных решений.

RNNoise, Demucs и другие открытые варианты. RNNoise: классический лёгкий вариант, бесплатный, почти не нагружает CPU, и для многих задач этого вполне хватает. Demucs и DeepFilterNet дают более высокое качество, но требуют больше вычислительных ресурсов. Для on-device обработки на смартфонах среднего уровня мы сейчас используем DeepFilterNet v3 в формате int8.

Платформенные шумоподавители. Изоляция голоса на устройстве, шумоподавление Google Meet (сервис для пользователей из России напрямую недоступен) и современные Bluetooth-кодеки активно подавляют посторонние шумы прямо на устройстве. Это полезно, но может быть и рискованно: такие системы иногда удаляют важные фонемы, необходимые для работы ASR. Мы проводим тесты как с включённым, так и с выключенным нативным шумоподавлением, а в некоторых случаях просим пользователей отключить его.

Ориентир по эффекту: нейросетевой шумоподавитель в шумном пайплайне снижает WER на 20-40 процентов относительно исходного значения. Это самое простое и дешёвое улучшение, которое можно применить без изменения самой модели.

Стратегия 2: устойчивые к шуму акустические модели

Архитектура Conformer объединила self-attention и свёрточное извлечение признаков и стала де-факто стандартом для современных систем распознавания речи. Whisper использовал крупномасштабную слабую супервизию, более 680 000 часов разнообразного интернет-аудио, и стал одной из первых ASR-моделей, которая стабильно работает на «диких» распределениях данных. Каузальные модели для стриминга увеличивают WER на 1-2 пункта, но снижают задержку до менее 200 мс: для живых субтитров такой обмен обычно оправдан.

К 2026 году фронтир: это несколько семейств моделей, каждое из которых оптимизировано под свой профиль развёртывания.

Deepgram Nova-3: проприетарная модель со стримингом в реальном времени, задержка около 300 мс, поддерживает 36 языков, WER 6,84% на чистом аудио и 11-15% на шумном. Лучший выбор для голосовых агентов в реальном времени и живых субтитров.

Whisper Large v3 Turbo: open-source, работает в офлайн-режиме и пакетно, заметно быстрее полной версии благодаря обрезке слоёв декодера, при этом уступает полной модели менее чем на 1 пункт WER. Лучший выбор для пакетной транскрипции записанного контента при минимальной стоимости за минуту.

NVIDIA Parakeet TDT 0.6B v2 и Canary-Qwen 2.5B: лидеры публичных рейтинг-листов ASR в 2026 году, доступны через Riva NIM.

AssemblyAI Universal-2: хорошо справляется с аудио из колл-центров и диаризацией, дополнительно включает определение тематики и модерацию контента.

Унифицированные речевые модели вроде gpt-realtime speech: не чистый ASR-эндпоинт, но остаются конкурентоспособным решением для диалоговых агентов, особенно если вы и так используете LLM.

SpecAugment и обучение с добавлением шума сейчас: стандартная практика, поэтому большинство моделей и так хорошо работают в шуме. Но важно, сколько именно шума они видели во время обучения. Если вы работаете в очень шумной среде, выбирайте модели, у которых вендоры публикуют WER в шумных условиях, а не только на чистом эталонном наборе.

Стратегия 3: дообучение под отрасль и смещение по ключевым словам

Даже лучшая универсальная модель исказит редкое название препарата или артикул с буквенно-цифровым кодом. Это не лечится переобучением с нуля. Есть три более дешёвых способа.

Keyterm-биасинг на инференсе. Современные API поддерживают до 1000 пользовательских терминов на запрос с настраиваемыми весами, глоссарий через текстовый промпт или встроенное повышение точности распознавания имён собственных, названий продуктов, лекарств, артикулов и отраслевой терминологии. Никакого обучения не требуется, можно внедрить уже сегодня.

LoRA или лёгкое дообучение на отраслевом аудио. Если стандартное акустическое распределение не подходит, например из-за сильных акцентов, особенностей записи или редких языковых вариантов, LoRA-адаптер, обученный на 20-100 часах размеченного клиентского аудио, снижает ошибку распознавания на 3-8 пунктов WER.

Пользовательский словарь и фонетические лексиконы. Для слов с неочевидным произношением, например брендов или заимствованных терминов, явный словарь произношений помогает модели корректно их распознавать. Большинство корпоративных ASR-платформ такую возможность поддерживают.

Порядок «сначала биасинг, потом дообучение» имеет значение. Биасинг бесплатный, обратимый и занимает день. Дообучение требует времени GPU и накладных расходов на MLOps. Всегда используйте биасинг в полной мере, прежде чем переходить к обучению.

Сравнение моделей: Nova-3, Whisper v3, Riva, AssemblyAI

Критерий Deepgram Nova-3 Whisper Large v3 Turbo NVIDIA Riva Parakeet/Canary AssemblyAI Universal-2
Развёртывание Облачный API, можно развернуть локально Open-source, self-host NIM-микросервис, on-prem Облачный API
Стриминг в реальном времени Да, около 300 мс Ограниченно, батч-ориентирован Да, около 200 мс Да, около 400 мс
WER на чистом аудио ~6,8% ~7,5% ~6,3% (Canary-Qwen) ~7,2%
WER на шумном аудио 11-15% 12-17% 10-14% 12-16%
Языки 36 99+ 25+ 17
Keyterm-биасинг До 1000 терминов Через промпт Пользовательский словарь Word Boost
Диаризация Да Через надстройку Да Да, сильная
Цена за минуту ~0,3-0,6 ₽ Только инфраструктура, ~0,07 ₽ По часам GPU ~0,3-0,7 ₽
Подходит для Голосовые агенты, контакт-центры Пакетная обработка медиа On-prem под регуляцией Аналитика подкастов и встреч

Универсального победителя нет. В 2026 году наш выбор по умолчанию для шумных задач в реальном времени: Nova-3 с фронтендом для шумоподавления и keyterm-биасингом. Для on-premise задач и требований к соответствию: Whisper v3 Turbo или Riva Canary на GPU заказчика. Для массовой транскрипции медиа батчевый Whisper выигрывает по стоимости.

Типичная ошибка: тестировать на публичном эталонном наборе, а не на вашем реальном аудио. Публичные бенчмарки занижают шумный WER на 15-25 процентов.

Русская речь: те же три стратегии, но другие модели

Все цифры WER выше сняты на английском. На русском расклад другой, и главное расхождение касается как раз Whisper, которого выше рекомендовали как открытый вариант: на русских датасетах он проигрывает моделям, обученным на русской речи, втрое.

Модель Лицензия Размер Колл-центр, WER Дальнее поле (Golos Farfield)
GigaAM-v3-RNNT, Сбер MIT 220 млн параметров 9,5% 3,9%
T-one, Т-Банк, потоковая Apache 2.0 71,6 млн параметров 8,63% с языковой моделью обучена на телефонии
Whisper large-v3 MIT 1,55 млрд параметров 23,1% 16,4%

Средний WER по шести русским наборам: 6,7% у GigaAM-v3-RNNT против 20,8% у Whisper large-v3.

Что из этого следует для архитектуры:

  • Открытая модель под русский берётся не Whisper. GigaAM-v3 выложен под MIT и весит 220 млн параметров против 1,55 млрд у Whisper large-v3, то есть одновременно точнее и дешевле по железу
  • Для телефонии и колл-центра есть отдельный ответ. T-one обучена на 80 тысячах часов, из них 57,9 тысячи телефонных. Это настоящий стриминг: модель принимает куски по 300 мс, задержка пайплайна порядка 1-1,2 секунды. Лицензия Apache 2.0 разрешает коммерческое использование
  • Облачный путь внутри страны. Яндекс SpeechKit и SaluteSpeech закрывают случай, когда своё железо держать не хочется, и заодно снимают вопрос хранения аудио внутри страны по 152-ФЗ
  • Полностью офлайн на слабом железе остаётся за компактными моделями вроде Vosk, но за экономию ресурсов там платят точностью

Сами три стратегии для русского работают ровно так же: чистим аудио до модели, берём модель с подходящим обучающим распределением, дообучаем под отрасль. Меняется только то, что подставляется во вторую строку.

Отдельная оговорка про акценты и неносителей языка: русскоязычные модели обучены преимущественно на речи носителей, и на сильном акценте разрыв с англоязычными бенчмарками не воспроизводится. Если аудитория говорит по-русски с акцентом, замер нужен на своём аудио, а не по таблицам.

Референсная архитектура: пайплайн ASR для шума в 2026

Вот пайплайн, который мы развёртываем для шумных задач в реальном времени. На каждой стадии своя задача, лимит задержки и запасной вариант.

Стадия Компонент Бюджет задержки
1. Захват 16 кГц моно PCM, AEC выключен, если ниже по конвейеру используется сильное шумоподавление менее 5 мс
2. Voice Activity Detection Silero VAD v5 или WebRTC VAD для простых задач менее 10 мс
3. Шумоподавление Krisp SDK, NVIDIA Maxine или DeepFilterNet v3 менее 15 мс
4. Транспорт WebSocket или data-канал WebRTC с Opus, кадры по 20 мс 20-60 мс
5. ASR Nova-3, Riva Parakeet или Whisper Turbo со стриминговым эндпойнтером 150-300 мс
6. Keyterm-биасинг и постобработка Подстановка по пользовательскому словарю, пунктуация, регистр, форматирование чисел 10-30 мс
7. LLM или действие ниже Опционально: классификация интента, распознавание сущностей, голосовой ассистент зависит от сценария

От рта до отрисованного субтитра end-to-end: 250-450 мс. Это укладывается в диапазон, который человек воспринимает как реальное время. Перевалите за 600 мс, и разговорный поток ломается.

В голосовых агентах основная причина задержки: работа LLM, а не сам ASR-слой. Тот же транспорт и слой ASR, описанные здесь, встраивается в более широкую архитектуру мультимодального голосового агента напрямую. За ответом агента идёт озвучка, и библиотеки синтеза речи добавляют к этому бюджету собственную задержку до первого байта аудио.

Аппаратный слой: микрофоны, бимформинг и ограничения устройств

Алгоритмы шумоподавления могут восстановить только то, что записал микрофон. Если вы контролируете оборудование, даже небольшие улучшения дают значительный выигрыш в WER.

Расположение микрофона. Расстояние от рта до микрофона важнее, чем его качество. Недорогой бумовый микрофон на расстоянии 3 см от губ справится лучше, чем дорогой конференц-микрофон, установленный в 2 метрах.

Микрофонные массивы и бимформинг. Два и более микрофона с известной геометрией позволяют сфокусировать приёмный сигнал на говорящем. Используйте бимформинг, когда вы контролируете оборудование: два микрофона с эхокомпенсацией почти всегда работают лучше, чем более крупная модель с одним микрофоном. Для стационарного размещения бимформинг: самый дешёвый способ улучшить распознавание речи на 3-6 пунктов WER.

Частота дискретизации. Используйте 16 кГц в моно. Более высокая частота не улучшает работу ASR: большинство моделей всё равно снижают частоту. Ниже, например 8 кГц как в телефонном аудио, теряются высокочастотные компоненты, и WER растёт на 3-5 пунктов.

Эхокомпенсация. Если система воспроизводит аудио пользователю, например голосовой ассистент или видеозвонок, без эхокомпенсации вы будете слышать и транскрибировать собственный синтезированный голос. AEC3 из WebRTC работает отлично и бесплатна.

Что мы узнали, внедряя ASR в реальные приложения с шумом

Медицинские и телемедицинские платформы. Главное узкое место: клиническая лексика, а не шум. Прогоняйте keyterm-биасинг по списку препаратов, кодам МКБ и названиям процедур, а лексикон должен вести сам провайдер медицинской платформы.

Субтитры для live-стриминга. Музыка на фоне речи: самый сложный случай. Шумоподавление убирает гармоники, модели ошибаются и «придумывают» текст песни. Проблему решает фронтенд, который знает о наличии музыки через разделение источников, и модель, обученная на аудио с музыкой.

Полевые сервисы и стройка. Ветер, техника и средства индивидуальной защиты, которые заглушают звук, неизбежны. Инвестируйте в аппаратную часть, например микрофоны костной проводимости и направленные гарнитуры, до настройки программного обеспечения.

Многоязычные встречи. Переключение языков в середине предложения сбивает большинство систем распознавания речи. Используйте модели с мультиязычным обучением.

Голосовые агенты и замена IVR. Низкая задержка важнее небольшого роста ошибки распознавания. Система, которая работает на 200 мс быстрее, но имеет WER на 1 процент выше, воспринимается пользователями лучше, чем более медленная, но чуть точнее. Выбирайте стриминговые модели, а от батчевого распознавания в реальном времени лучше отказаться.

Реальная экономика в 2026: облачный API против self-hosted

На низких объёмах облачные API всегда выигрывают. На высоких: выигрывает self-hosted Whisper на собственных GPU. Точка перехода: где-то между 5000 и 20 000 минут в день.

Объём (минут в месяц) Облачный API (~0,45 ₽/мин) Self-hosted Whisper (GPU) Победитель
100 000 (мало) ~45 000 ₽ ~60 000 ₽, один GPU с недогрузкой Облако
1 000 000 (среднее) ~450 000 ₽ ~262 500 ₽, 2-3 GPU Self-hosted
10 000 000 (энтерпрайз) ~4,5 млн ₽ ~1,1-1,8 млн ₽ Self-hosted
100 000 000 (гипермасштаб) ~45 млн ₽ ~6-9 млн ₽ Self-hosted

В цифрах self-hosted учтены GPU, размазанное время MLOps-инженера и наблюдаемость, но не учтены альтернативные издержки от того, что ваши инженеры не работают над другими задачами: именно поэтому большинство компаний с объёмом меньше 10 миллионов минут в месяц остаются на облачных API, даже когда экономика склоняется в другую сторону. Реальный вопрос звучит иначе: что разблокирует скорость продукта, а не просто что дешевле в моменте. Для голосовых сценариев в ту же смету попадает телефония, и голосовые API вместе с их ограничениями считаются в одном бюджете с распознаванием.

Одна поправка для русскоязычного продукта: в строке self-hosted стоит считать не Whisper, а GigaAM-v3 или T-one. Они точнее на русском и на порядок легче, поэтому та же нагрузка потребует меньше GPU, а точка перехода на своё железо наступит раньше. Разбор ниже.

Делать или покупать: когда стоит обучать собственную акустическую модель

В 2026 году обучать ASR-модель с нуля почти никогда не стоит. Рабочий подход: дообучение фронтирной open-source модели на отраслевых данных. Редкие случаи, когда оправдана кастомная модель: вы работаете с языком или диалектом, который плохо поддерживается современными моделями, условия настолько экстремальны, что публичные модели перестают работать, у вас есть большой размеченный датасет объёмом более 1000 часов, или по регуляторным требованиям нужна полная прослеживаемость происхождения модели от начала до конца.

Всем остальным: начните с фронтирной модели и трёх стратегий выше, измерьте WER и переходите к обучению только тогда, когда столкнётесь с чётким пределом. Путь дообучения обычно достигает уровня WER, готового к продакшену, в несколько раз быстрее, чем обучение с нуля. Прежде чем вкладываться в GPU и разметку, помогает оценка архитектуры пайплайна: часто потолок задаёт фронтенд или транспорт, и смена модели тут ничего не меняет.

Оценка: как измерять WER в реальных условиях работы

Цифры WER от вендоров: это результаты в идеальных условиях бенчмарков. Ваши пользователи не говорят в таких условиях. Соберите внутренний тестовый набор, который отражает реальные условия использования: демографию говорящих, типы шума, разнообразие устройств, словарный запас и распределение акцентов. 100-300 вручную размеченных фрагментов достаточно, чтобы получить статистически значимое сравнение между кандидатами на роль пайплайна.

Измеряйте метрики, которые действительно важны для вашего продукта. WER: классика, но разбейте данные на сегменты по уровню шума и по акценту. Полнота по ключевым терминам: правильно ли модель распознаёт важные слова из вашего словаря, поскольку пайплайн с более высоким общим WER, но точным распознаванием критичных терминов, может быть полезнее пайплайна с более низким WER, который их искажает. Перцентили задержки p50, p95 и p99: длинные хвосты задержки портят работу голосовых агентов. Точность эндпойнтинга: ложные начала, обрезанные фразы, слишком длинные паузы. Семантическая корректность: для пайплайнов с голосовым агентом оценивайте точность выполнения конечной задачи, а не только качество транскрипции. Низкий WER сам по себе сценарий не спасает: дальше работают голосовой UX и работа со смыслом, которые прощают пользователю оставшиеся ошибки распознавания.

Автоматизируйте оценку. Каждое обновление модели, изменение пайплайна или итерация дообучения должны генерировать отчёт по WER на одном и том же эталонном наборе. Без этого вы действуете вслепую.

Что регулирует закон

Речь: персональные данные по 152-ФЗ, и голос дополнительно относится к биометрическим персональным данным, если система способна идентифицировать человека. Обработка требует отдельного, понятного согласия с возможностью его отозвать, а провайдер ASR становится вашим субподрядчиком по обработке данных.

Для медицинских сценариев дополнительно действуют требования 323-ФЗ и профильных приказов Минздрава. Для образовательных сценариев с участием несовершеннолетних применяются требования 273-ФЗ вместе с 152-ФЗ. Для организаций, относящихся к критической информационной инфраструктуре, значение имеет соответствие требованиям ФСТЭК и 187-ФЗ.

Запись разговоров. Во многих юрисдикциях, включая Россию, для записи и транскрипции разговора нужно явное согласие участников. Встраивайте процесс получения согласия в продукт с самого начала, а не добавляйте его постфактум.

Срок хранения данных. По умолчанию используйте короткий срок хранения транскриптов и возможность продлить его только по согласию пользователя. Никогда не используйте клиентское аудио для обучения моделей поставщика без явного согласия пользователя.

Голосовая биометрия и идентификация говорящего. Это сценарий повышенного юридического риска: используйте его только с явного согласия, строго в определённых целях и после юридической проверки. Диаризация, то есть различение «спикера A» и «спикера B» без установления личности, считается менее рискованной и применяется широко.

Сколько это стоит на практике

Разработка устойчивого к шуму ASR-пайплайна под ключ у Фора Софт начинается от 310 000 ₽: итоговая стоимость зависит от требований к дообучению модели, числа языков и требований к соответствию.

Наш опыт внедрения распознавания речи

Фора Софт интегрирует ASR в продукты для коммуникаций в реальном времени с 2005 года: 250+ проектов, 2 миллиона часов разработки, заказчики из 17+ стран, 50 специалистов в штате без субподряда.

Мы разработали ТрансЛингвист: платформу для перевода встреч в реальном времени, где стриминговый ASR, машинный перевод и синтез речи объединены в цикл с задержкой менее секунды, а работу дополняют 8 000+ проверенных переводчиков по 62 языковым парам. Мы также разработали ядро для трансляций в реальном времени для БрейнСерт, платформы для уроков в реальном времени с доступностью 99,995% и свыше 500 миллионов минут проведённых занятий, включая живые субтитры для виртуальных аудиторий при разных микрофонах и каналах связи. Тот же опыт с потоковым аудио лежит в основе Таннел, нашего сервиса p2p видеозвонков на WebRTC с входом по номеру комнаты.

В каждой команде по обработке в реальном времени у Фора Софт есть специалисты по ИИ и машинному обучению, поэтому трёхслойная архитектура из этого руководства: то, что мы реально применяем на практике, а не абстрактная теория.

Продукт в реестре отечественного ПО Минцифры, программа «Мундиаль», реестровая запись № 21522.

FAQ

Какой WER реалистичен для моего продукта?

Сопоставьте своё развёртывание с таблицей из раздела по бенчмаркам WER. Чистая и тихая среда: 5-10%. Офис или деловая встреча: 8-14%. Колл-центр или поездка в машине: 12-18%. Промышленная зона или медицинская клиника: 16-24%. Значения ниже этих диапазонов обычно означают, что вы реализовали все три стратегии, а значения выше означают, что хотя бы одна стратегия отсутствует.

Нужно ли шумоподавление, если я использую Whisper или Nova-3?

Да, в большинстве шумных сред. Фронтирные модели устойчивы к умеренному шуму, но в по-настоящему громких условиях всё равно дают относительное улучшение WER на 20-40 процентов при добавлении качественного фронтенда. Фронтенд: самое выгодное по соотношению цена и результат дополнение к существующему ASR-пайплайну в 2026 году.

Что выбрать: Deepgram, Whisper или Riva?

Deepgram Nova-3 для стриминговых SaaS-решений в реальном времени, где важны низкая задержка и простота интеграции. Whisper Large v3 Turbo для офлайн-задач, батч-обработки или случаев, когда важна приватность, а также если нужен открытый бэкенд для дообучения. NVIDIA Riva для on-prem развёртываний, регулируемых сред и систем, где критична точность распознавания, при наличии NVIDIA-оборудования в инфраструктуре.

Сколько размеченных данных нужно для дообучения?

Для LoRA-адаптера обычно достаточно 20-100 часов размеченного аудио из нужной предметной области, что даёт улучшение на 3-8 пунктов WER. Полное дообучение требует 200-1000 часов данных. Если данных меньше 10 часов, keyterm-биасинг и работа с промптом обычно эффективнее, чем обучение.

Можно ли запустить распознавание речи полностью на устройстве?

Да, и в 2026 году это становится всё более привлекательным. Компактные локальные модели показывают WER 12-18% на смартфонах среднего уровня и надёжно справляются с короткими командами. Локальная обработка выигрывает по приватности и возможности работать без интернета, а облачные решения пока остаются точнее, поддерживают больше языков и умеют разделять речь разных людей.

Какую модель брать для русского языка?

Не Whisper. На русских датасетах средний WER у GigaAM-v3-RNNT 6,7% против 20,8% у Whisper large-v3, а на записях колл-центра 9,5% против 23,1%. Для телефонии и стриминга берите T-one под Apache 2.0, для остального GigaAM-v3 под MIT. Если своё железо не нужно, есть Яндекс SpeechKit и SaluteSpeech.

Как работать с акцентами и неносителями языка?

Выбирайте модели, обученные на нескольких языках, если они охватывают нужные акценты, и при необходимости дообучайте модель под конкретный акцент. Избегайте моделей, ориентированных только на один язык и акцент, если ваша аудитория международная.

Сколько времени уходит на запуск шумоустойчивой ASR-фичи?

Для команды с опытом: 4-8 недель на полную интеграцию облачного API с шумоподавлением, ключевыми терминами и тестовым стендом. 3-6 месяцев на локальный пайплайн с дообучением под задачи клиента.

Матрица сравнения: собрать самому, купить, гибрид или open-source

Подход Кому подходит Усилия на запуск Риски
Готовый SaaS Команды до 10 инженеров, общий сценарий Низкие, 1-2 недели Привязка к вендору, ограничения по настройке
Гибрид SaaS и кастомного слоя Mid-market, смешанные сценарии Средние, 1-2 месяца Интеграционный долг, две системы на поддержке
Сборка in-house Энтерпрайз, уникальные данные или требования по соблюдению норм Высокие, 3-6 месяцев Скорость разработки, удержание специалистов
Open-source self-hosted Команды, чувствительные к цене, с технической экспертизой Высокие, 2-4 месяца Операционная нагрузка, патчинг безопасности

Выбирайте строку исходя из размера команды, регуляторной нагрузки и целевого времени получения ценности, а не ту, что звучит амбициознее.

KPI, которые стоит отслеживать до и после запуска

Решения по ASR в шумных средах оцениваются по реальным результатам, а не по показушным счётчикам. Следите за ростом использования неделя к неделе, задержкой p95, изменением точности и качества по неделям, удержанием пользователей на 1, 7 и 30 день и влиянием на выручку через честный A/B-тест с контрольной группой. Большинство команд забывают про контрольную группу и потом не могут понять, был ли прирост реальным.

Готовы запустить ASR, который работает в реальных условиях? Свяжитесь с Фора Софт: за 3 рабочих дня подготовим план MVP, аудит архитектуры и оценку стоимости бесплатно.

  • Технологии