Распознавание речи на основе ИИ в мобильных приложениях: руководство на 2026 год

28/8/2025
·
Обновлено
8.11.2026

Главные тезисы

  • Голос больше не диковинка. Уже более 27% мобильных поисковых запросов совершаются голосом, а рынок голосовой коммерции вырос с 3,2 трлн ₽ в 2023 году до прогнозируемых 13 трлн ₽ к 2030 году.
  • Мобильный голосовой стек 2026 года наконец стал дешёвым и быстрым: on-device Apple SpeechAnalyzer и Gemini Nano обеспечивают приватное офлайн-распознавание; Deepgram Nova-3 и OpenAI Realtime API дают облачный отклик меньше 300 мс.
  • Реальные узкие места — приёмка в магазинах приложений и вопросы приватности. Разрешения на микрофон, App Privacy labels, декларации Data Safety и NSSpeechRecognitionUsageDescription чаще отклоняют голосовые приложения, чем ошибки в работе.
  • Выигрывает гибридная архитектура. On-device — для приватных задач и сценариев, чувствительных к задержкам; облако — для многоязычных и требующих высокой точности. Выбор делается под конкретную фичу, а не под всё приложение целиком.
  • Фора Софт запускает голосовой функционал в iOS- и Android-приложениях за 8–12 недель по отработанной схеме: гибридный ASR (локальная + облачная обработка), LLM с вызовом функций для распознавания команд, потоковый синтез речи, логирование с соблюдением приватности. Прохождение проверки в App Store и Google Play встроено в процесс разработки.

Подробнее по теме: читайте полный гайд — 3 ключевые стратегии распознавания речи в шумной обстановке (2026).

Если вы отвечаете за продукт или инженерию в компании с фокусом на мобильные устройства — здравоохранение, финтех, ритейл, фитнес, доступность, автопромышленность — вы уже знаете: голос перестаёт быть приятным дополнением и становится ожидаемой функцией. Конкуренты внедряют голосовой поиск, голосовую коммерцию, голосовой ввод и голосовой онбординг. Ожидания пользователей тихо изменились: если я могу это сказать, приложение должно понять.

Этот гайд — рабочая схема, которую мы в Фора Софт используем, когда заказчик хочет добавить голос в уже существующее iOS- или Android-приложение или создаёт voice-первый продукт с нуля. Здесь — стек технологий, SDK, правила приватности, требования к задержке и план интеграции на 8–12 недель: с цифрами и источниками, без общих фраз. Если хотите сразу обсудить объём работ — позвоните или напишите нам по контактам в конце статьи.

Почему этот гайд написала Фора Софт

Фора Софт уже более 20 лет создаёт функции реального времени со звуком, видео и ИИ в мобильных приложениях. Вот три причины, почему мы решили написать именно этот материал.

Во-первых, голос — близкий родственник всех модальностей, с которыми мы уже работаем. Наш опыт внедрения ИИ для распознавания речи в домофоны позволил вывести в продакшен ASR, голосовую биометрию и LLM-интенты на тысячах дверей. Архитектура одновременного перевода обрабатывает живой многоязычный звук в масштабах. Работа над AI-платформой стриминга завершает медиа-стек реального времени, на котором строится любое voice-first мобильное приложение.

Во-вторых, на мобильном голосе мелкие инженерные решения быстро накапливаются. Разница между голосовой функцией, которая работает мгновенно, и той, что кажется сломанной, часто составляет 200 миллисекунд, одну пропущенную permission-строку или неудачный retry-цикл. Мы прошли через это достаточно раз, чтобы составить проверенный чек-лист.

В-третьих, модераторы App Store и Google Play стали строже относиться к использованию голоса и разрешениям на микрофон. С 2023 по 2026 год доля отклонённых приложений, которые экономили на объяснении, зачем нужен доступ к приватным данным, заметно выросла. Голосовая функция, которая не проходит проверку, стоит ровно ноль.

Наша позиция, сразу честно: мы не верим в «голос везде». Голос — подходящая модальность для ситуаций, когда руки заняты, глаза заняты или важна доступность. Но это не лучший выбор для плотного ввода данных или приватных взаимодействий в общественных местах. Лучшие голосовые функции 2026 года — точечные, а не фоновые.

Что в 2026 году на самом деле означает «распознавание речи на базе ИИ в мобильных приложениях»

Под этой фразой скрываются пять разных возможностей. Большинство продуктовых команд объединяют их в одну, а большинство RFP недостаточно подробно описывают ту, которая действительно нужна.

1. Голосовой ввод (диктовка)

Пользователь говорит — приложение расшифровывает. Быстрый ввод длинных текстов, особенно на телефоне. Архетипы — Gboard, Otter, Rev, медицинские приложения для стенографии (Nuance DAX, Abridge, Suki). Точность и отзывчивость в реальном времени важнее всего.

2. Голосовые команды

Пользователь произносит короткую фразу, соответствующую действию в приложении: «пауза», «следующий трек», «найти страховой полис», «добавить в корзину». Сюда относятся Peloton, Spotify, голосовой заказ в Walmart и интеграции с CarPlay. Грамматика упрощена — главная задача — точность и скорость распознавания.

3. Голосовой поиск

Пользователь произносит свободный запрос, приложение превращает его в поисковый запрос. Голосовой поиск есть у Amazon, eBay, Zillow и сервисов доставки еды. Нужны ASR, распознавание намерений и отображение результатов — а также грамотная замена, если транскрипция ошиблась.

4. Voice-First диалоговые агенты

Полноценный устный диалог. Erica у Bank of America, голосовой режим ChatGPT, боты для медицинского сбора данных, фитнес-коучи. Это цикл ASR → LLM → TTS (или speech-to-speech) с памятью и многошаговыми рассуждениями. Самая высокая техническая планка, самый большой продуктовый эффект.

5. Голосовая биометрия

Верификация диктора как способ аутентификации. Банки и колл-центры применяют её уже более десяти лет; теперь технология появляется в мобильном онбординге, страховании и медицине. Регулируется BIPA, статьёй 9 GDPR и CCPA/CPRA — это не функция, которую можно добавить без юридической проверки.

Любая голосовая функция в продакшене в 2026 году — одна из пяти. Выбирайте ту, которая действительно нужна, а потом уже определяйте стек под неё. Чрезмерный охват — самая частая причина задержек при запуске голосовых фич.

Рынок: почему мобильный голос растёт двузначными темпами

Голосовые фичи в мобильных приложениях стимулируют три пересекающихся рынка. Все три растут двузначными темпами.

Рынок Объём (2024–25) CAGR Источники
Распознавание речи и голоса637 млрд ₽ (2024) → 1,7 трлн ₽ (2030)19,1%MarketsandMarkets
Голосовая коммерция3,2 трлн ₽ (2023) → 13 трлн ₽ (2030)~24,6%Grand View Research
Голосовая биометрия195–217 млрд ₽ (2025)16–22%Mordor, Fortune Business Insights
Сегмент ASR / разговорного ИИ187 млрд ₽ (2024)24,8%Grand View Research

Поведение пользователей говорит само за себя. Около 27% мобильных поисковых запросов — голосовые; 56% таких запросов поступают со смартфонов; почти 77% людей в возрасте 18–34 лет используют голосовой поиск хотя бы раз в неделю. А доля голосовых заказов в розничной торговле США к 2025 году достигнет примерно 49% потребителей — не «доступно», а используется.

Голос не вытесняет тач. Он заменяет его там, где тач неудобен: за рулём, на кухне, во время тренировки, когда на руках ребёнок или есть проблемы с мелкой моторикой. Любое мобильное приложение, пользователи которого хотя бы 10% времени оказываются в таких ситуациях, должно поддерживать голосовое управление.

Мобильный голосовой пайплайн: семь этапов на телефоне

Мобильный голос — это не «настольный голос с маленьким экраном». Телефон — совсем другая инженерная задача: маленькая батарея, жёсткие ограничения на работу в фоне, микрофон у самых губ, ненадёжная сеть. Любая серьёзная мобильная голосовая функция проходит через эти семь этапов.

Этап 1 — Активация

Как запускается голос? Три варианта: пользователь нажимает кнопку микрофона (самый простой и надёжный способ — минимальный риск отклонений в магазине), удерживает кнопку push-to-talk (удобнее для командной работы) или использует команду пробуждения — «Hey Acme». На iOS для wake-word требуется ограниченный режим фонового аудио от Apple, на Android — фоновый сервис и постоянное уведомление. Picovoice Porcupine — самый популярный сторонний движок для распознавания wake-word, Sensory TrulyHandsfree — его корпоративная альтернатива.

Этап 2 — Захват звука

iOS: AVAudioEngine или AVFoundation, захват на 16 кГц, моно, 16-битный PCM. Android: AudioRecord или MediaRecorder с теми же параметрами. VAD (обнаружение речи) удаляет тишину перед отправкой — стандарт в сообществе: Silero VAD или WebRTC VAD. Хороший VAD сокращает объём данных и стоимость распознавания речи на 40–60% в типичных мобильных голосовых сессиях.

Этап 3 — ASR

Три пути: on-device (фреймворк Apple Speech / SpeechAnalyzer, Android SpeechRecognizer с поддержкой Gemini Nano, whisper.cpp, Picovoice Leopard, Vosk), потоковое облако (Deepgram Nova-3, Google Chirp 3, Azure Speech, AssemblyAI Universal-2, OpenAI Realtime API) или гибрид (сначала on-device, облачная сверка при низкой уверенности). Выбор зависит от допустимой задержки, необходимости работы без интернета, поддерживаемых языков и требований к приватности.

Этап 4 — NLU / интент

Транскрипт превращается в интент. Для небольшого набора команд достаточно регулярных выражений или простого классификатора. В случае открытого диалога подойдёт компактная LLM с поддержкой function calling: Claude Sonnet 4.6 или GPT-4o в облаке, Apple Intelligence или Gemini Nano на устройстве. Держите LLM в рамках функциональных вызовов — свободный текстовый ответ в три раза медленнее и в десять раз дороже, чем структурированный.

Этап 5 — Выполнение действия

Интент превращается в функциональный вызов внутри приложения: добавить в корзину, начать тренировку, позвонить жильцу, открыть документ. iOS App Intents (iOS 16 +) и Android App Actions позволяют системному ассистенту запускать ваши действия, не открывая приложение. Это слой «Siri Shortcuts для голоса» — внедрив его, вы появляются в подсказках Siri и сценариях Google Assistant.

Этап 6 — TTS-ответ

Если приложение отвечает голосом, TTS работает либо на устройстве (AVSpeechSynthesizer на iOS, Android TextToSpeech), либо в облаке (ElevenLabs, OpenAI TTS, Google Chirp 3 HD). ElevenLabs Flash v2.5 с TTFB около 75 мс — самый быстрый облачный вариант; TTS на устройстве бесплатен, но звучит менее естественно. Для всего, что похоже на диалог, потоковая отдача обязательна.

Этап 7 — Приватность, согласие и ведение журнала

Permission-строки в Info.plist (iOS) и AndroidManifest.xml. App Privacy labels в App Store Connect. Раздел Data Safety в Google Play Console. Сценарии согласия внутри приложения для биометрии. Журналирование, готовое к аудиту, с политиками удержания. Пропустите что-нибудь из этого — и приложение либо отклонят, либо засудят.

On-device или облако: самый главный выбор

Девяносто процентов архитектурных споров на проекте «голос в мобильном» сводятся к выбору между on-device и облаком. Вот наша матрица компромиссов.

Параметр On-device (Apple Speech, Gemini Nano, whisper.cpp) Облако (Deepgram, Chirp, OpenAI Realtime)
Задержка100–400 см, без вариаций сети200–600 мс плюс задержка сети
Точность (WER)6–12% на чистой речи; хуже — на шумной и с акцентом3–7% (Nova-3, Chirp 3)
Языки~30 на iOS, ~70 на Android с Gemini Nano100 + (Chirp 3), 30 + (Nova-3)
Офлайн-режимДа — самолёт, удалённые районы, тоннелиНет — требуется соединение
ПриватностьЗвук не покидает устройствоЗвук проходит через серверы вендора
Влияние на батареюВыше во время распознавания помогает нейронный движокНагрузка на CPU ниже, но радиомодуль продолжает работать
Размер приложения+50–1200 МБ под встроенные моделиПочти ноль
Стоимость минутыНулевая на единицу0,2–0,7 ₽ за минуту потокового ASR

Правильный ответ почти всегда — гибрид. Обработка на устройстве подходит для коротких команд, пробуждения по фразе и сценариев, где важна конфиденциальность (например, медицинская диктовка или финансовые запросы). Облако — для многоязычной распознавательной работы, длинных текстов и диалоговых агентов с открытым доступом. Пусть выбор делается для каждой сессии отдельно, а не для всего приложения сразу.

Практическое правило: по умолчанию используй on-device, если транскрипт не должен покидать телефон, язык поддерживается операционной системой и входит в топ-10, а ожидаемая речь короче 10 секунд. Во всех остальных случаях — отправляй в облако. Показывай пользователю выбор (значок замка = приватно / on-device) — доверие тоже важная функция.

Голосовой стек Apple: SpeechAnalyzer, App Intents, Apple Intelligence

В 2025 году на WWDC Apple обновила свои голосовые API. Старый SFSpeechRecognizer по-прежнему работает, но для нового кода рекомендуется использовать SpeechAnalyzer — он интегрирован с on-device стеком Apple Intelligence и предоставляет более подробные метаданные: уровень уверенности, тайминги слов и определение языка.

Практические заметки по iOS-голосу в 2026 году:

  • On-device — выбор по умолчанию. Apple Intelligence работает на чипах A17 Pro и серии M и старше. На более старых устройствах обработка речи переходит в облако — для этого требуется разрешение пользователя.
  • App Intents заменяют донаты Siri Shortcuts. Объявляйте действия, доступные по голосу, через App Intents, предлагайте параметризованные интенты («начни тренировку на 30 минут») — и Siri будет показывать ваше приложение автоматически. Это самый дешёвый канал дистрибуции в мобильном голосовом интерфейсе.
  • Для фонового аудио нужен специальный режим. Чтобы приложение могло воспроизводить звук в фоне, требуется включить UIBackgroundModes: audio и чётко объяснить пользователю, зачем это нужно. Ревьюеры Apple отклоняют сценарии вроде «всегда слушать», если они выглядят спекулятивными.
  • Permission-строка имеет значение. Нужны и NSSpeechRecognitionUsageDescription, и NSMicrophoneUsageDescription. Пишите их конкретными глаголами, а не общими фразами. «Чтобы расшифровывать ваши голосовые заметки в журнале сессии» — пройдёт ревью; «Чтобы обеспечить голосовые функции» — нет.

Голосовой стек Android: ML Kit GenAI, Gemini Nano, App Actions

Сюжет Android в 2026 году раздвоен. Базовое API SpeechRecognizer обеспечивает простое распознавание речи на любом современном устройстве. ML Kit GenAI с on-device Gemini Nano на Pixel 9, Galaxy S24 и новее поддерживает распознавание намерений и генерацию ответов для сложных сценариев — всё работает приватно, без интернета и бесплатно с момента запуска.

Практические заметки по Android-голосу в 2026 году:

  • App Actions — аналог App Intents. Объявляйте возможности в shortcuts.xml, чтобы Google Assistant и Gemini могли запускать ваше приложение голосом. Здесь большинство приложений теряет канал дистрибуции.
  • Foreground service для постоянного прослушивания. В Android 14 и выше ужесточили правила для foreground-сервисов: теперь требуется указать тип «microphone» и показывать пользователю постоянное уведомление.
  • Доступ к Gemini Nano привязан к железу. Проектируйте так, чтобы функции плавно заменялись облачным ASR на старых телефонах — иначе 40% вашей аудитории получит худший опыт.
  • Декларации Data Safety строгие. ML-проверка Google Play действительно анализирует импорт SDK и выявляет необъявленные аудиопотоки. Декларируйте каждый ASR SDK, даже если данные «эфемерные».

Кроссплатформа: React Native, Flutter, Capacitor

Если вы не пишете нативно под каждую ОС, выбирайте SDK, совместимое с вашим фреймворком. Здесь проекты тихо сжигают недели.

Фреймворк Варианты ASR Варианты TTS Подводные камни
React Native@react-native-voice/voice, expo-speech-recognition, Deepgram SDK, AssemblyAI SDKreact-native-tts, expo-speechПереход на New Architecture (Fabric / TurboModules) сломал часть старых голосовых модулей; проверяйте совместимость перед началом работ.
Flutterspeech_to_text, deepgram_speech_to_text, Google Cloud Speech SDKflutter_tts, google_ttsПрокидывание iOS-строк приватности через Info.plist выполняется вручную — плагин это не сделает автоматически.
Capacitor / Ionic@capacitor-community/speech-recognition, @capgo/capacitor-speech-recognition@capacitor-community/text-to-speechФоновое прослушивание работает по-разному в разных плагинах Capacitor — проверяйте на реальных устройствах, а не на симуляторах.
Нативно (Swift / Kotlin)Apple Speech / SpeechAnalyzer; Android SpeechRecognizer; любой облачный SDKAVSpeechSynthesizer; Android TextToSpeechМаксимум контроля, максимум усилий. Выбор по умолчанию, когда важны задержка или приватность.

Если приложение полностью нативное, оставайтесь нативными и в голосовом слое — мосты RN или Flutter добавляют 50–150 мс накладных расходов на каждое взаимодействие. Если вы уже используете кроссплатформенную разработку, применяйте плагины для последних версий и предусматривайте нативные фолбэки на критических участках.

Планируете голосовую функцию для мобильного приложения?

Проведём аудит кодовой базы (нативной или на RN/Flutter), порекомендуем стек и оценим сроки интеграции — от 8 до 12 недель. Без обязательств.

Позвоните нам → Напишите нам →

Бюджет задержки: правило одной секунды

Мобильные пользователи не прощают задержек в голосовом управлении. Эмпирически: до 500 мс — отклик кажется мгновенным; 500–1000 мс — отзывчивым; 1–2 секунды — медленным; больше 2 секунд — пользователь уже нажимает пальцем. Вот наш целевой бюджет для голосовой команды, выполняющей действие внутри приложения.

Этап Бюджет Комментарий
VAD и конец речи~50 смSilero VAD или WebRTC VAD на устройстве.
ASR (первый транскрипт)100–400 мсDeepgram Nova-3 — меньше 300 мс в облаке; Apple Speech — около 200 мс на устройстве.
Интент / LLM100–500 мсМаленький классификатор — менее 50 мс; вызов функции у GPT-4o / Sonnet 4.6 — 300–500 мс.
Выполнение действия50–150 смВызов API, обновление локальной БД, состояние UI.
Первый аудио TTS75–250 смElevenLabs Flash — около 75 мс; Apple AVSpeechSynthesizer — около 200 мс.
Итого~375–1350 смЦель — задержка end-to-end менее 1000 мс для команд и менее 1500 мс для диалога.

Самые простые способы улучшить производительность: стримьте ASR (не дожидаясь конца фразы); используйте перед LLM простой классификатор для очевидных команд; стримьте первые байты TTS; для диалоговых функций выбирайте speech-to-speech (например, OpenAI Realtime или нативное аудио Gemini); поддерживайте постоянный WebSocket-соединение с ASR-провайдером, а не открывайте его заново на каждую сессию.

Разрешения и приватность: UX, который помогает приложению пройти ревью

Голосовые функции в App Store и Google Play чаще отклоняют из-за вопросов приватности, чем из-за проблем с работой. У ревьюеров есть чёткая установка: если пользователь не сразу поймёт, что аудиозапись покидает его устройство, об этом нужно чётко и заранее предупредить.

UX разрешений на iOS

  • Объявите NSMicrophoneUsageDescription (доступ к микрофону) и NSSpeechRecognitionUsageDescription (фреймворк Speech, который на старых чипах может использовать серверы Apple).
  • Подготовьте пользователя к запросу. Покажите экран с объяснением внутри приложения до системного запроса — приложения с предварительным уведомлением получают на 20–30% больше согласий.
  • «Этикетка приватности» в App Store Connect должна чётко указывать все потоки голосовых данных — независимо от того, связаны они с приложением или используются для аналитики. Пропущенная декларация = отклонение.
  • Guideline 5.1.1 (сбор данных и приватность) — самая частая причина отклонения голосовых приложений. Опубликуйте политику конфиденциальности и разместите ссылку на неё в приложении.

UX разрешений на Android

  • Объявите android.permission.RECORD_AUDIO в AndroidManifest.xml и запрашивайте во время выполнения с помощью Activity Result API.
  • Для постоянного прослушивания объявите FOREGROUND_SERVICE_MICROPHONE (Android 14 +) и поддерживайте активное уведомление.
  • Раздел Data Safety должен перечислять каждый сторонний ASR SDK и указывать, какие данные он передаёт. Автоматическая проверка Google Play выявляет несоответствия.
  • Для голосовых приложений в медицине и финансах категория приложения требует соблюдения дополнительных правил — ознакомьтесь с Developer Program Policies для вашей категории.

Сценарии согласия

Если приложение сохраняет голосовые записи для дальнейшего использования — например, для медицинской диктовки, обратных звонков в поддержку или обучения моделей — требуется не просто согласие, а осознанное и явное разрешение. Чекбокс, спрятанный в пользовательском соглашении, здесь не подходит. Если вы используете голосовую биометрию для аутентификации, вы попадаете под действие BIPA и статьи 9 GDPR. В этом случае нужно отдельное согласие с чёткой политикой хранения данных. Мы делаем это полноценной частью интерфейса — переделывать потом будет сложно и дорого.

Комплаенс: HIPAA, PCI, GDPR, BIPA, COPPA, EU AI Act

Краткий обзор. Любой проект «голос в мобильном» использует часть этих компонентов. Закладывайте требования в архитектуру с самого начала.

  • HIPAA — медицинская диктовка, телемедицина, приложения для ухода за пожилыми. Голосовые записи часто содержат персональные медицинские данные (PHI). С каждым поставщиком голосового SDK нужно заключать соглашение о сотрудничестве (Business Associate Agreement), обеспечить шифрование данных как при хранении, так и при передаче, вести аудит-логи и хранить информацию шесть лет. Nuance DAX, Abridge и Suki соответствуют требованиям HIPAA; большинство потребительских ASR SDK — нет, пока с ними не подписан BAA.
  • PCI DSS — голосовые платежи. Если пользователь называет номер карты, сам звук и его текстовая расшифровка попадают в зону PCI DSS. Большинство команд направляют голосовые платежи через отдельный изолированный сервис (например, Voice IVR-провайдеры вроде CDW, Cisco или Plivo), а не пытаются включить всё мобильное приложение в зону PCI DSS.
  • GDPR — любой пользователь из ЕС. Голос по умолчанию считается персональными данными; голосовой отпечаток относится к особой категории по статье 9. Требуется законное основание, явное согласие на обработку биометрических данных, проведение DPIA, хранение данных в ЕС и обеспечение права на удаление. Руководство EDPB на 2024–2025 годы ужесточает контроль за соблюдением требований.
  • BIPA (Иллинойс) — любое использование голосовой биометрии у жителей штата. Требуется письменное согласие, публичная политика хранения данных и установленный срок их уничтожения. Активная площадка для коллективных исков.
  • CCPA / CPRA (Калифорния) — голосовые записи и отпечатки пальцев относятся к чувствительным персональным данным. Требуется согласие на их обработку, а также предоставляется право на удаление.
  • COPPA — пользователи младше 13 лет. Требуется согласие родителей до сбора голоса. Образовательные приложения часто ошибаются на этом этапе.
  • Статья 50 EU AI Act — любой ИИ-голосовой агент, общающийся с пользователями в ЕС, должен сообщить, что он — искусственный интеллект. Достаточно короткой вступительной фразы («Здравствуйте, я ИИ-ассистент Acme»).
  • Tennessee ELVIS Act — запрещено клонировать реальные голоса с помощью TTS без согласия. Используйте синтетические голоса от вендора, если у вас нет подписанного разрешения.

Комплаенс-шорткат, который реально работает: относитесь к любому голосовому транскрипту как к персональным данным с момента записи, а к любому голосовому отпечатку — как к чувствительным персональным данным (статья 9). Вы перестрахуетесь в 20% случаев, но никогда не получите неожиданного предписания. Цена такой дисциплины на этапе проектирования — примерно один спринт; цена добавления уже после коллективного иска по BIPA — порядка 3,7–18 млн ₽ плюс мировое соглашение.

Голос в регулируемом приложении?

HIPAA, PCI, BIPA, COPPA, EU AI Act — мы реализовывали голосовые функции в соответствии со всеми этими стандартами. Свяжитесь с нами, и до выбора технологий мы проанализируем ваш конкретный периметр соответствия требованиям.

Позвоните нам → Напишите нам →

Offline-first голос: когда телефон должен работать без интернета

Не каждое приложение может рассчитывать на стабильную связь. Авиакомпании запрещают использование радио ниже 3000 метров. Приложения для выездных бригад работают в подвалах и на открытых полях. Медицинские приложения иногда юридически не имеют права передавать звук за пределы устройства. В таких условиях офлайн-голос — не предмет обсуждения.

Практические варианты в 2026 году:

  • Apple Speech / SpeechAnalyzer on-device — iOS 18 +, A17 Pro и выше для полного набора функций. Приемлемый WER на чистой речи для топ-30 языков. Бесплатно, мгновенно, без загрузки модели в приложение.
  • Android SpeechRecognizer + Gemini Nano — Pixel 9 / Galaxy S24 и новее. Та же категория, что и on-device стек Apple; плавно переключается на облачную обработку на старых устройствах.
  • whisper.cpp — Whisper, портированный на C++ с ускорением через Metal / NNAPI. Запускается на любом современном телефоне, но минимальная пригодная модель (small.en) весит около 150 МБ. Большие модели (medium, large-v3-turbo) дают почти такой же уровень ошибок распознавания, как в облаке, но увеличивают размер приложения на 500 МБ–1,5 ГБ. Храните их как загружаемые ресурсы, а не включайте в основной бандл.
  • Picovoice Leopard / Cheetah — коммерческая лицензия, около 30 МБ, работает в реальном времени на мобильных устройствах, точность распознавания около 90% на чистом английском. Платный, но с предсказуемыми условиями.
  • Vosk — open source, на базе Kaldi, модель объёмом около 50 МБ на язык, точность около 85%. Подходит для проектов с ограниченным бюджетом.

Грубая прикидка: модель Whisper small.en на iPhone 15 расшифровывает минуту чистой речи примерно за 10 секунд — то есть в 6 раз быстрее реального времени — с точностью около 95% на чистом аудио. Влияние на батарею заметное, но не критичное: 10-минутная сессия диктовки расходует 3–5% заряда современного телефона. Поставляйте модель как загружаемый ассет, агрессивно кэшируйте и позволяйте пользователю подключать её самостоятельно.

Сценарии, которые работают в 2026 году

Кто выпускает голосовые функции, которыми реально пользуются пользователи? Обзор текущего состояния дел.

Ритейл и голосовая коммерция

Amazon, Walmart, eBay и Starbucks внедрили голосовой повторный заказ и голосовой поиск в своих мобильных приложениях. Голосовой заказ Walmart стал массовым ещё несколько лет назад; у Starbucks он заметно сократил очереди в drive-through. По данным Grand View Research, рынок голосовой коммерции к 2030 году достигнет 13 трлн ₽ при среднегодовом темпе роста 24,6%. Устоявшийся паттерн: голос — для повторных заказов знакомых товаров, тач — для изучения нового.

Здравоохранение и медицинская диктовка

Nuance DAX Copilot (Microsoft), Abridge, Suki, DeepScribe. Abridge привлек 206 млрд ₽ в раунде Series D в феврале 2025 года — это сигнал инвесторов о том, что клиническое документирование на основе ИИ перешло из стадии пилотных проектов в корпоративную инфраструктуру. Набор функций у таких решений узкий: фиксация визита, генерация SOAP-нотации, создание структурированных кодов для биллинга. При этом требования к соответствию стандартам очень высокие — HIPAA, SOC 2, локализация данных.

Финтех и голосовой банкинг

Erica от Bank of America — главный пример: она уже обслуживает более 40 млн пользователей, позволяя проверять баланс, переводить деньги и оплачивать счета голосом. В своих приложениях аналогичные голосовые помощники есть у Capital One, Chase и Wells Fargo. Общий принцип: голос используется для запросов, а подтверждение операций — через касание экрана. Из-за требований PCI DSS и риска дипфейков голосовая авторизация платежей считается неоправданной.

Автомобильная отрасль и hands-free

Cerence AI (выделенное автомобильное подразделение Nuance), Android Auto с Gemini, CarPlay с Siri. Автомобили модельного года 2026 всё чаще оснащаются встроенной голосовой системой, и мобильная версия приложения должна корректно интегрироваться через медиа- и мессенджер-интенты CarPlay и Android Auto. Если ваше приложение работает в машине, голосовой интерфейс становится практически обязательным.

Доступность и инклюзия

Голос — самый понятный способ сделать мобильное приложение доступным. В США в 2025 году подано более 5000 исков по ADA — это рост примерно на 20% по сравнению с прошлым годом. Приложения, ориентированные на пользователей с нарушениями моторики или зрения, особенно выигрывают от режима «голос прежде всего» — и это одна из немногих функций, где аргументы инклюзивного дизайна и коммерческие выгоды полностью совпадают.

Фитнес и велнес

Peloton добавил голосовые команды в своё iOS-приложение в 2024 году. Strava, Nike Run Club и Apple Fitness+ поддерживают голосовое управление и озвучку. Сценарий подходит к среде: середина тренировки, руки мокрые, телефон закреплён на предплечье — голос остаётся единственным удобным способом взаимодействия.

Диктовка и продуктивность

Голосовой ввод Gboard поддерживает более 900 языков. Otter и Rev предлагают приложения с транскрипцией в реальном времени. Willow — новый участник рынка — утверждает, что позволяет печатать в четыре раза быстрее благодаря гибридному подходу «голос + тактильная клавиатура». Голосовая продуктивность — уже зрелая категория: теперь ключевым фактором отличия не точность распознавания речи, а постобработка — пунктуация, форматирование, разделение спикеров, перевод.

Мини-кейс: гибридный голос в React Native приложении для продуктивности

Контекст: североамериканский SaaS-продукт для продуктивности с ~450 тыс. активных мобильных пользователей попросил добавить голосовой захват заметок встреч в существующее React Native приложение. Требования: офлайн-работа в самолёте, поддержка нескольких языков для европейской команды, задержка меньше секунды и сохранение категории в App Store, чтобы избежать повторного ревью.

Что мы выкатили:

  • Гибридный ASR — Apple SpeechAnalyzer и Android SpeechRecognizer on-device по умолчанию; облачный фолбэк на Deepgram Nova-3, если пользователь включает многоязычный режим.
  • whisper.cpp small.en в виде загружаемого ассета для офлайна; запускается только при включённом режиме «офлайн-захвата».
  • Claude Sonnet 4.6 с схемой вызова функций для постобработки (форматирование, создание краткого содержания, выделение задач, привязка к нужной заметке).
  • Потоковый UI — частичные обновления транскрипта каждые 150 мс, видимая волновая форма, чёткие переходы между состояниями «Слушаю» и «Обрабатываю».
  • Редизайн UX разрешений — предварительный запрос на доступ к микрофону и использованию распознавания речи с пояснением в одном абзаце и кнопкой «Не сейчас». Доля согласий выросла с 58% до 83%.
  • App Intents и App Actions — команды вроде «Привет, Siri, запиши заметку в [AppName]» или «Окей, Google, сделай заметку о встрече» работают с экрана блокировки.

Замеренные результаты, 90 дней после запуска:

  • На голосе создавалось ~38% всех новых заметок на iOS и ~31% на Android (с нуля).
  • Медианная end-to-end задержка от «закончил говорить» до отформатированной заметки: ~850 мс на устройстве, ~1,3 с в облаке.
  • Ревью App Store пройдено с первого раза. По приватности отклонений не было.
  • Срок проекта от старта до выхода v1 в продакшене: 10 недель, включая 2 недели стресс-тестирования.

Детали анонимизированы по просьбе заказчика. Эта архитектура стала шаблоном для всех мобильных голосовых проектов, которые мы оценивали с тех пор.

5 ловушек, которые убивают мобильные голосовые проекты

1. Запуск голоса без потокового интерфейса

Если пользователь что-то сказал, а приложение замолчало на две секунды, он подумает, что всё сломалось. Всегда показывайте волну, частичный текст или хотя бы индикатор загрузки. Ощущаемая задержка — это и есть важная функция.

2. Свободный микрофон у LLM

Открытые текстовые ответы LLM на мобильном голосе работают медленно, стоят дорого и иногда выдают неправдоподобные данные. Используйте у LLM вызов функций с enum-интентами. Если нужен длинный ответ — подготовьте шаблон, а LLM пусть подставляет значения в нужные места.

3. Игнорирование CarPlay и Android Auto

Пользователи, которые в обычной жизни используют голос в вашем приложении 10% времени, в машине — 90%. Если приложение не поддерживает голосовые команды в CarPlay и Android Auto, вы теряете половину возможностей голосового интерфейса.

4. Недокументированные потоки данных

Самой частой причиной отклонения голосовых приложений в App Store и Google Play в 2025 году стало неполное раскрытие информации о приватности — сторонний ASR SDK отправляет аудио за пределы устройства, но об этом не указано в App Privacy или Data Safety. Автоматизируйте проверку. Перед подачей приложения изучайте документацию по обработке данных у каждого SDK.

5. Отсутствие плана на случай отказа

Голос отказывает. Сеть падает. Транскрипт ломается. Пользователь не знает, что сказать. Любой голосовой функционал должен предусматривать простой способ вернуться к интерфейсу с тач-управлением: кнопка «ввести вручную», подсказка «повторите», возможность «нажать, чтобы отменить». Приложения, не имеющие сценариев на случай сбоев, теряют пользователей при каждой неполадке.

Полностью on-device голос имеет смысл, когда: приложение работает с регулируемыми данными (HIPAA, PCI), целевой рынок предъявляет жёсткие требования к хранению данных (ЕС, Швейцария, Бразилия) или сценарий требует надёжности в самолёте, тоннеле и сельской местности. Облако — по умолчанию; on-device — правильный выбор для небольшой, но растущей группы пользователей.

KPI: как понять, что голосовая функция работает

Три блока. Снимайте всё с первого дня.

Качество

  • WER на реальном пользовательском аудио — цель менее 10% после применения phrase biasing.
  • Точность определения цели — более 95%; частота ложных срабатываний — менее 0,5%.
  • Медианная end-to-end задержка — <1000 мс для команд; <1500 мс для диалога.
  • Частота повторов — доля сессий, в которых пользователь переформулировал запрос. Цель — менее 15%.

Внедрение

  • Voice DAU — доля пользователей, которые ежедневно активно использовали голосовой интерфейс.
  • Доля согласий на разрешения — какой процент пользователей разрешил доступ к микрофону и использованию распознавания.
  • Доля фичи — какой процент целевых задач (захват заметки, поиск, заказ, повторный заказ) выполняется голосом, а не жестами.
  • Прирост удержания — когортный retention голосовых пользователей по сравнению с остальными.

Комплаенс и надёжность

  • Частота отклонений в App Store / Google Play — цель: ноль отклонений.
  • Захват согласий — доля голосовых сессий, в которых было получено согласие, когда оно необходимо.
  • Пройденные тесты failover — ежемесячный хаос-тест облачных ASR, LLM и TTS-фолбэков.
  • Время реакции на запрос об удалении данных — цель <30 дней (GDPR), <45 дней (CCPA).

Когда НЕ нужно добавлять голос в мобильное приложение

Честный список. Пять ситуаций, когда голос — не лучший ответ.

  • Плотный ввод данных с жёсткой валидацией — налоговые формы, многополевой поиск. Голосовой ввод повышает вероятность ошибки при вводе чисел. Тач лучше.
  • Чувствительные к приватности действия в публичных местах — например, диктовать номер карты в переполненной электричке. Пользователи откажутся, даже если технически всё работает.
  • Сценарии в один экран и одно нажатие — если задача решается одним касанием, голос замедляется.
  • Низкоиспользуемые функции — если у целевой фичи 200 пользователей в месяц, стоимость голосовой инженерии превышает выгоду. Выбирайте более масштабную задачу.
  • Юрисдикции без чёткого биометрического закона — если функция требует голосовой биометрии, а на целевом рынке нет устоявшегося правового режима, подождите, пока ситуация прояснится.

Фреймворк принятия решений — выбираем стек за пять вопросов

Любой мобильный голосовой RFP, который мы анализировали, сводится к этим пяти вопросам. Ответы на них определяют выбор стека.

  1. Какая из пяти голосовых возможностей вам действительно нужна? Диктовка, команды, поиск, разговорный агент или биометрия. Не заявляйте сразу две.
  2. Офлайн — жёсткое требование? Если да → Apple Speech / Gemini Nano / whisper.cpp. Если нет → Deepgram / Chirp / OpenAI Realtime в облаке.
  3. Сколько языков? До 10 → достаточно on-device. От 20 и больше → облако через Chirp 3 или Whisper API.
  4. Закрытая грамматика или открытый диалог? Команды / поиск → небольшой классификатор без LLM. Диалог → LLM с вызовом функций (Sonnet 4.6, GPT-4o или on-device Apple Intelligence / Gemini Nano).
  5. Какие режимы комплаенса применимы? HIPAA → вендоры с BAA + обработка на устройстве, если возможно. PCI → отдельный изолированный путь для голосовых платежей. GDPR → хранение данных в ЕС. BIPA → письменное согласие и чёткая политика хранения. Учитывайте это с самого начала.

Сценарий интеграции: путь на 8–12 недель

Что мы реально поставляем, когда заказчик берёт нас на мобильную голосовую фичу. Сроки — для существующих iOS- и Android-приложений с бэкендом; green-field проекты прибавляют 2–3 недели.

Недели Фаза Артефакты
1Исследование и архитектураСкоупинг сценариев, карта юрисдикций, выбор стека, вайрфреймы UX и разрешений, DPIA, где применимо
2–3ФундаментЗахват аудио, VAD, UX разрешений, декларации App Privacy и Data Safety, каркас фича-флагов
4–5ASR-слойOn-device интеграция (Apple Speech / Android SpeechRecognizer), потоковое облако-фолбэк (Deepgram / Chirp), UI волны
6–7Интенты и выполнениеLLM с вызовом функций, классификатор намерений, обработчики действий, сценарии отката
8TTS и системная интеграцияПотоковый TTS, App Intents / App Actions, хуки CarPlay / Android Auto, регистрация в Siri / Assistant
9Комплаенс и аудитСценарии согласия, аудит-лог, таймеры удержания, инструменты для права на удаление, тексты раскрытия ИИ
10Стресс-тест и настройкаБета-тест на реальном трафике, замер WER, настройка phrase biasing, KPI-дашборд, подготовка к публикации в магазинах
11–12Подача и запускПодача в App Store / Google Play, ответы ревьюерам, поэтапный запуск, дежурный runbook, ML-ops по контролю дрейфа

Наш парный с ИИ инженерный процесс сокращает сроки на этапах 4–7 примерно на 30% по сравнению с командой без ИИ. LLM лучше всего справляется с рутинной интеграцией — подключением SDK, настройкой permission-строк, тестовой обвязкой, но не заменяет архитектурные решения.

Готовы оценить объём работ?

Приходите со своим приложением, целевым сценарием и юрисдикциями. Мы подготовим оценочный план за 5 рабочих дней.

Позвоните нам → Напишите нам →

Куда движется мобильный голос в 2026–2027 годах

Четыре тренда, на которые стоит ориентироваться при планировании.

Speech- to-speech схлопывает пайплайн

gpt-realtime у OpenAI и нативное аудио у Gemini полностью пропускают каскад ASR → LLM → TTS. End-to-end задержка падает до 200–300 мс «голос-в-голос», просодия заметно улучшается. Расплата — меньше контроля над транскриптом и пайплайном интентов. Хорошо для диалоговых фич, хуже для критичных к безопасности или плотных по комплаенсу.

On-device LLM становятся реально удобными

Apple Intelligence, Gemini Nano, квантизированные Llama 3.3 и Mistral Small 3 через MLC или llama.cpp — всё это позволяет разместить в кармане настоящую модель с 3–8 миллиардами параметров. Для простых голосовых задач — команд, коротких запросов, кратких резюме — телефон больше не нуждается в облаке. Приватность выше, задержка меньше, а стоимость использования — ноль.

App Intents / App Actions становятся каналом распространения

Siri и Gemini выводят голосовые команды на системный уровень. Приложения, которые поддерживают расширенные App Intents и App Actions, появляются в интерфейсе ассистента; те, что не поддерживают, остаются за пределами нового способа взаимодействия. Лидеры уже активно работают в этом направлении.

Voice-first для AR и носимых

Vision Pro, Meta Orion, умные очки — у всех голос основной способ ввода. Мобильные приложения, которые в 2026 году выйдут с чистым голосовым интерфейсом, будут готовы к AR-интерфейсам 2027–2028 годов. Остальные будут спешить дорабатывать.

FAQ

Насколько точно on-device распознавание речи в 2026 году?

Apple SpeechAnalyzer и Android SpeechRecognizer (с Gemini Nano) обычно показывают WER 6–12% на чистой речи в популярных языках — этого хватает для большинства задач с голосовыми командами и диктовкой, а точность близка к облачным решениям. Whisper small.en на устройстве достигает около 95% точности на чистом английском; более крупные модели (medium, large-3-turbo) выдают результат на уровне облака, но занимают от 500 МБ до 1,5 ГБ памяти.

Сколько стоит голосовой ASR на пользователя в месяц?

Цены облачного потокового ASR — от 0,2 до 0,7 ₽ за минуту. Типичный пользователь потребительского приложения, говорящий по три минуты в день, обходится в 20–67 ₽ в месяц только на ASR. On-device ASR — бесплатный. Вызовы LLM для распознавания интентов добавляют ещё 3–22 ₽ в месяц при типичных объёмах. На одного голосового MAU полный стек стоит 37–150 ₽ в месяц.

Apple или Google могут заблокировать сторонние голосовые SDK?

Маловероятно — но обе платформы требуют указывать сторонние потоки данных в App Privacy / Data Safety. Пока информация точная, а поставщик SDK соблюдает правила защиты данных, согласование проходит без проблем. Проблема возникает не из-за использования сторонних решений, а из-за недостоверной декларации.

Использовать Realtime API от OpenAI или создать собственный пайплайн?

Берите Realtime API для диалоговых функций, где важна просодия «голос-в-голос», а транскрипт — вторичен. Собирайте свой пайплайн ASR + LLM + TTS, если транскрипт нужен для комплаенса, требуется специфический словарь для phrase biasing или нужна гибкость — чтобы выбирать вендоров по цене или иметь резерв. Большинство продакшен-приложений используют и то, и другое: Realtime — для диалогового агента, а кастомный пайплайн — для диктовки и поиска.

Как обрабатывать многоязычных пользователей?

Для 20+ языков облако по-прежнему остаётся правильным решением. Google Chirp 3 поддерживает 100+ языков с автоопределением; Deepgram Nova-3 — топ-30 с качеством, пригодным для продакшена; OpenAI Whisper — 99 языков с хорошей точностью, но с большей задержкой. Храните языковые предпочтения пользователя и используйте значения по умолчанию, основанные на локали устройства.

Стоит ли вкладываться в голос для B2B-приложения с менее чем 10 тыс. пользователей?

Иногда, если целевой процесс связан с занятостью рук (например, выездной сервис, клиника, склад), голос становится эффективным инструментом удержания даже при небольшом масштабе. Если же процесс сводится к чистому вводу данных за столом, тач-интерфейс работает лучше. Задайте себе вопрос: какой процент пользователей находится в условиях, где они не могут печатать? Если этот показатель превышает 20%, голосовое управление окупит затраты на разработку.

Что чаще всего становится причиной отклонения голосовых приложений в App Store?

Guideline 5.1.1 — сбор данных и приватность. Конкретно: отсутствие или неясность строк с запросами разрешений, отсутствие или неточность информации в разделе App Privacy, недостаточное раскрытие о передаче данных сторонним SDK. Ревьюеры обращают на это внимание в первую очередь. Подавайте приложение с точными декларациями и понятным объяснением в интерфейсе перед каждым запросом разрешения.

Сколько занимает мобильная голосовая интеграция?

8–12 недель на реализацию функции (например, голосового захвата или голосового поиска) в уже существующем приложении для iOS и Android. 14–18 недель на создание полноценного голосового агента с поддержкой диалогов и соблюдением требований комплаенса (HIPAA, PCI, размещение в ЕС). Разработка с нуля voice-первого приложения добавляет 2–3 недели на построение базовой архитектуры.

Смежная тема

Распознавание речи на базе ИИ для домофонов

Голосовой стек, когда цель — панель на двери, а не телефон в кармане: другие ограничения, та же основа.

Глубокое погружение

Одновременный перевод на базе ИИ

Архитектура живого многоязычного голоса напрямую применима к многоязычной мобильной диктовке и голосовым агентам.

Дополнение

Гид по AI-платформе стриминга

Как масштабируются архитектуры аудио- и видеостриминга в реальном времени — каркас любой серьёзной voice-first мобильной разработки.

По теме

Видеонаблюдение на базе ИИ

Где голос встречается с видео в физической безопасности — полезный контекст для голосовых приложений, которые работают с камерами.

Услуги

Услуги Фора Софт

Полное меню работ Фора Софт по аудио, видео и ИИ в реальном времени.

Итоги

Распознавание речи в мобильных приложениях уже не выделяет продукт — это базовая функция в тех категориях, где пользователи хотя бы 10% времени могут быть свободны от рук. Стек 2026 года готов: Apple SpeechAnalyzer и Gemini Nano — для приватного распознавания на устройстве; Deepgram Nova-3, Chirp 3 и OpenAI Realtime — для облачного стриминга уровня продакшена; ElevenLabs и on-device TTS — для озвучки ответов; App Intents и App Actions — для системной интеграции.

Успешные голосовые функции отличаются от заброшенных не выбором модели, а дисциплиной задержки, UX-разрешений, планированием соответствия требованиям и проектированием путей отказа. Заложите всё это с самого начала.

Если этот гайд совпадает с направлением вашего roadmap, свяжитесь с Фора Софт — и за неделю мы подготовим оценённый план.

  • Технологии