Распознавание речи на основе ИИ в мобильных приложениях: руководство на 2026 год
Главные тезисы
- Голос больше не диковинка. Уже более 27% мобильных поисковых запросов совершаются голосом, а рынок голосовой коммерции вырос с 3,2 трлн ₽ в 2023 году до прогнозируемых 13 трлн ₽ к 2030 году.
- Мобильный голосовой стек 2026 года наконец стал дешёвым и быстрым: on-device Apple SpeechAnalyzer и Gemini Nano обеспечивают приватное офлайн-распознавание; Deepgram Nova-3 и OpenAI Realtime API дают облачный отклик меньше 300 мс.
- Реальные узкие места — приёмка в магазинах приложений и вопросы приватности. Разрешения на микрофон, App Privacy labels, декларации Data Safety и NSSpeechRecognitionUsageDescription чаще отклоняют голосовые приложения, чем ошибки в работе.
- Выигрывает гибридная архитектура. On-device — для приватных задач и сценариев, чувствительных к задержкам; облако — для многоязычных и требующих высокой точности. Выбор делается под конкретную фичу, а не под всё приложение целиком.
- Фора Софт запускает голосовой функционал в iOS- и Android-приложениях за 8–12 недель по отработанной схеме: гибридный ASR (локальная + облачная обработка), LLM с вызовом функций для распознавания команд, потоковый синтез речи, логирование с соблюдением приватности. Прохождение проверки в App Store и Google Play встроено в процесс разработки.
Подробнее по теме: читайте полный гайд — 3 ключевые стратегии распознавания речи в шумной обстановке (2026).
Если вы отвечаете за продукт или инженерию в компании с фокусом на мобильные устройства — здравоохранение, финтех, ритейл, фитнес, доступность, автопромышленность — вы уже знаете: голос перестаёт быть приятным дополнением и становится ожидаемой функцией. Конкуренты внедряют голосовой поиск, голосовую коммерцию, голосовой ввод и голосовой онбординг. Ожидания пользователей тихо изменились: если я могу это сказать, приложение должно понять.
Этот гайд — рабочая схема, которую мы в Фора Софт используем, когда заказчик хочет добавить голос в уже существующее iOS- или Android-приложение или создаёт voice-первый продукт с нуля. Здесь — стек технологий, SDK, правила приватности, требования к задержке и план интеграции на 8–12 недель: с цифрами и источниками, без общих фраз. Если хотите сразу обсудить объём работ — позвоните или напишите нам по контактам в конце статьи.
Почему этот гайд написала Фора Софт
Фора Софт уже более 20 лет создаёт функции реального времени со звуком, видео и ИИ в мобильных приложениях. Вот три причины, почему мы решили написать именно этот материал.
Во-первых, голос — близкий родственник всех модальностей, с которыми мы уже работаем. Наш опыт внедрения ИИ для распознавания речи в домофоны позволил вывести в продакшен ASR, голосовую биометрию и LLM-интенты на тысячах дверей. Архитектура одновременного перевода обрабатывает живой многоязычный звук в масштабах. Работа над AI-платформой стриминга завершает медиа-стек реального времени, на котором строится любое voice-first мобильное приложение.
Во-вторых, на мобильном голосе мелкие инженерные решения быстро накапливаются. Разница между голосовой функцией, которая работает мгновенно, и той, что кажется сломанной, часто составляет 200 миллисекунд, одну пропущенную permission-строку или неудачный retry-цикл. Мы прошли через это достаточно раз, чтобы составить проверенный чек-лист.
В-третьих, модераторы App Store и Google Play стали строже относиться к использованию голоса и разрешениям на микрофон. С 2023 по 2026 год доля отклонённых приложений, которые экономили на объяснении, зачем нужен доступ к приватным данным, заметно выросла. Голосовая функция, которая не проходит проверку, стоит ровно ноль.
Наша позиция, сразу честно: мы не верим в «голос везде». Голос — подходящая модальность для ситуаций, когда руки заняты, глаза заняты или важна доступность. Но это не лучший выбор для плотного ввода данных или приватных взаимодействий в общественных местах. Лучшие голосовые функции 2026 года — точечные, а не фоновые.
Что в 2026 году на самом деле означает «распознавание речи на базе ИИ в мобильных приложениях»
Под этой фразой скрываются пять разных возможностей. Большинство продуктовых команд объединяют их в одну, а большинство RFP недостаточно подробно описывают ту, которая действительно нужна.
1. Голосовой ввод (диктовка)
Пользователь говорит — приложение расшифровывает. Быстрый ввод длинных текстов, особенно на телефоне. Архетипы — Gboard, Otter, Rev, медицинские приложения для стенографии (Nuance DAX, Abridge, Suki). Точность и отзывчивость в реальном времени важнее всего.
2. Голосовые команды
Пользователь произносит короткую фразу, соответствующую действию в приложении: «пауза», «следующий трек», «найти страховой полис», «добавить в корзину». Сюда относятся Peloton, Spotify, голосовой заказ в Walmart и интеграции с CarPlay. Грамматика упрощена — главная задача — точность и скорость распознавания.
3. Голосовой поиск
Пользователь произносит свободный запрос, приложение превращает его в поисковый запрос. Голосовой поиск есть у Amazon, eBay, Zillow и сервисов доставки еды. Нужны ASR, распознавание намерений и отображение результатов — а также грамотная замена, если транскрипция ошиблась.
4. Voice-First диалоговые агенты
Полноценный устный диалог. Erica у Bank of America, голосовой режим ChatGPT, боты для медицинского сбора данных, фитнес-коучи. Это цикл ASR → LLM → TTS (или speech-to-speech) с памятью и многошаговыми рассуждениями. Самая высокая техническая планка, самый большой продуктовый эффект.
5. Голосовая биометрия
Верификация диктора как способ аутентификации. Банки и колл-центры применяют её уже более десяти лет; теперь технология появляется в мобильном онбординге, страховании и медицине. Регулируется BIPA, статьёй 9 GDPR и CCPA/CPRA — это не функция, которую можно добавить без юридической проверки.
Любая голосовая функция в продакшене в 2026 году — одна из пяти. Выбирайте ту, которая действительно нужна, а потом уже определяйте стек под неё. Чрезмерный охват — самая частая причина задержек при запуске голосовых фич.
Рынок: почему мобильный голос растёт двузначными темпами
Голосовые фичи в мобильных приложениях стимулируют три пересекающихся рынка. Все три растут двузначными темпами.
| Рынок | Объём (2024–25) | CAGR | Источники |
|---|---|---|---|
| Распознавание речи и голоса | 637 млрд ₽ (2024) → 1,7 трлн ₽ (2030) | 19,1% | MarketsandMarkets |
| Голосовая коммерция | 3,2 трлн ₽ (2023) → 13 трлн ₽ (2030) | ~24,6% | Grand View Research |
| Голосовая биометрия | 195–217 млрд ₽ (2025) | 16–22% | Mordor, Fortune Business Insights |
| Сегмент ASR / разговорного ИИ | 187 млрд ₽ (2024) | 24,8% | Grand View Research |
Поведение пользователей говорит само за себя. Около 27% мобильных поисковых запросов — голосовые; 56% таких запросов поступают со смартфонов; почти 77% людей в возрасте 18–34 лет используют голосовой поиск хотя бы раз в неделю. А доля голосовых заказов в розничной торговле США к 2025 году достигнет примерно 49% потребителей — не «доступно», а используется.
Голос не вытесняет тач. Он заменяет его там, где тач неудобен: за рулём, на кухне, во время тренировки, когда на руках ребёнок или есть проблемы с мелкой моторикой. Любое мобильное приложение, пользователи которого хотя бы 10% времени оказываются в таких ситуациях, должно поддерживать голосовое управление.
Мобильный голосовой пайплайн: семь этапов на телефоне
Мобильный голос — это не «настольный голос с маленьким экраном». Телефон — совсем другая инженерная задача: маленькая батарея, жёсткие ограничения на работу в фоне, микрофон у самых губ, ненадёжная сеть. Любая серьёзная мобильная голосовая функция проходит через эти семь этапов.
Этап 1 — Активация
Как запускается голос? Три варианта: пользователь нажимает кнопку микрофона (самый простой и надёжный способ — минимальный риск отклонений в магазине), удерживает кнопку push-to-talk (удобнее для командной работы) или использует команду пробуждения — «Hey Acme». На iOS для wake-word требуется ограниченный режим фонового аудио от Apple, на Android — фоновый сервис и постоянное уведомление. Picovoice Porcupine — самый популярный сторонний движок для распознавания wake-word, Sensory TrulyHandsfree — его корпоративная альтернатива.
Этап 2 — Захват звука
iOS: AVAudioEngine или AVFoundation, захват на 16 кГц, моно, 16-битный PCM. Android: AudioRecord или MediaRecorder с теми же параметрами. VAD (обнаружение речи) удаляет тишину перед отправкой — стандарт в сообществе: Silero VAD или WebRTC VAD. Хороший VAD сокращает объём данных и стоимость распознавания речи на 40–60% в типичных мобильных голосовых сессиях.
Этап 3 — ASR
Три пути: on-device (фреймворк Apple Speech / SpeechAnalyzer, Android SpeechRecognizer с поддержкой Gemini Nano, whisper.cpp, Picovoice Leopard, Vosk), потоковое облако (Deepgram Nova-3, Google Chirp 3, Azure Speech, AssemblyAI Universal-2, OpenAI Realtime API) или гибрид (сначала on-device, облачная сверка при низкой уверенности). Выбор зависит от допустимой задержки, необходимости работы без интернета, поддерживаемых языков и требований к приватности.
Этап 4 — NLU / интент
Транскрипт превращается в интент. Для небольшого набора команд достаточно регулярных выражений или простого классификатора. В случае открытого диалога подойдёт компактная LLM с поддержкой function calling: Claude Sonnet 4.6 или GPT-4o в облаке, Apple Intelligence или Gemini Nano на устройстве. Держите LLM в рамках функциональных вызовов — свободный текстовый ответ в три раза медленнее и в десять раз дороже, чем структурированный.
Этап 5 — Выполнение действия
Интент превращается в функциональный вызов внутри приложения: добавить в корзину, начать тренировку, позвонить жильцу, открыть документ. iOS App Intents (iOS 16 +) и Android App Actions позволяют системному ассистенту запускать ваши действия, не открывая приложение. Это слой «Siri Shortcuts для голоса» — внедрив его, вы появляются в подсказках Siri и сценариях Google Assistant.
Этап 6 — TTS-ответ
Если приложение отвечает голосом, TTS работает либо на устройстве (AVSpeechSynthesizer на iOS, Android TextToSpeech), либо в облаке (ElevenLabs, OpenAI TTS, Google Chirp 3 HD). ElevenLabs Flash v2.5 с TTFB около 75 мс — самый быстрый облачный вариант; TTS на устройстве бесплатен, но звучит менее естественно. Для всего, что похоже на диалог, потоковая отдача обязательна.
Этап 7 — Приватность, согласие и ведение журнала
Permission-строки в Info.plist (iOS) и AndroidManifest.xml. App Privacy labels в App Store Connect. Раздел Data Safety в Google Play Console. Сценарии согласия внутри приложения для биометрии. Журналирование, готовое к аудиту, с политиками удержания. Пропустите что-нибудь из этого — и приложение либо отклонят, либо засудят.
On-device или облако: самый главный выбор
Девяносто процентов архитектурных споров на проекте «голос в мобильном» сводятся к выбору между on-device и облаком. Вот наша матрица компромиссов.
| Параметр | On-device (Apple Speech, Gemini Nano, whisper.cpp) | Облако (Deepgram, Chirp, OpenAI Realtime) |
|---|---|---|
| Задержка | 100–400 см, без вариаций сети | 200–600 мс плюс задержка сети |
| Точность (WER) | 6–12% на чистой речи; хуже — на шумной и с акцентом | 3–7% (Nova-3, Chirp 3) |
| Языки | ~30 на iOS, ~70 на Android с Gemini Nano | 100 + (Chirp 3), 30 + (Nova-3) |
| Офлайн-режим | Да — самолёт, удалённые районы, тоннели | Нет — требуется соединение |
| Приватность | Звук не покидает устройство | Звук проходит через серверы вендора |
| Влияние на батарею | Выше во время распознавания помогает нейронный движок | Нагрузка на CPU ниже, но радиомодуль продолжает работать |
| Размер приложения | +50–1200 МБ под встроенные модели | Почти ноль |
| Стоимость минуты | Нулевая на единицу | 0,2–0,7 ₽ за минуту потокового ASR |
Правильный ответ почти всегда — гибрид. Обработка на устройстве подходит для коротких команд, пробуждения по фразе и сценариев, где важна конфиденциальность (например, медицинская диктовка или финансовые запросы). Облако — для многоязычной распознавательной работы, длинных текстов и диалоговых агентов с открытым доступом. Пусть выбор делается для каждой сессии отдельно, а не для всего приложения сразу.
Практическое правило: по умолчанию используй on-device, если транскрипт не должен покидать телефон, язык поддерживается операционной системой и входит в топ-10, а ожидаемая речь короче 10 секунд. Во всех остальных случаях — отправляй в облако. Показывай пользователю выбор (значок замка = приватно / on-device) — доверие тоже важная функция.
Голосовой стек Apple: SpeechAnalyzer, App Intents, Apple Intelligence
В 2025 году на WWDC Apple обновила свои голосовые API. Старый SFSpeechRecognizer по-прежнему работает, но для нового кода рекомендуется использовать SpeechAnalyzer — он интегрирован с on-device стеком Apple Intelligence и предоставляет более подробные метаданные: уровень уверенности, тайминги слов и определение языка.
Практические заметки по iOS-голосу в 2026 году:
- On-device — выбор по умолчанию. Apple Intelligence работает на чипах A17 Pro и серии M и старше. На более старых устройствах обработка речи переходит в облако — для этого требуется разрешение пользователя.
- App Intents заменяют донаты Siri Shortcuts. Объявляйте действия, доступные по голосу, через App Intents, предлагайте параметризованные интенты («начни тренировку на 30 минут») — и Siri будет показывать ваше приложение автоматически. Это самый дешёвый канал дистрибуции в мобильном голосовом интерфейсе.
- Для фонового аудио нужен специальный режим. Чтобы приложение могло воспроизводить звук в фоне, требуется включить
UIBackgroundModes: audioи чётко объяснить пользователю, зачем это нужно. Ревьюеры Apple отклоняют сценарии вроде «всегда слушать», если они выглядят спекулятивными. - Permission-строка имеет значение. Нужны и
NSSpeechRecognitionUsageDescription, иNSMicrophoneUsageDescription. Пишите их конкретными глаголами, а не общими фразами. «Чтобы расшифровывать ваши голосовые заметки в журнале сессии» — пройдёт ревью; «Чтобы обеспечить голосовые функции» — нет.
Голосовой стек Android: ML Kit GenAI, Gemini Nano, App Actions
Сюжет Android в 2026 году раздвоен. Базовое API SpeechRecognizer обеспечивает простое распознавание речи на любом современном устройстве. ML Kit GenAI с on-device Gemini Nano на Pixel 9, Galaxy S24 и новее поддерживает распознавание намерений и генерацию ответов для сложных сценариев — всё работает приватно, без интернета и бесплатно с момента запуска.
Практические заметки по Android-голосу в 2026 году:
- App Actions — аналог App Intents. Объявляйте возможности в
shortcuts.xml, чтобы Google Assistant и Gemini могли запускать ваше приложение голосом. Здесь большинство приложений теряет канал дистрибуции. - Foreground service для постоянного прослушивания. В Android 14 и выше ужесточили правила для foreground-сервисов: теперь требуется указать тип «microphone» и показывать пользователю постоянное уведомление.
- Доступ к Gemini Nano привязан к железу. Проектируйте так, чтобы функции плавно заменялись облачным ASR на старых телефонах — иначе 40% вашей аудитории получит худший опыт.
- Декларации Data Safety строгие. ML-проверка Google Play действительно анализирует импорт SDK и выявляет необъявленные аудиопотоки. Декларируйте каждый ASR SDK, даже если данные «эфемерные».
Кроссплатформа: React Native, Flutter, Capacitor
Если вы не пишете нативно под каждую ОС, выбирайте SDK, совместимое с вашим фреймворком. Здесь проекты тихо сжигают недели.
| Фреймворк | Варианты ASR | Варианты TTS | Подводные камни |
|---|---|---|---|
| React Native | @react-native-voice/voice, expo-speech-recognition, Deepgram SDK, AssemblyAI SDK | react-native-tts, expo-speech | Переход на New Architecture (Fabric / TurboModules) сломал часть старых голосовых модулей; проверяйте совместимость перед началом работ. |
| Flutter | speech_to_text, deepgram_speech_to_text, Google Cloud Speech SDK | flutter_tts, google_tts | Прокидывание iOS-строк приватности через Info.plist выполняется вручную — плагин это не сделает автоматически. |
| Capacitor / Ionic | @capacitor-community/speech-recognition, @capgo/capacitor-speech-recognition | @capacitor-community/text-to-speech | Фоновое прослушивание работает по-разному в разных плагинах Capacitor — проверяйте на реальных устройствах, а не на симуляторах. |
| Нативно (Swift / Kotlin) | Apple Speech / SpeechAnalyzer; Android SpeechRecognizer; любой облачный SDK | AVSpeechSynthesizer; Android TextToSpeech | Максимум контроля, максимум усилий. Выбор по умолчанию, когда важны задержка или приватность. |
Если приложение полностью нативное, оставайтесь нативными и в голосовом слое — мосты RN или Flutter добавляют 50–150 мс накладных расходов на каждое взаимодействие. Если вы уже используете кроссплатформенную разработку, применяйте плагины для последних версий и предусматривайте нативные фолбэки на критических участках.
Планируете голосовую функцию для мобильного приложения?
Проведём аудит кодовой базы (нативной или на RN/Flutter), порекомендуем стек и оценим сроки интеграции — от 8 до 12 недель. Без обязательств.
Бюджет задержки: правило одной секунды
Мобильные пользователи не прощают задержек в голосовом управлении. Эмпирически: до 500 мс — отклик кажется мгновенным; 500–1000 мс — отзывчивым; 1–2 секунды — медленным; больше 2 секунд — пользователь уже нажимает пальцем. Вот наш целевой бюджет для голосовой команды, выполняющей действие внутри приложения.
| Этап | Бюджет | Комментарий |
|---|---|---|
| VAD и конец речи | ~50 см | Silero VAD или WebRTC VAD на устройстве. |
| ASR (первый транскрипт) | 100–400 мс | Deepgram Nova-3 — меньше 300 мс в облаке; Apple Speech — около 200 мс на устройстве. |
| Интент / LLM | 100–500 мс | Маленький классификатор — менее 50 мс; вызов функции у GPT-4o / Sonnet 4.6 — 300–500 мс. |
| Выполнение действия | 50–150 см | Вызов API, обновление локальной БД, состояние UI. |
| Первый аудио TTS | 75–250 см | ElevenLabs Flash — около 75 мс; Apple AVSpeechSynthesizer — около 200 мс. |
| Итого | ~375–1350 см | Цель — задержка end-to-end менее 1000 мс для команд и менее 1500 мс для диалога. |
Самые простые способы улучшить производительность: стримьте ASR (не дожидаясь конца фразы); используйте перед LLM простой классификатор для очевидных команд; стримьте первые байты TTS; для диалоговых функций выбирайте speech-to-speech (например, OpenAI Realtime или нативное аудио Gemini); поддерживайте постоянный WebSocket-соединение с ASR-провайдером, а не открывайте его заново на каждую сессию.
Разрешения и приватность: UX, который помогает приложению пройти ревью
Голосовые функции в App Store и Google Play чаще отклоняют из-за вопросов приватности, чем из-за проблем с работой. У ревьюеров есть чёткая установка: если пользователь не сразу поймёт, что аудиозапись покидает его устройство, об этом нужно чётко и заранее предупредить.
UX разрешений на iOS
- Объявите
NSMicrophoneUsageDescription(доступ к микрофону) иNSSpeechRecognitionUsageDescription(фреймворк Speech, который на старых чипах может использовать серверы Apple). - Подготовьте пользователя к запросу. Покажите экран с объяснением внутри приложения до системного запроса — приложения с предварительным уведомлением получают на 20–30% больше согласий.
- «Этикетка приватности» в App Store Connect должна чётко указывать все потоки голосовых данных — независимо от того, связаны они с приложением или используются для аналитики. Пропущенная декларация = отклонение.
- Guideline 5.1.1 (сбор данных и приватность) — самая частая причина отклонения голосовых приложений. Опубликуйте политику конфиденциальности и разместите ссылку на неё в приложении.
UX разрешений на Android
- Объявите
android.permission.RECORD_AUDIOвAndroidManifest.xmlи запрашивайте во время выполнения с помощью Activity Result API. - Для постоянного прослушивания объявите
FOREGROUND_SERVICE_MICROPHONE(Android 14 +) и поддерживайте активное уведомление. - Раздел Data Safety должен перечислять каждый сторонний ASR SDK и указывать, какие данные он передаёт. Автоматическая проверка Google Play выявляет несоответствия.
- Для голосовых приложений в медицине и финансах категория приложения требует соблюдения дополнительных правил — ознакомьтесь с Developer Program Policies для вашей категории.
Сценарии согласия
Если приложение сохраняет голосовые записи для дальнейшего использования — например, для медицинской диктовки, обратных звонков в поддержку или обучения моделей — требуется не просто согласие, а осознанное и явное разрешение. Чекбокс, спрятанный в пользовательском соглашении, здесь не подходит. Если вы используете голосовую биометрию для аутентификации, вы попадаете под действие BIPA и статьи 9 GDPR. В этом случае нужно отдельное согласие с чёткой политикой хранения данных. Мы делаем это полноценной частью интерфейса — переделывать потом будет сложно и дорого.
Комплаенс: HIPAA, PCI, GDPR, BIPA, COPPA, EU AI Act
Краткий обзор. Любой проект «голос в мобильном» использует часть этих компонентов. Закладывайте требования в архитектуру с самого начала.
- HIPAA — медицинская диктовка, телемедицина, приложения для ухода за пожилыми. Голосовые записи часто содержат персональные медицинские данные (PHI). С каждым поставщиком голосового SDK нужно заключать соглашение о сотрудничестве (Business Associate Agreement), обеспечить шифрование данных как при хранении, так и при передаче, вести аудит-логи и хранить информацию шесть лет. Nuance DAX, Abridge и Suki соответствуют требованиям HIPAA; большинство потребительских ASR SDK — нет, пока с ними не подписан BAA.
- PCI DSS — голосовые платежи. Если пользователь называет номер карты, сам звук и его текстовая расшифровка попадают в зону PCI DSS. Большинство команд направляют голосовые платежи через отдельный изолированный сервис (например, Voice IVR-провайдеры вроде CDW, Cisco или Plivo), а не пытаются включить всё мобильное приложение в зону PCI DSS.
- GDPR — любой пользователь из ЕС. Голос по умолчанию считается персональными данными; голосовой отпечаток относится к особой категории по статье 9. Требуется законное основание, явное согласие на обработку биометрических данных, проведение DPIA, хранение данных в ЕС и обеспечение права на удаление. Руководство EDPB на 2024–2025 годы ужесточает контроль за соблюдением требований.
- BIPA (Иллинойс) — любое использование голосовой биометрии у жителей штата. Требуется письменное согласие, публичная политика хранения данных и установленный срок их уничтожения. Активная площадка для коллективных исков.
- CCPA / CPRA (Калифорния) — голосовые записи и отпечатки пальцев относятся к чувствительным персональным данным. Требуется согласие на их обработку, а также предоставляется право на удаление.
- COPPA — пользователи младше 13 лет. Требуется согласие родителей до сбора голоса. Образовательные приложения часто ошибаются на этом этапе.
- Статья 50 EU AI Act — любой ИИ-голосовой агент, общающийся с пользователями в ЕС, должен сообщить, что он — искусственный интеллект. Достаточно короткой вступительной фразы («Здравствуйте, я ИИ-ассистент Acme»).
- Tennessee ELVIS Act — запрещено клонировать реальные голоса с помощью TTS без согласия. Используйте синтетические голоса от вендора, если у вас нет подписанного разрешения.
Комплаенс-шорткат, который реально работает: относитесь к любому голосовому транскрипту как к персональным данным с момента записи, а к любому голосовому отпечатку — как к чувствительным персональным данным (статья 9). Вы перестрахуетесь в 20% случаев, но никогда не получите неожиданного предписания. Цена такой дисциплины на этапе проектирования — примерно один спринт; цена добавления уже после коллективного иска по BIPA — порядка 3,7–18 млн ₽ плюс мировое соглашение.
Голос в регулируемом приложении?
HIPAA, PCI, BIPA, COPPA, EU AI Act — мы реализовывали голосовые функции в соответствии со всеми этими стандартами. Свяжитесь с нами, и до выбора технологий мы проанализируем ваш конкретный периметр соответствия требованиям.
Offline-first голос: когда телефон должен работать без интернета
Не каждое приложение может рассчитывать на стабильную связь. Авиакомпании запрещают использование радио ниже 3000 метров. Приложения для выездных бригад работают в подвалах и на открытых полях. Медицинские приложения иногда юридически не имеют права передавать звук за пределы устройства. В таких условиях офлайн-голос — не предмет обсуждения.
Практические варианты в 2026 году:
- Apple Speech / SpeechAnalyzer on-device — iOS 18 +, A17 Pro и выше для полного набора функций. Приемлемый WER на чистой речи для топ-30 языков. Бесплатно, мгновенно, без загрузки модели в приложение.
- Android SpeechRecognizer + Gemini Nano — Pixel 9 / Galaxy S24 и новее. Та же категория, что и on-device стек Apple; плавно переключается на облачную обработку на старых устройствах.
- whisper.cpp — Whisper, портированный на C++ с ускорением через Metal / NNAPI. Запускается на любом современном телефоне, но минимальная пригодная модель (small.en) весит около 150 МБ. Большие модели (medium, large-v3-turbo) дают почти такой же уровень ошибок распознавания, как в облаке, но увеличивают размер приложения на 500 МБ–1,5 ГБ. Храните их как загружаемые ресурсы, а не включайте в основной бандл.
- Picovoice Leopard / Cheetah — коммерческая лицензия, около 30 МБ, работает в реальном времени на мобильных устройствах, точность распознавания около 90% на чистом английском. Платный, но с предсказуемыми условиями.
- Vosk — open source, на базе Kaldi, модель объёмом около 50 МБ на язык, точность около 85%. Подходит для проектов с ограниченным бюджетом.
Грубая прикидка: модель Whisper small.en на iPhone 15 расшифровывает минуту чистой речи примерно за 10 секунд — то есть в 6 раз быстрее реального времени — с точностью около 95% на чистом аудио. Влияние на батарею заметное, но не критичное: 10-минутная сессия диктовки расходует 3–5% заряда современного телефона. Поставляйте модель как загружаемый ассет, агрессивно кэшируйте и позволяйте пользователю подключать её самостоятельно.
Сценарии, которые работают в 2026 году
Кто выпускает голосовые функции, которыми реально пользуются пользователи? Обзор текущего состояния дел.
Ритейл и голосовая коммерция
Amazon, Walmart, eBay и Starbucks внедрили голосовой повторный заказ и голосовой поиск в своих мобильных приложениях. Голосовой заказ Walmart стал массовым ещё несколько лет назад; у Starbucks он заметно сократил очереди в drive-through. По данным Grand View Research, рынок голосовой коммерции к 2030 году достигнет 13 трлн ₽ при среднегодовом темпе роста 24,6%. Устоявшийся паттерн: голос — для повторных заказов знакомых товаров, тач — для изучения нового.
Здравоохранение и медицинская диктовка
Nuance DAX Copilot (Microsoft), Abridge, Suki, DeepScribe. Abridge привлек 206 млрд ₽ в раунде Series D в феврале 2025 года — это сигнал инвесторов о том, что клиническое документирование на основе ИИ перешло из стадии пилотных проектов в корпоративную инфраструктуру. Набор функций у таких решений узкий: фиксация визита, генерация SOAP-нотации, создание структурированных кодов для биллинга. При этом требования к соответствию стандартам очень высокие — HIPAA, SOC 2, локализация данных.
Финтех и голосовой банкинг
Erica от Bank of America — главный пример: она уже обслуживает более 40 млн пользователей, позволяя проверять баланс, переводить деньги и оплачивать счета голосом. В своих приложениях аналогичные голосовые помощники есть у Capital One, Chase и Wells Fargo. Общий принцип: голос используется для запросов, а подтверждение операций — через касание экрана. Из-за требований PCI DSS и риска дипфейков голосовая авторизация платежей считается неоправданной.
Автомобильная отрасль и hands-free
Cerence AI (выделенное автомобильное подразделение Nuance), Android Auto с Gemini, CarPlay с Siri. Автомобили модельного года 2026 всё чаще оснащаются встроенной голосовой системой, и мобильная версия приложения должна корректно интегрироваться через медиа- и мессенджер-интенты CarPlay и Android Auto. Если ваше приложение работает в машине, голосовой интерфейс становится практически обязательным.
Доступность и инклюзия
Голос — самый понятный способ сделать мобильное приложение доступным. В США в 2025 году подано более 5000 исков по ADA — это рост примерно на 20% по сравнению с прошлым годом. Приложения, ориентированные на пользователей с нарушениями моторики или зрения, особенно выигрывают от режима «голос прежде всего» — и это одна из немногих функций, где аргументы инклюзивного дизайна и коммерческие выгоды полностью совпадают.
Фитнес и велнес
Peloton добавил голосовые команды в своё iOS-приложение в 2024 году. Strava, Nike Run Club и Apple Fitness+ поддерживают голосовое управление и озвучку. Сценарий подходит к среде: середина тренировки, руки мокрые, телефон закреплён на предплечье — голос остаётся единственным удобным способом взаимодействия.
Диктовка и продуктивность
Голосовой ввод Gboard поддерживает более 900 языков. Otter и Rev предлагают приложения с транскрипцией в реальном времени. Willow — новый участник рынка — утверждает, что позволяет печатать в четыре раза быстрее благодаря гибридному подходу «голос + тактильная клавиатура». Голосовая продуктивность — уже зрелая категория: теперь ключевым фактором отличия не точность распознавания речи, а постобработка — пунктуация, форматирование, разделение спикеров, перевод.
Мини-кейс: гибридный голос в React Native приложении для продуктивности
Контекст: североамериканский SaaS-продукт для продуктивности с ~450 тыс. активных мобильных пользователей попросил добавить голосовой захват заметок встреч в существующее React Native приложение. Требования: офлайн-работа в самолёте, поддержка нескольких языков для европейской команды, задержка меньше секунды и сохранение категории в App Store, чтобы избежать повторного ревью.
Что мы выкатили:
- Гибридный ASR — Apple SpeechAnalyzer и Android SpeechRecognizer on-device по умолчанию; облачный фолбэк на Deepgram Nova-3, если пользователь включает многоязычный режим.
- whisper.cpp small.en в виде загружаемого ассета для офлайна; запускается только при включённом режиме «офлайн-захвата».
- Claude Sonnet 4.6 с схемой вызова функций для постобработки (форматирование, создание краткого содержания, выделение задач, привязка к нужной заметке).
- Потоковый UI — частичные обновления транскрипта каждые 150 мс, видимая волновая форма, чёткие переходы между состояниями «Слушаю» и «Обрабатываю».
- Редизайн UX разрешений — предварительный запрос на доступ к микрофону и использованию распознавания речи с пояснением в одном абзаце и кнопкой «Не сейчас». Доля согласий выросла с 58% до 83%.
- App Intents и App Actions — команды вроде «Привет, Siri, запиши заметку в [AppName]» или «Окей, Google, сделай заметку о встрече» работают с экрана блокировки.
Замеренные результаты, 90 дней после запуска:
- На голосе создавалось ~38% всех новых заметок на iOS и ~31% на Android (с нуля).
- Медианная end-to-end задержка от «закончил говорить» до отформатированной заметки: ~850 мс на устройстве, ~1,3 с в облаке.
- Ревью App Store пройдено с первого раза. По приватности отклонений не было.
- Срок проекта от старта до выхода v1 в продакшене: 10 недель, включая 2 недели стресс-тестирования.
Детали анонимизированы по просьбе заказчика. Эта архитектура стала шаблоном для всех мобильных голосовых проектов, которые мы оценивали с тех пор.
5 ловушек, которые убивают мобильные голосовые проекты
1. Запуск голоса без потокового интерфейса
Если пользователь что-то сказал, а приложение замолчало на две секунды, он подумает, что всё сломалось. Всегда показывайте волну, частичный текст или хотя бы индикатор загрузки. Ощущаемая задержка — это и есть важная функция.
2. Свободный микрофон у LLM
Открытые текстовые ответы LLM на мобильном голосе работают медленно, стоят дорого и иногда выдают неправдоподобные данные. Используйте у LLM вызов функций с enum-интентами. Если нужен длинный ответ — подготовьте шаблон, а LLM пусть подставляет значения в нужные места.
3. Игнорирование CarPlay и Android Auto
Пользователи, которые в обычной жизни используют голос в вашем приложении 10% времени, в машине — 90%. Если приложение не поддерживает голосовые команды в CarPlay и Android Auto, вы теряете половину возможностей голосового интерфейса.
4. Недокументированные потоки данных
Самой частой причиной отклонения голосовых приложений в App Store и Google Play в 2025 году стало неполное раскрытие информации о приватности — сторонний ASR SDK отправляет аудио за пределы устройства, но об этом не указано в App Privacy или Data Safety. Автоматизируйте проверку. Перед подачей приложения изучайте документацию по обработке данных у каждого SDK.
5. Отсутствие плана на случай отказа
Голос отказывает. Сеть падает. Транскрипт ломается. Пользователь не знает, что сказать. Любой голосовой функционал должен предусматривать простой способ вернуться к интерфейсу с тач-управлением: кнопка «ввести вручную», подсказка «повторите», возможность «нажать, чтобы отменить». Приложения, не имеющие сценариев на случай сбоев, теряют пользователей при каждой неполадке.
Полностью on-device голос имеет смысл, когда: приложение работает с регулируемыми данными (HIPAA, PCI), целевой рынок предъявляет жёсткие требования к хранению данных (ЕС, Швейцария, Бразилия) или сценарий требует надёжности в самолёте, тоннеле и сельской местности. Облако — по умолчанию; on-device — правильный выбор для небольшой, но растущей группы пользователей.
KPI: как понять, что голосовая функция работает
Три блока. Снимайте всё с первого дня.
Качество
- WER на реальном пользовательском аудио — цель менее 10% после применения phrase biasing.
- Точность определения цели — более 95%; частота ложных срабатываний — менее 0,5%.
- Медианная end-to-end задержка — <1000 мс для команд; <1500 мс для диалога.
- Частота повторов — доля сессий, в которых пользователь переформулировал запрос. Цель — менее 15%.
Внедрение
- Voice DAU — доля пользователей, которые ежедневно активно использовали голосовой интерфейс.
- Доля согласий на разрешения — какой процент пользователей разрешил доступ к микрофону и использованию распознавания.
- Доля фичи — какой процент целевых задач (захват заметки, поиск, заказ, повторный заказ) выполняется голосом, а не жестами.
- Прирост удержания — когортный retention голосовых пользователей по сравнению с остальными.
Комплаенс и надёжность
- Частота отклонений в App Store / Google Play — цель: ноль отклонений.
- Захват согласий — доля голосовых сессий, в которых было получено согласие, когда оно необходимо.
- Пройденные тесты failover — ежемесячный хаос-тест облачных ASR, LLM и TTS-фолбэков.
- Время реакции на запрос об удалении данных — цель <30 дней (GDPR), <45 дней (CCPA).
Когда НЕ нужно добавлять голос в мобильное приложение
Честный список. Пять ситуаций, когда голос — не лучший ответ.
- Плотный ввод данных с жёсткой валидацией — налоговые формы, многополевой поиск. Голосовой ввод повышает вероятность ошибки при вводе чисел. Тач лучше.
- Чувствительные к приватности действия в публичных местах — например, диктовать номер карты в переполненной электричке. Пользователи откажутся, даже если технически всё работает.
- Сценарии в один экран и одно нажатие — если задача решается одним касанием, голос замедляется.
- Низкоиспользуемые функции — если у целевой фичи 200 пользователей в месяц, стоимость голосовой инженерии превышает выгоду. Выбирайте более масштабную задачу.
- Юрисдикции без чёткого биометрического закона — если функция требует голосовой биометрии, а на целевом рынке нет устоявшегося правового режима, подождите, пока ситуация прояснится.
Фреймворк принятия решений — выбираем стек за пять вопросов
Любой мобильный голосовой RFP, который мы анализировали, сводится к этим пяти вопросам. Ответы на них определяют выбор стека.
- Какая из пяти голосовых возможностей вам действительно нужна? Диктовка, команды, поиск, разговорный агент или биометрия. Не заявляйте сразу две.
- Офлайн — жёсткое требование? Если да → Apple Speech / Gemini Nano / whisper.cpp. Если нет → Deepgram / Chirp / OpenAI Realtime в облаке.
- Сколько языков? До 10 → достаточно on-device. От 20 и больше → облако через Chirp 3 или Whisper API.
- Закрытая грамматика или открытый диалог? Команды / поиск → небольшой классификатор без LLM. Диалог → LLM с вызовом функций (Sonnet 4.6, GPT-4o или on-device Apple Intelligence / Gemini Nano).
- Какие режимы комплаенса применимы? HIPAA → вендоры с BAA + обработка на устройстве, если возможно. PCI → отдельный изолированный путь для голосовых платежей. GDPR → хранение данных в ЕС. BIPA → письменное согласие и чёткая политика хранения. Учитывайте это с самого начала.
Сценарий интеграции: путь на 8–12 недель
Что мы реально поставляем, когда заказчик берёт нас на мобильную голосовую фичу. Сроки — для существующих iOS- и Android-приложений с бэкендом; green-field проекты прибавляют 2–3 недели.
| Недели | Фаза | Артефакты |
|---|---|---|
| 1 | Исследование и архитектура | Скоупинг сценариев, карта юрисдикций, выбор стека, вайрфреймы UX и разрешений, DPIA, где применимо |
| 2–3 | Фундамент | Захват аудио, VAD, UX разрешений, декларации App Privacy и Data Safety, каркас фича-флагов |
| 4–5 | ASR-слой | On-device интеграция (Apple Speech / Android SpeechRecognizer), потоковое облако-фолбэк (Deepgram / Chirp), UI волны |
| 6–7 | Интенты и выполнение | LLM с вызовом функций, классификатор намерений, обработчики действий, сценарии отката |
| 8 | TTS и системная интеграция | Потоковый TTS, App Intents / App Actions, хуки CarPlay / Android Auto, регистрация в Siri / Assistant |
| 9 | Комплаенс и аудит | Сценарии согласия, аудит-лог, таймеры удержания, инструменты для права на удаление, тексты раскрытия ИИ |
| 10 | Стресс-тест и настройка | Бета-тест на реальном трафике, замер WER, настройка phrase biasing, KPI-дашборд, подготовка к публикации в магазинах |
| 11–12 | Подача и запуск | Подача в App Store / Google Play, ответы ревьюерам, поэтапный запуск, дежурный runbook, ML-ops по контролю дрейфа |
Наш парный с ИИ инженерный процесс сокращает сроки на этапах 4–7 примерно на 30% по сравнению с командой без ИИ. LLM лучше всего справляется с рутинной интеграцией — подключением SDK, настройкой permission-строк, тестовой обвязкой, но не заменяет архитектурные решения.
Готовы оценить объём работ?
Приходите со своим приложением, целевым сценарием и юрисдикциями. Мы подготовим оценочный план за 5 рабочих дней.
Куда движется мобильный голос в 2026–2027 годах
Четыре тренда, на которые стоит ориентироваться при планировании.
Speech- to-speech схлопывает пайплайн
gpt-realtime у OpenAI и нативное аудио у Gemini полностью пропускают каскад ASR → LLM → TTS. End-to-end задержка падает до 200–300 мс «голос-в-голос», просодия заметно улучшается. Расплата — меньше контроля над транскриптом и пайплайном интентов. Хорошо для диалоговых фич, хуже для критичных к безопасности или плотных по комплаенсу.
On-device LLM становятся реально удобными
Apple Intelligence, Gemini Nano, квантизированные Llama 3.3 и Mistral Small 3 через MLC или llama.cpp — всё это позволяет разместить в кармане настоящую модель с 3–8 миллиардами параметров. Для простых голосовых задач — команд, коротких запросов, кратких резюме — телефон больше не нуждается в облаке. Приватность выше, задержка меньше, а стоимость использования — ноль.
App Intents / App Actions становятся каналом распространения
Siri и Gemini выводят голосовые команды на системный уровень. Приложения, которые поддерживают расширенные App Intents и App Actions, появляются в интерфейсе ассистента; те, что не поддерживают, остаются за пределами нового способа взаимодействия. Лидеры уже активно работают в этом направлении.
Voice-first для AR и носимых
Vision Pro, Meta Orion, умные очки — у всех голос основной способ ввода. Мобильные приложения, которые в 2026 году выйдут с чистым голосовым интерфейсом, будут готовы к AR-интерфейсам 2027–2028 годов. Остальные будут спешить дорабатывать.
FAQ
Насколько точно on-device распознавание речи в 2026 году?
Apple SpeechAnalyzer и Android SpeechRecognizer (с Gemini Nano) обычно показывают WER 6–12% на чистой речи в популярных языках — этого хватает для большинства задач с голосовыми командами и диктовкой, а точность близка к облачным решениям. Whisper small.en на устройстве достигает около 95% точности на чистом английском; более крупные модели (medium, large-3-turbo) выдают результат на уровне облака, но занимают от 500 МБ до 1,5 ГБ памяти.
Сколько стоит голосовой ASR на пользователя в месяц?
Цены облачного потокового ASR — от 0,2 до 0,7 ₽ за минуту. Типичный пользователь потребительского приложения, говорящий по три минуты в день, обходится в 20–67 ₽ в месяц только на ASR. On-device ASR — бесплатный. Вызовы LLM для распознавания интентов добавляют ещё 3–22 ₽ в месяц при типичных объёмах. На одного голосового MAU полный стек стоит 37–150 ₽ в месяц.
Apple или Google могут заблокировать сторонние голосовые SDK?
Маловероятно — но обе платформы требуют указывать сторонние потоки данных в App Privacy / Data Safety. Пока информация точная, а поставщик SDK соблюдает правила защиты данных, согласование проходит без проблем. Проблема возникает не из-за использования сторонних решений, а из-за недостоверной декларации.
Использовать Realtime API от OpenAI или создать собственный пайплайн?
Берите Realtime API для диалоговых функций, где важна просодия «голос-в-голос», а транскрипт — вторичен. Собирайте свой пайплайн ASR + LLM + TTS, если транскрипт нужен для комплаенса, требуется специфический словарь для phrase biasing или нужна гибкость — чтобы выбирать вендоров по цене или иметь резерв. Большинство продакшен-приложений используют и то, и другое: Realtime — для диалогового агента, а кастомный пайплайн — для диктовки и поиска.
Как обрабатывать многоязычных пользователей?
Для 20+ языков облако по-прежнему остаётся правильным решением. Google Chirp 3 поддерживает 100+ языков с автоопределением; Deepgram Nova-3 — топ-30 с качеством, пригодным для продакшена; OpenAI Whisper — 99 языков с хорошей точностью, но с большей задержкой. Храните языковые предпочтения пользователя и используйте значения по умолчанию, основанные на локали устройства.
Стоит ли вкладываться в голос для B2B-приложения с менее чем 10 тыс. пользователей?
Иногда, если целевой процесс связан с занятостью рук (например, выездной сервис, клиника, склад), голос становится эффективным инструментом удержания даже при небольшом масштабе. Если же процесс сводится к чистому вводу данных за столом, тач-интерфейс работает лучше. Задайте себе вопрос: какой процент пользователей находится в условиях, где они не могут печатать? Если этот показатель превышает 20%, голосовое управление окупит затраты на разработку.
Что чаще всего становится причиной отклонения голосовых приложений в App Store?
Guideline 5.1.1 — сбор данных и приватность. Конкретно: отсутствие или неясность строк с запросами разрешений, отсутствие или неточность информации в разделе App Privacy, недостаточное раскрытие о передаче данных сторонним SDK. Ревьюеры обращают на это внимание в первую очередь. Подавайте приложение с точными декларациями и понятным объяснением в интерфейсе перед каждым запросом разрешения.
Сколько занимает мобильная голосовая интеграция?
8–12 недель на реализацию функции (например, голосового захвата или голосового поиска) в уже существующем приложении для iOS и Android. 14–18 недель на создание полноценного голосового агента с поддержкой диалогов и соблюдением требований комплаенса (HIPAA, PCI, размещение в ЕС). Разработка с нуля voice-первого приложения добавляет 2–3 недели на построение базовой архитектуры.
Что почитать дальше
Смежная тема
Распознавание речи на базе ИИ для домофонов
Голосовой стек, когда цель — панель на двери, а не телефон в кармане: другие ограничения, та же основа.
Глубокое погружение
Одновременный перевод на базе ИИ
Архитектура живого многоязычного голоса напрямую применима к многоязычной мобильной диктовке и голосовым агентам.
Дополнение
Гид по AI-платформе стриминга
Как масштабируются архитектуры аудио- и видеостриминга в реальном времени — каркас любой серьёзной voice-first мобильной разработки.
По теме
Видеонаблюдение на базе ИИ
Где голос встречается с видео в физической безопасности — полезный контекст для голосовых приложений, которые работают с камерами.
Услуги
Услуги Фора Софт
Полное меню работ Фора Софт по аудио, видео и ИИ в реальном времени.
Итоги
Распознавание речи в мобильных приложениях уже не выделяет продукт — это базовая функция в тех категориях, где пользователи хотя бы 10% времени могут быть свободны от рук. Стек 2026 года готов: Apple SpeechAnalyzer и Gemini Nano — для приватного распознавания на устройстве; Deepgram Nova-3, Chirp 3 и OpenAI Realtime — для облачного стриминга уровня продакшена; ElevenLabs и on-device TTS — для озвучки ответов; App Intents и App Actions — для системной интеграции.
Успешные голосовые функции отличаются от заброшенных не выбором модели, а дисциплиной задержки, UX-разрешений, планированием соответствия требованиям и проектированием путей отказа. Заложите всё это с самого начала.
Если этот гайд совпадает с направлением вашего roadmap, свяжитесь с Фора Софт — и за неделю мы подготовим оценённый план.

