Голосовой интерфейс: как спроектировать хороший UX

Компании, которые запускают голосовой интерфейс, часто ориентируются на один показатель: насколько точно система распознаёт речь. На практике пользователи оценивают голосовую функцию не по проценту распознанных слов, а по тому, доводит ли она их до нужного результата, даже когда что-то расслышано неточно. Продукты, которые смотрят только на точность распознавания, нередко выпускают голосовую функцию, от которой пользователи отказываются уже через неделю.
Это руководство разбирает, почему точность распознавания речи не главный показатель качества, три принципа хорошего голосового UX, сколько это стоит на практике и какие ошибки чаще всего допускают компании при запуске.
Точность распознавания: не главный показатель
Показатели точности, которые поставщики демонстрируют на лабораторных записях, почти всегда заметно хуже на реальном звуке пользователей: с фоновым шумом, акцентом и естественной речью. Более того, не все ошибки одинаково важны: ошибка в ключевом слове запроса гораздо серьёзнее, чем ошибка в незначительном слове-паразите, даже если формальный процент ошибок в обоих случаях одинаковый. Поэтому выбор голосовых API опирается сразу на несколько параметров: задержку, поддержку языков, стоимость минуты и поведение на шумном звуке.
Практическое правило: главный показатель для бизнеса: доля успешно выполненных пользователем задач, а не абстрактный процент распознанных слов. Именно этот показатель определяет, вернётся ли пользователь к голосовому интерфейсу снова. И внедрение речевых технологий стоит начинать с описания сценариев, по которым эта доля будет считаться.
Три принципа хорошего голосового UX
Аккуратное восстановление после ошибок важнее идеальной точности. Если система не уверена в распознанном слове, разумнее задать короткий уточняющий вопрос, показав наиболее вероятный вариант, чем сразу выполнять действие или сухо сообщать об ошибке.
Поддержка естественного прерывания. Возможность пользователя перебить голосового ассистента посреди фразы: это то, что отличает современный голосовой интерфейс от устаревшего голосового меню. Без этого разговор ощущается неестественным и раздражающим.
Резервный переход на другой канал взаимодействия. Если голосовой ввод не сработал даже после уточнения, у пользователя должна быть возможность быстро переключиться на текст или экран, а не упираться в тупик разговора с системой. Эти принципы задают качество разговора, а дальше вопрос в том, как запускают голосового ассистента целиком: от выбора первых сценариев до вывода в продакшен.
| Принцип | Что это даёт |
|---|---|
| Восстановление после ошибок | Снижает раздражение от неточного распознавания |
| Естественное прерывание | Делает разговор похожим на общение с человеком |
| Резервный канал взаимодействия | Не оставляет пользователя в тупике при сбое |
Учитывайте акценты и особенности речи ваших пользователей
Решение, которое показывает отличную точность на стандартной дикторской речи, может заметно хуже работать на акцентах, диалектах или смешанной речи, где пользователь переключается между двумя языками внутри одной фразы. Если аудитория продукта разнообразна, тестирование только на одном типе речи означает, что заметная часть пользователей получит продукт, который их плохо понимает.
Практическое правило: тестируйте распознавание речи на записях, которые реально отражают демографию и манеру речи ваших пользователей, а не только на общих тестовых наборах.
Как устроена работа со смыслом сказанного
Распознавание речи превращает голос в текст, но не объясняет, чего хочет пользователь. Понимание смысла запроса: это отдельная задача, которую стоит architектурно отделять от самого распознавания речи. Если объединить эти два слоя в единую систему, при возникновении проблемы невозможно понять, ослышалась ли система или просто неправильно поняла смысл уже верно распознанной фразы.
Разделение этих слоёв также позволяет менять поставщика распознавания речи, не переделывая всю логику понимания запросов и вызова внутренних систем компании. Нагляднее всего этот слой виден в NLU-ботах в поддержке клиентов, где от точности определения намерения зависит, попадёт ли обращение в нужный сценарий.
Сколько это стоит на практике
Голосовой интерфейс на основе готовых компонентов с простым набором сценариев: наименее затратный и самый быстрый вариант запуска. Полноценный голосовой интерфейс с продуманным восстановлением после ошибок, поддержкой нескольких языков и интеграцией с внутренними системами компании: заметно больший объём работы.
Разработка голосового интерфейса под ключ у Фора Софт начинается от 310 000 ₽: итоговая стоимость зависит от числа сценариев, требований к обработке на устройстве и требований к соответствию. Сузить эту вилку помогает планирование MVP голосового интерфейса: в первый релиз попадают только те сценарии, которые пользователи действительно проходят голосом.
Что регулирует закон
Голос человека: биометрические персональные данные, поэтому обработка голосовых записей подпадает под требования 152-ФЗ: нужно явное согласие, которое легко отозвать, и понятное объяснение, куда передаются данные.
Для медицинских сценариев дополнительно действуют требования 323-ФЗ и профильных приказов Минздрава к обработке медицинских данных. Для организаций, относящихся к критической информационной инфраструктуре, значение имеет соответствие требованиям ФСТЭК: это стоит уточнить на этапе выбора архитектуры.
Пять ошибок, которые чаще всего допускают компании
Запуск на основе лабораторного показателя точности вместо теста на реальном звуке пользователей. Цифра из общего рейтинга почти никогда не повторяется на вашем реальном трафике.
Объединение распознавания речи и понимания смысла в единую непрозрачную систему. Это делает почти невозможной диагностику того, что именно пошло не так при сбое.
Отсутствие поддержки естественного прерывания и подавления эха. Пользователи, которые не могут перебить систему или сталкиваются с тем, что микрофон улавливает собственный голос ассистента, быстро отказываются от голосового интерфейса.
Отношение к вопросам конфиденциальности как к доработке в конце проекта. Решение о том, где хранится аудио, как долго и кто имеет к нему доступ, нужно принимать на старте архитектуры, а не в середине проекта.
Слепое доверие к результату распознавания в чувствительных сценариях. В медицине, юриспруденции и финансах стоит предусмотреть дополнительную проверку результата, поскольку современные модели иногда выдают связный, но неверный текст там, где реальная речь была нечёткой.
Наш опыт
Фора Софт разрабатывает продукты с голосом и видео в реальном времени с 2005 года: 250+ проектов, 2 миллиона часов разработки, заказчики из 17+ стран, 50 специалистов в штате без субподряда.
Мы разработали КарьерПойнт: платформу с голосовыми функциями для карьерного коучинга, которой пользуются свыше 100 000 человек, где качество голосового взаимодействия напрямую влияет на то, вернётся ли пользователь к сервису снова. Мы также разработали ядро для трансляций в реальном времени для БрейнСерт: платформы для уроков в реальном времени с доступностью 99,995% и свыше 500 миллионов минут проведённых занятий. Тот же опыт с голосовым каналом в реальном времени лежит в основе Таннел, нашего сервиса p2p видеозвонков на WebRTC с входом по номеру комнаты.
Продукт в реестре отечественного ПО Минцифры, программа «Мундиаль», реестровая запись № 21522. План MVP, аудит архитектуры и первая оценка стоимости: бесплатно, в течение 3 рабочих дней.
Когда голосовой интерфейс не нужен
Пользователи чаще всего находятся в тихом общественном месте, где неудобно говорить вслух. В этом случае голосовой интерфейс будет мешать, а не помогать.
Задача строго структурирована и хорошо решается формой или выпадающим списком. Голос добавляет сложность там, где простой интерфейс справляется быстрее.
Аудитория говорит на разных языках и с акцентами, которые компания ещё не протестировала. Запуск без такой проверки рискует оставить часть пользователей с продуктом, который их не понимает.
Продукт ещё ищет соответствие рынку. Голосовая функция в этом случае отвлекает внимание команды от главного сценария использования, который ещё не отработан.
FAQ
Что важнее для голосового интерфейса: точность распознавания или восстановление после ошибок?
Восстановление после ошибок: система с чуть менее высокой точностью, но аккуратными уточняющими вопросами воспринимается пользователем лучше, чем более точная система, которая сразу выполняет неверное действие.
Нужно ли отдельное кодовое слово для активации голосового ассистента?
Только если продукт постоянно слушает пользователя в фоне, например умная колонка. Для голосовой функции с явной кнопкой микрофона внутри приложения отдельное кодовое слово обычно не нужно.
Как работать с пользователями, которые смешивают два языка в одной фразе?
Использовать решение, изначально рассчитанное на многоязычную речь, а не последовательность из отдельных одноязычных моделей: такая связка хуже справляется с переключением языков внутри фразы.
Реально ли обрабатывать голос прямо на устройстве пользователя?
Да, на современных устройствах это уже рабочий вариант, особенно там, где важна работа без интернета или повышенные требования к конфиденциальности данных.
Сколько времени занимает запуск голосового интерфейса?
Простой сценарий с ограниченным набором функций обычно занимает несколько недель. Полноценный интерфейс с продуманным восстановлением после ошибок и несколькими языками: несколько месяцев.
Хотите разобрать, какой голосовой UX подойдёт вашему продукту?
Свяжитесь с Фора Софт: за 3 рабочих дня подготовим план MVP, аудит и оценку стоимости бесплатно.
