Распознавание эмоций по голосу и видео: полное руководство на 2026 год

23/7/2025
·
Обновлено
8.11.2026

Главное

Распознавание эмоций по аудио и видео — это мультимодальная задача машинного обучения, а не работа одной модели. Самые эффективные системы используют лицо, голос, текст и иногда физиологические данные — каждый из этих сигналов помогает компенсировать недостатки других.

Заявленная точность вводит в заблуждение. Бенчмарк-метрики 90–99% в продакшене падают до 60–80%, а в реальных условиях съёмки — при акцентах, окклюзии и демографическом сдвиге — ошибка может превышать 70%.

EU AI Act с 2 февраля 2025 года запрещает большинство случаев распознавания эмоций на рабочих местах и в образовательных учреждениях. Если ваш продукт затрагивает сотрудников или учащихся в ЕС — пересматривайте функционал или отключайте эту возможность: исключения для медицинских и safety-целей сформулированы очень узко.

Сначала покупайте, стройте только если модель — ваше конкурентное преимущество. Готовые API (AWS, Google, Azure, Hume, MorphCast, Affectiva) подключаются за несколько недель; создание собственного мультимодального стека займёт 4–9 месяцев с применением Agent Engineering и окупится только при действительно нестандартных данных, узкой отрасли или жёстких требованиях к задержке.

Этика — главный риск доставки. Согласия пользователей, проверки на смещение, отчёты о точности по демографическим группам и чёткий список «не использовать для…» — вот что позволяет фиче остаться в продукте после запуска, а не архитектура модели.

Зачем Фора Софт написала это руководство

Распознавание эмоций в аудио и видео находится на пересечении трёх направлений, которыми мы занимаемся уже два десятилетия: коммуникации в реальном времени, компьютерное зрение и прикладное машинное обучение. Мы создаём видеоплатформы для продакшена в телемедицине, edtech, прямых трансляциях, видеонаблюдении и корпоративных продажах — это как раз те сферы, где вопрос «выглядит ли пользователь напряжённым, отстранённым или встревоженным?» перестаёт быть исследовательским и становится реальной функцией продукта.

Наша практика интеграции ИИ включает отдельную услугу Emotion Recognition Dynamics — мы анализируем эмоции на лицах в видео в реальном времени с помощью Azure Cognitive Services, OpenCV, MediaPipe, YOLO, PyTorch и TensorFlow и связываем эти данные с действиями пользователей. Платформа sales-аналитики Meetric объединяет голосовые и поведенческие сигналы во время живых звонков и повышает конверсию в сделку примерно на четверть. VocalViews, которым пользуются исследовательские команды Samsung, Google и Netflix, накладывает ИИ-анализ тональности на видеоинтервью на 30+ языках для более чем 800 000 верифицированных участников. Платформа видеонаблюдения V. A. L. T. работает с HD-видео и поведенческой аналитикой на 2500+ камерах и обслуживает 50 000 пользователей в день в правоохранительной сфере и медицинском образовании.

Дальше — руководство, которого нам не хватало в первый день: как устроены такие пайплайны на самом деле, какие датасеты и API важны, что регулируется, что может пойти не так в продакшене и какие цифры нужны покупателю, чтобы трезво решить: делать самому или покупать. Текст ориентирован на тех, кто будет выкатывать эту фичу, а не писать о ней статью.

Что такое распознавание эмоций в аудио и видео

«Распознавание эмоций» — общий термин для систем, которые определяют эмоциональное состояние (счастье, грусть, гнев, страх, удивление, отвращение, презрение, а также непрерывные шкалы валентности и возбуждения) по видео с лицом, аудиозаписи речи, текстовым транскриптам или физиологическим сигналам. В научной литературе это также называют аффективными вычислениями, распознаванием аффекта или мультимодальным распознаванием эмоций (multimodal emotion recognition, MER).

Коммерческая постановка задачи уже определена. Обычно команды выпускают одно из четырёх: классификацию лицевых выражений в видеопотоке, распознавание эмоций по речи (speech emotion recognition, SER) на микрофонном фиде, анализ тональности по транскрибированному тексту или мультимодальный классификатор со слиянием, объединяющий две-три из этих модальностей. Исследовательское поле добавляет биосигналы (ЭЭГ, пульс, кожно-гальваническая реакция), но они редко выходят за пределы лабораторий, а EU AI Act теперь отдельно ограничивает их использование на рабочем месте.

Полезная ментальная модель: пайплайн берёт аудиовизуальный фрагмент, извлекает признаки для каждой модальности отдельно, обрабатывает их отдельной моделью и затем либо объединяет результаты по принципу мажоритарного голосования (позднее слияние), либо обучается на всех модальностях одновременно (раннее или гибридное слияние). На выходе — вероятностное распределение по набору эмоциональных меток и уровень уверенности. Что делать с этим распределением — оповестить клинициста, подсказать продажнику, перенаправить звонок в поддержку или изменить рекомендацию контента — и есть сам продукт.

Планируете фичу с распознаванием эмоций и не знаете, с чего начать?

Расскажите нам про задачу — мы подскажем, подходит ли ваш кейс, с каких модальностей начать и какой реалистичный срок с учётом Agent Engineering.

Позвоните нам → Напишите нам →

Где распознавание эмоций реально окупается в 2026

Рынок аффективных вычислений, по прогнозам, вырастет с 5,7 трлн ₽ в 2025 году до 14,4 трлн ₽ к 2030 году при CAGR 20%. Более половины узкой части — emotion-AI — приходится на контакт-центры и инструменты клиентского опыта. Честно говоря, не каждой отрасли это нужно, но в пяти направлениях — точно нужно, и именно там у нас заключаются реальные сделки.

1. Телемедицина и behavioral health. Мультимодальные сигналы эмоций — вокальная просодия, лицевые микровыражения, лингвистические маркеры в транскрипте — помогают выявлять риск депрессии, тревожности и тяжесть ПТСР во время виртуальных консультаций и позволяют клиницистам лучше выстраивать темп сессии. Быстрее всего такие технологии внедряются на платформах, где уже есть видеовизиты.

2. Мониторинг водителя и салона. Регуляторы вынуждают развивать эту тему. Покупка Affectiva компанией Smart Eye в 2021 году за 5,5 млрд ₽ была мотивирована требованиями к мониторингу салона в автомобилях; камеры теперь отслеживают состояние водителя, уровень когнитивной нагрузки и признаки агрессивного вождения — всё это входит в состав систем безопасности.

3. Контакт-центры. Коучинг операторов в реальном времени по эмоциям в речи — Cogito, Observe.AI, Uniphore — стал стандартным инструментом корпоративной поддержки. Одномодальный SER достигает точности 80–90% на хорошо подобранных тренировочных данных, и этого достаточно, чтобы корректировать поведение оператора.

4. Корпоративный sales-интеллект. Платформы вроде Gong, Chorus и наш собственный Meetric анализируют активность менеджеров и особенности речи, чтобы помогать им в работе, оценивать звонки и автоматически заполнять CRM. Meetric сообщает о росте конверсии в сделку на 25% и о 80–100% автозаполнении CRM у компаний, внедривших систему.

5. Маркет-рисёрч, тестирование медиа и UX. Анализ тональности видеоинтервью в больших масштабах, тестирование рекламы на панелях и изучение реакций игроков — всё это возможно с помощью браузерных SDK для анализа лица (MorphCast, Realeyes). Им не нужны серверные вызовы, и они обходят многие споры вокруг биометрических данных. VocalViews использует именно такой подход на базе 185 000+ бизнес-пользователей.

Как устроен современный пайплайн распознавания эмоций

Каждая продакшен-система, которую мы строили или проверяли, следует одной и той же пятиэтапной структуре: захват, предобработка, извлечение признаков, классификация, действие. Рисунок 1 показывает типичный пайплайн.

Эталонный пайплайн мультимодального распознавания эмоций: захват, предобработка, извлечение признаков по модальностям, слияние, классификация, действие

Рисунок 1. Типовой пайплайн мультимодального распознавания эмоций в продакшене.

Этап 1. Захват

Видео с частотой 10–30 кадров в секунду — этого достаточно, потому что изменения мимики происходят медленнее, чем смена кадров. Аудио обычно записывается в формате 16 кГц моно PCM и буферизуется в фрагменты длительностью 20–100 мс для стримингового SER. Чтобы минимизировать задержку — например, в контакт-центрах или системах мониторинга водителя — лучше обрабатывать данные прямо на устройстве: отправка необработанной биометрии в облако увеличивает риски, связанные с GDPR и AI Act.

Этап 2. Предобработка

Для лица: детекция (MTCNN, RetinaFace, YOLOv8-face), выравнивание в каноническую позу, нормализация освещения. Для аудио: определение активности речи, обрезка пауз, шумоподавление, мел-спектрограмма или MFCC. Для текста: транскрипция с помощью продакшен-ASR (Whisper, Deepgram, AssemblyAI), затем токенизация. Именно на этом этапе определяется точность в реальных условиях: слабый детектор лиц при плохом освещении превращает результат классификатора в бессмыслицу.

Этап 3. Извлечение признаков

Современные системы в основном end-to-end: CNN или Vision Transformer поверх выровненных кропов лица; энкодеры Wav2Vec2, HuBERT или Whisper поверх сырого аудио; BERT-подобный энкодер поверх транскрипта. Признаки, спроектированные вручную (Action Units для лица, просодия для голоса), по-прежнему важны для интерпретируемости и для развёртываний на edge-устройствах с низкой задержкой, где ViT слишком тяжёл.

Этап 4. Классификация и объединение

Каждая модальность либо выдаёт своё распределение меток (позднее слияние с последующим взвешенным усреднением или небольшой gate-сетью), либо признаки разных модальностей объединяются и проходят через общий трансформер (раннее или гибридное слияние). Выбор зависит не от принципов, а от задачи — подробности см. в разделе «Мультимодальное слияние» ниже.

Этап 5. Действие

Именно здесь сосредоточена 90% продуктовой ценности — а 90% инженерных команд в это недоинвестируют. Метка — это не просто фича. Ей нужна калибровка, временное сглаживание (например, скользящее окно 3–10 секунд), логика подавления, чтобы избежать алёрт-усталости, и состояние согласия для каждого пользователя. Без этого слоя вы запустите демо, а не настоящий продукт.

Четыре модальности — сравнение

У каждого входного сигнала — свои сильные стороны, стоимость и возможные режимы отказа. В таблице ниже показаны компромиссы, характерные для выпускаемых систем.

Модальность Что фиксирует Типичный бенчмарк Реальность в проде Хорошо подходит для
Лицо (FER) Микро- и макровыражения, взгляд, поза головы 82–99% на AffectNet, CK+, RAF-DB 60–80% в полях, ошибка более 70% при окклюзии и изменении освещения Видеозвонки, маркетинговые исследования, контроль за водителем
Речь (SER) Просодия, высота, энергия, темп речи, качество голоса 84–97% на RAVDESS, EmoDB, IEMOCAP 65–80%, чувствителен к акценту и языку Колл-центры, IVR, аудиотелемедицина
Тональность текста Смысл, валентность, тема, намерение 85–93% на SST-2, MELD text Самая стабильная между контекстами, но плохо распознаёт сарказм Чаты, тикеты поддержки, разметка интервью
Физиология Пульс, GSR, ЭЭГ, дыхание 70–85% на DEAP, K-EmoCon Нужен носимый датчик; ограничено AI Act Клинические исследования, усталость водителя, VR UX-лаборатории
Мультимодальное слияние Любая комбинация перечисленного +3–8 п. п. по сравнению с лучшей одиночной модальностью Самая устойчивая к шуму реального мира Телемедицина: решения, где цена ошибки высока

Берите только лицо, если: у вас уже есть видеопоток, нужна задержка меньше 200 мс и согласие пользователя получено явно (например, в платном телемедицинском визите).

Берите только речь, если: вы работаете в колл-центре, клиенты не включают камеру или сам телефонный канал — это и есть ваш продукт.

Берите мультимодальный подход, если: цена ложного срабатывания высока (клиническая разметка, коучинг, безопасность), а среда — неконтролируемая.

Стратегии мультимодального слияния — без жаргона

Раннее слияние объединяет исходные или промежуточные признаки от каждой модальности и обучает один большой классификатор. Плюсы: модель учится взаимодействиям между модальностями целиком, обычно показывает лучшие результаты на тестах. Минусы: если пропадает одна модальность, это портит работу модели, обучение нестабильное, а задержка зависит от самой медленной ветви.

Позднее слияние обучает отдельный классификатор для каждой модальности, а затем объединяет их результаты — например, с помощью взвешенного усреднения, голосования или небольшого MLP-штольника. Плюсы: система работает стабильно, даже если одна из модальностей недоступна; легко тестировать новые модальности через A/B-тесты; это единственный реалистичный подход для гибридных систем «на краю» и в облаке. Минусы: в идеальных лабораторных условиях такой подход уступает по точности более сложным методам.

Гибридное (трансформерное) слияние использует cross-attention между энкодерами разных модальностей: текстовый декодер обращает внимание на аудиотокены, аудио — на токены лица и так далее. Это лучший результат (SOTA) в 2025–2026 годах на датасетах CMU-MOSEI и MELD. Прирост точности на 3–8 пунктов по сравнению с использованием одной модальности — норма; однако затраты на разработку и инференс высокие.

Начинайте с позднего слияния. Выпустите отдельный классификатор для каждой модальности, объедините их на уровне API и переходите к гибридному решению только если A/B-тест покажет, что вы реально теряете деньги.

Бенчмарк против реальности — неудобный разрыв

Вендоры обещают точность до 90%. Литература подтверждает это — на тщательно отобранных бенчмарках. Современные модели распознавания эмоций, прошедшие рецензирование, показывают 99,26% на CK+ и 82% на RAF-DB; ансамбли для распознавания эмоций превосходят 95% на RAVDESS и 96% на IEMOCAP. Это — верхняя граница.

Опубликованные in-the-wild оценки показывают рост ошибки более чем на 70% при искажениях, окклюзии, смене освещения или сдвиге распределения. На действительно невиданных пользователях и средах точность в продакшене падает в диапазон 60–80% и для лица, и для речи; сложные или социальные эмоции (смущение, презрение, сарказм) опускаются ниже 75% независимо от размера модели.

Что это значит для продуктовых решений: никогда не обещайте точные метки эмоций. Выдавайте вероятности с откалиброванной уверенностью, делайте пороги настраиваемыми параметрами и воспринимайте результат как один из сигналов. Мы создаём клиентские дашборды, где уверенность в эмоции комбинируется с длительностью сессии, порядком реплик и темой — итоговое решение принимается на основе агрегированной метрики.

Бенчмарк показывает 90%, а в продакшене — всего 65%?

Наша команда уже помогала с проваленными проектами по распознаванию эмоций — проводили аудит датасета, переразмечали данные и переобучали модели на гибридном слиянии. Расскажем, как помочь и вам.

Позвоните нам → Напишите нам →

Датасеты, которые нужно знать перед обучением

Если вы строите датасет — фича ваша. Если покупаете — датасет становится смещением, которое вы унаследуете. Каждый API-провайдер обучен на каком-то подмножестве этих корпусов, и его режимы отказа отражают именно этот факт.

Лицо

AffectNet — более миллиона спонтанных интернет-изображений, размеченных по 8 дискретным эмоциям, а также по валентности и уровню возбуждения. Основной стандарт в индустрии, но с преобладанием западных данных. FER-2013 — 35 тысяч изображений, разметка с шумом, но до сих пор считается каноническим бенчмарком. CK+ и JAFFE — лабораторные съёмки с актёрской игрой, завышают точность моделей. RAF-DB — данные из реальной жизни. AFEW — выражения лиц, вырезанные из фильмов. Aff-Wild2 — самый сильный датасет для анализа эмоций в естественных условиях, особенно по непрерывным шкалам валентности и возбуждения.

Речь

IEMOCAP — 12 часов записи, 10 дикторов, речь по сценарию и импровизированная, используется как бенчмарк для распознавания эмоций. RAVDESS — постановочный, сбалансирован по полу, часто применяется в исследованиях. EmoDB (на немецком), CREMA-Д (этнически сбалансированный), MELD (диалоги из телешоу). Все они ориентированы на английский или немецкий языки.

Мультимодальные

CMU-MOSEI и MELD объединяют данные с лица, аудио и текстовые транскрипты — это основной выбор для исследований по слиянию данных. DEAP и K-EmoCon дополнительно включают физиологические каналы.

Строить или покупать — матрица решений

Команды почти всегда недооценивают операционные расходы на поддержку модели и переоценивают стоимость перехода, если начинают с API. Ниже — общая схема, по которой мы работаем с клиентами.

Критерий Купить (API/SDK) Построить (custom)
Срок до первого пилота 2–4 недели 3–6 месяцев с Agent Engineering
Стартовая стоимость Низкая (интеграция + UX) Средняя (данные, разметка, инфраструктура)
Потолок точности Сколько даст вендор Выше — на вашей целевой аудитории
Контроль смещения Чёрный ящик, аудит возможен редко Аудит у вас в руках
Резиденция данных Регион вендора или on-device SDK Где хотите хостить
Операционные расходы Поминутная или поразовая тарификация растёт вместе с объёмом GPU-инфра, MLOps, циклы переобучения
Когда выигрывает Скорость, не-ключевая фича, стандартная вертикаль Конкурентное преимущество, нестандартная аудитория, edge и задержки, регуляторика

Берите гибридную сборку, если: готовая модель показывает 80% точности на вашей аудитории, а дообученный финальный слой и ваша логика слияния закрывают оставшиеся 20% — это, как правило, оптимальная точка.

Ландшафт API и SDK

Рынок сконцентрировался вокруг небольшого числа универсальных облачных API, специализированных поставщиков решений для распознавания голоса и лиц, браузерных SDK для обработки данных на устройстве и игроков, ориентированных на конкретные отрасли — например, автопром или контакт-центры. Таблица ниже отражает текущее положение дел для анализа при выборе поставщика. Цены указаны ориентировочно и обновляются ежеквартально — всегда уточняйте актуальные условия у вендора.

Вендор Модальность Развёртывание Цена (ориентировочно) Подходит для
AWS Rekognition Эмоции по лицу Облако ~0,07 ₽ за изображение, 7,5 ₽ за минуту видео Быстрые пилоты по лицу внутри AWS-инфраструктуры
Google Video Intelligence Лицо, детекция кадров Облако Поминутно, объёмные скидки Массовая разметка видео, пользователи GCP
Azure Face + Video Indexer Лицо + речь + тональность Облако За вызов / за минуту Корпоративные Azure-стеки; учтите вывод из эксплуатации API general-emotion
Hume AI Голос + просодия лица Облако, стриминг по WebSocket Поминутно, есть исследовательский тариф Мультимодальный анализ уровня research, выразительные голосовые интерфейсы
Affectiva / Smart Eye Лицо, мониторинг салона Встраиваемое решение / OEM По лицензии, индивидуально Автомобильный мониторинг водителя
MorphCast Лицо Браузерный JS SDK, on-device Подписка, SDK <1 МБ Маркет-исследование, электронное обучение, приватные сценарии
Realeyes Лицо + внимание Облако / SDK Корпоративные лицензии Тестирование рекламы, медиа-панели
Noldus FaceReader Лицо, единицы действия Десктоп Годовая лицензия Академические и поведенческие исследования
Symbl.ai / Deepgram / AssemblyAI Тональность речи, транскрипт Облако, стриминг Поминутный ASR + надстройка по тональности Встречи, звонки, стеки sales-интеллекта

Регулирование: EU AI Act изменил рынок в феврале 2025

Самый крупный регуляторный сдвиг в сфере распознавания эмоций произошёл незаметно: 2 февраля 2025 года вступила в силу статья 5(1)(f) EU AI Act, которая запрещает продавать, использовать и внедрять ИИ-системы, определяющие эмоции по биометрическим данным — лицу, голосу, походке и физиологическим сигналам на рабочих местах и в образовательных учреждениях. Исключения для медицинских целей и обеспечения безопасности сформулированы очень узко. Руководящие материалы по применению закона опубликованы 4 февраля 2025 года.

Несколько моментов, на которых спотыкаются продуктовые команды. Запрет действует независимо от страны штаб-квартиры вендора, если система предлагается людям в ЕС. Он распространяется не только на лицо, но и на голос. Реклама, клиентская аналитика и нерабочие потребительские сценарии не попадают под статью 5, но всё равно регулируются GDPR и правилами классификации высокорисковых систем в других частях акта.

За пределами ЕС: GDPR по-прежнему относит вывод по биометрии к специальной категории данных по статье 9 — то есть требуется явное согласие или иное чёткое правовое основание. В США законы, подобные BIPA (Иллинойс), создают реальные судебные риски (Clearview и Facebook заплатили девятизначные суммы по мировым соглашениям), и несколько штатов приняли аналогичные нормы. Великобритания и Канада в целом следуют подходу GDPR. Китай регулирует распознавание лиц отдельно; индийский DPDP Act требует согласия и ограничения цели обработки.

Практическое правило: если ваш продукт — B2B для работодателей или образовательных учреждений в ЕС, не используйте анализ эмоций сотрудников или учащихся. Точка. Вместо этого рассмотрите метрики вовлечённости и внимания — они ориентированы на задачу, а не на эмоции.

Смещение, справедливость и что на самом деле говорит наука

Самая важная работа в этой области — обзор Барретт, Адольфса, Марселлы, Мартинеса и Поллака 2019 года в Psychological Science in the Public Interest. Их вывод: связь между движением мышц лица и категорией эмоции гораздо слабее, чем считалось в индустрии. Люди улыбаются, не испытывая при этом счастья; выражения лица зависят от культуры, контекста и индивидуальных особенностей; «универсальные базовые эмоции» — это спорная модель, а не общепринятая научная теория.

В переводе на продуктовые риски: готовые API эмоций, обученные на западных, более молодых и мужскоцентричных датасетах, ошибаются на темнокожих женщинах, носителях восточноазиатских языков, пожилых пользователях и вообще на тех, чей выразительный идиом отличается от обучающего распределения — измеримо и воспроизводимо. Задокументированные аудиты показывают разрыв в точности на 5–20 пунктов между демографическими группами на одном и том же бенчмарке. Просите у вендоров отчёты по точности в разрезе демографии — большинство их не предоставят.

Меры, которые реально работают: сбалансированные обучающие данные (CREMA-D, CAER-S для лица, подмножество MELD для текста), постфактум-калибровочный слой для каждого демографического сегмента, список «не выводить эмоции для…» (найм, оценка эффективности, поведенческая медицина без участия клинициста) и постоянный мониторинг дрейфа. Бесплатного тут ничего нет. Зато всё это дешевле, чем коллективный иск.

Эталонная архитектура продакшен-системы

Рисунок 2 показывает архитектуру, с которой мы начинаем разработку мультимодальных emotion-aware продуктов. Мы намеренно выполняем лёгкий анализ по лицу на устройстве пользователя, а более сложные модели для речи и текста обращаемся к облаку — такой подход является оптимальным компромиссом для телемедицины, контакт-центров и систем анализа продаж.

Схема эталонной архитектуры: edge-инференс лица, облачные модели речи и текста, сервис слияния, feature store, слой согласия и аудита

Рисунок 2. Эталонная архитектура продакшена для мультимодального распознавания эмоций.

Неочевидные части: слой согласия и аудита, который добавляется к каждому инференсу (статус согласия пользователя, юрисдикция, feature flag), feature store с TTL 30 дней — чтобы при переобучении не приходилось заново собирать данные, и канал обратной связи, где операторы отмечают ложные срабатывания. Без такой обратной связи модели могут годами медленно ухудшаться.

Мини-кейс: чему нас научил запуск распознавания эмоций в продажах по видеосвязи

Ситуация. Скандинавская B2B-платформа для sales-аналитики хотела получать live-сигналы вовлечённости во время звонков в Zoom, Teams и Google Meet — не распознанные эмоции, а измеримые поведенческие признаки (внимание, согласие, замешательство), которые можно было бы сразу передать менеджеру прямо в ходе разговора.

12-недельный план. Недели 1–2: поток согласий, мост кросс-платформенного захвата. Недели 3–6: пайплайн анализа интонации речи на базе Whisper + лёгкая SER-голова, плюс оценка вовлечённости по мимике (взгляд, улыбка, движение бровей) через WASM-модель на устройстве. Недели 7–9: позднее объединение в общий показатель вовлечённости, настройка порогов на реальных клиентских звонках. Недели 10–12: UX-коучинг менеджера во время звонка, краткое резюме после звонка, выгрузка данных в CRM.

Результат. Конверсия в сделку выросла на 25% по сравнению с базовым периодом до запуска; 80–100% полей в CRM автозаполняются на основе данных звонка и эмоциональных сигналов; менеджеры стали больше доверять engagement-скору, когда мы заменили оценки «счастливый / грустный» на более точные — «внимательный» и «возражающий». Продукт работает как Meetric. Если нужна похожая оценка вашего стека — звоните или пишите.

Модель стоимости — как выглядит реальный проект

Цифры ниже основаны на нашей ускоренной доставке через Agent Engineering: наши AI-решения внедряются быстрее и проще, чем при традиционной аутсорсинговой модели. Это ориентировочные диапазоны, а не коммерческое предложение; точные суммы зависят от вашего технологического стека, доступа к данным и требований по комплаенсу.

Объём работ Типичная длительность Стоимость сборки Операционные расходы
Интеграция API (лицо или речь) 3–6 недель 1,5–4,5 млн ₽ Платежи вендору API растут с объёмом
Мультимодальный MVP на вашем видеостеке 8–14 недель 4,5–12 млн ₽ Смешанная оплата за API + умеренная GPU-инфраструктура
Custom-модель со слиянием и дообучением 4–8 месяцев 11–33 млн ₽ GPU-кластер, MLOps, абонемент на разметку
Регулируемый клинический запуск (близкий к SaMD) 6–12 месяцев 22–67 млн ₽ Аудит, ревалидация, клинические операции

Наш опыт: лучший ROI большинство покупателей получают от первых двух строк, а дообучение поверх — только когда появляются реальные продакшен-данные и конкретный режим отказа, который нужно закрыть.

Фреймворк решений — выбор пути за пять вопросов

1. Кто субъект? Клиенты, пациенты, учащиеся, сотрудники, водители или широкая публика? Если речь идёт о сотрудниках или учащихся в ЕС — остановитесь и пересмотрите объём: применяется статья 5.

2. Какое решение управляется сигналом? Это подсказка пользователю, решение о нём или что-то между ними? Решения, касающиеся людей — например, приём на работу, выдача кредита или клиническая сортировка — резко повышают регуляторные и этические требования. Подсказки и рекомендации несут куда меньший риск.

3. Какая модальность у вас уже есть? Если у вас есть видеопоток (телемедицина, sales-звонок), связка «лицо + голос» — недорогая; если есть только телефонный номер, скорее всего, правильный объём — SER.

4. Насколько необычна ваша аудитория? Дети, пожилые люди, люди в масках, носители других языков, с акцентом? Чем нестандартнее аудитория — тем больше нужен собственный пайплайн данных и тем меньше можно доверять заявленной точности готовых решений.

5. Какова ваша терпимость к ложным срабатываниям? Они есть у любой emotion-системы. Если ложная пометка «в дистрессе» для клинициста допустима — продолжайте; если та же пометка вызывает автоматическое действие с серьёзными последствиями, не запускайте систему без участия человека.

Ошибки, которые мы всё ещё видим

1. Категорические метки в UI. «Пользователь зол» — это хуже для UX, чем «тон голоса повышается, менеджеру стоит говорить спокойнее». Показывайте уровень уверенности и поведенческие сигналы, а не дискретные категории эмоций.

2. Пропуск слоя согласия. GDPR (статья 9) и AI Act требуют индивидуального согласия на биометрическую обработку — и пользователи могут его отозвать. Если ваша система не позволяет отключить анализ данных одного пользователя без обновления — это нарушение требований.

3. Восприятие демографического разрыва как ошибки округления. Падение точности на 15 пунктов в одной этнической группе — это не случайный шум, а повод для судебного иска. Проводите аудит ежеквартально, обновляйте обучающие данные, выпускайте внутренние отчёты по точности.

4. Игнорирование временного контекста. Классификация по одному кадру или одной реплике ненадёжна. Используйте сглаживание в окне 3–10 секунд, придавайте больший вес более свежим кадрам и требуйте устойчивости сигнала для срабатывания.

5. Недостаточное инструментирование. Emotion AI со временем теряет точность. Если вы не логируете предсказания, эталонные данные (где это возможно) и обратную связь от пользователей — проблему обнаружите только тогда, когда её заметят регулятор или клиент.

KPI: что измерять

KPI качества. Точность и полнота по классам на отложенной выборке из продакшена (цель — F1 ≥ 0,75 для основного класса). Демографическая парность: разница в точности не более 5 пунктов по расе, полу и возрастным группам. Ошибка калибровки (ECE) ≤ 0,05.

KPI бизнеса. Уровень подключения фичи, доля пользователей, использующих подсказку (проверяем, кто вообще ею пользуется), рост конверсии или улучшение результата в контролируемом запуске, доля согласившихся (здоровый поток согласия — 40–70%).

KPI надёжности. P95-задержка инференса (цель — <250 мс для real-time UX), алёрты дрейфа модели (еженедельные проверки распределения), частота инцидентов с ложными эскалациями и время отката версии модели.

Когда НЕ использовать распознавание эмоций

Не выпускайте фичу, если выполняется хотя бы одно из следующих условий. (а) Ваш кейс — сотрудники или учащиеся в ЕС, а вы не попадаете под медицинское или исключение по безопасности. (б) Сигнал должен принимать решение о человеке без участия человека в процессе. (в) Нет способа собрать сбалансированные по демографии данные для оценки — вы получите смещённый результат и не заметите этого. (г) Продукт уже работает; распознавание эмоций добавляется просто потому, что это модно. Стоп.

В большинстве этих случаев лучше выбрать поведенческую метрику — соотношение talk time, детекция тишины, латентность ответа, извлечение ключевых слов. Это дешевле, стабильнее и гораздо меньше регулируется.

Готовы протестировать распознавание эмоций или отслеживание вовлечённости для вашего продукта?

Проведём аудит вашего видео- и аудиостека, подскажем оптимальную модальность, оценим интеграцию с Agent Engineering и подготовим one-pager, который можно представить совету директоров.

Позвоните нам → Напишите нам →

FAQ

Насколько точно распознавание эмоций в аудио и видео работает на практике?

На курируемых бенчмарках современные модели достигают 82–99% по распознаванию лиц и 84–97% по речи. В реальных условиях (продакшен) точность для одной модальности обычно составляет 60–80%. Будьте готовы к резкому падению точности — на 70 пунктов и более — при изменении освещения, частичной закрытости объекта, акцентах или сдвиге в демографическом составе. Мультимодальное объединение данных обычно повышает точность на 3–8 пунктов по сравнению с лучшей одиночной модальностью.

Законно ли распознавание эмоций в ЕС?

Со 2 февраля 2025 года по статье 5(1)(f) EU AI Act запрещены ИИ-системы, распознающие эмоции по биометрическим данным на рабочих местах и в образовательных учреждениях. Исключения для медицинских и safety-применений сформулированы узко. Контексты, связанные с клиентами и потребителями, не попадают под статью 5, но остаются под контролем GDPR и других требований AI Act.

Строить свою модель или использовать API?

Начинайте с API или SDK. Создавайте или дообучайте модель, только если производительность готового решения на вашей аудитории явно недостаточна, у вас есть уникальные обучающие данные или требования к хранению данных и задержкам не позволяют использовать сторонние эндпойнты. Большинство наших развёртываний стартуют как интеграция API и переходят к гибридному варианту (дообученная голова + собственное слияние) только после замеров реального базового уровня.

Сколько стоит добавить распознавание эмоций в видеопродукт?

Интеграция API для одной модальности обычно стоит 1,5–4,5 млн ₽ и занимает 3–6 недель. Мультимодальный MVP на существующем видеостеке — 4,5–12 млн ₽ и 8–14 недель. Кастомная модель со слиянием и дообучением — 11–33 млн ₽ и 4–8 месяцев. Указанные диапазоны рассчитаны при нашей доставке и ускорённой разработке агентов (Agent Engineering).

На каких датасетах обучать?

Для лица: AffectNet и RAF-DB — как основа, Aff-Wild2 — для оценки валентности и возбуждения в реальных условиях, CREMA-Д — для более сбалансированной аудио- и видеоразметки по демографическим признакам. Для речи: IEMOCAP и RAVDESS — для тестирования моделей, MELD — для анализа разговорной речи. Для мультимодального анализа: CMU-MOSEI и MELD. Комбинируйте с собственными размеченными данными из продакшена — ни один публичный датасет не является глобально репрезентативным.

Как работать со смещением и справедливостью?

Запрашивайте у поставщиков разбивку точности по демографическим группам; настаивайте на сбалансированном обучении или калибровке по сегментам после обучения; проводите ежеквартальный аудит на реальных данных из продакшена; ограничивайте разницу в точности по расе, полу и возрасту не более чем 5 процентными пунктами; выпускайте внутренние отчёты об точности. Готовьтесь к переразметке и переобучению моделей минимум раз в год.

Можно ли запускать распознавание эмоций на устройстве ради приватности?

Да, всё больше. Браузерные SDK вроде MorphCast выполняют анализ лица прямо в браузере (на базе WASM/WebGL) с моделью объёмом менее 1 МБ, не отправляя биометрические данные на сервер. Мобильные фреймворки — Core ML, TensorFlow Lite, ONNX — позволяют запускать квантизованные модели распознавания лиц или речи непосредственно на устройстве. Точность таких решений на 5–10 пунктов ниже, чем у облачных аналогов, но выигрыш в приватности и скорости работы обычно это компенсирует.

Сколько реально занимает внедрение?

API-пилот — 2–4 недели; готовая к продакшену мультимодальная фича со слоем согласия, мониторингом и калибровкой — 10–16 недель; регулируемый клинический или safety-деплой — 6–12 месяцев, включая аудиты и ревалидацию. Agent Engineering заметно сокращает каждый из этих этапов по сравнению с классическим аутсорсингом.

Распознавание эмоций в реальном времени

Real-Time AI Emotion Software

Подробнее о live-сигналах аффекта в видеозвонках и контакт-центрах.

Эмоции в речи

Audio Emotion Detection System Using AI

Как строятся SER-пайплайны end-to-end и какие признаки выбирают.

Эмоции по лицу

Machine Learning for Video Emotion Analysis

Сфокусированный обзор лицевой части пайплайна: модели, датасеты, развёртывание.

Видеоконференции

AI Emotion Detection in Video Conferences

Продуктовые шаблоны для интеграции аффект-сигналов в Zoom, Teams и Meet.

Услуги

Услуги Фора Софт по интеграции ИИ

Наш стек, кейсы и быстрый путь к оценке AI-проекта вместе с нами.

Готовы запустить распознавание эмоций, которое работает стабильно в продакшене?

Короткий ответ на вопрос «стоит ли добавлять распознавание эмоций в аудио и видео?» — только если это делает решение дешевле, безопаснее или лучше. И только после того, как вы выбрали модальность, поставщика или модель, а также определились с применимым комплаенс-режимом. Проблемы с отказами предсказуемы: переоценка по бенчмаркам, демографическое смещение, пробелы в согласиях, мёртвые метки вместо живых сигналов — и каждую из них можно решить инженерными методами, а не отказом от технологии.

Фора Софт выпускала AI-решения для распознавания эмоций в рекламных видео, видеомаркетинговых исследованиях, телемедицинских платформах и системах поведенческого видеонаблюдения. Мы знаем, где возникают риски, сколько времени реально займёт разработка через Agent Engineering, и честно скажем, когда правильнее отказаться от идеи. Если вам нужен такой разговор — звоните или пишите.

Получите второе мнение по распознаванию эмоций в аудио и видео

Кратко обсудим задачу, определим объём и диапазон стоимости, дадим честный совет — строить, покупать или отложить фичу.

Позвоните нам → Напишите нам →

  • Технологии