Распознавание эмоций по голосу и видео: полное руководство на 2026 год
Главное
• Распознавание эмоций по аудио и видео — это мультимодальная задача машинного обучения, а не работа одной модели. Самые эффективные системы используют лицо, голос, текст и иногда физиологические данные — каждый из этих сигналов помогает компенсировать недостатки других.
• Заявленная точность вводит в заблуждение. Бенчмарк-метрики 90–99% в продакшене падают до 60–80%, а в реальных условиях съёмки — при акцентах, окклюзии и демографическом сдвиге — ошибка может превышать 70%.
• EU AI Act с 2 февраля 2025 года запрещает большинство случаев распознавания эмоций на рабочих местах и в образовательных учреждениях. Если ваш продукт затрагивает сотрудников или учащихся в ЕС — пересматривайте функционал или отключайте эту возможность: исключения для медицинских и safety-целей сформулированы очень узко.
• Сначала покупайте, стройте только если модель — ваше конкурентное преимущество. Готовые API (AWS, Google, Azure, Hume, MorphCast, Affectiva) подключаются за несколько недель; создание собственного мультимодального стека займёт 4–9 месяцев с применением Agent Engineering и окупится только при действительно нестандартных данных, узкой отрасли или жёстких требованиях к задержке.
• Этика — главный риск доставки. Согласия пользователей, проверки на смещение, отчёты о точности по демографическим группам и чёткий список «не использовать для…» — вот что позволяет фиче остаться в продукте после запуска, а не архитектура модели.
Зачем Фора Софт написала это руководство
Распознавание эмоций в аудио и видео находится на пересечении трёх направлений, которыми мы занимаемся уже два десятилетия: коммуникации в реальном времени, компьютерное зрение и прикладное машинное обучение. Мы создаём видеоплатформы для продакшена в телемедицине, edtech, прямых трансляциях, видеонаблюдении и корпоративных продажах — это как раз те сферы, где вопрос «выглядит ли пользователь напряжённым, отстранённым или встревоженным?» перестаёт быть исследовательским и становится реальной функцией продукта.
Наша практика интеграции ИИ включает отдельную услугу Emotion Recognition Dynamics — мы анализируем эмоции на лицах в видео в реальном времени с помощью Azure Cognitive Services, OpenCV, MediaPipe, YOLO, PyTorch и TensorFlow и связываем эти данные с действиями пользователей. Платформа sales-аналитики Meetric объединяет голосовые и поведенческие сигналы во время живых звонков и повышает конверсию в сделку примерно на четверть. VocalViews, которым пользуются исследовательские команды Samsung, Google и Netflix, накладывает ИИ-анализ тональности на видеоинтервью на 30+ языках для более чем 800 000 верифицированных участников. Платформа видеонаблюдения V. A. L. T. работает с HD-видео и поведенческой аналитикой на 2500+ камерах и обслуживает 50 000 пользователей в день в правоохранительной сфере и медицинском образовании.
Дальше — руководство, которого нам не хватало в первый день: как устроены такие пайплайны на самом деле, какие датасеты и API важны, что регулируется, что может пойти не так в продакшене и какие цифры нужны покупателю, чтобы трезво решить: делать самому или покупать. Текст ориентирован на тех, кто будет выкатывать эту фичу, а не писать о ней статью.
Что такое распознавание эмоций в аудио и видео
«Распознавание эмоций» — общий термин для систем, которые определяют эмоциональное состояние (счастье, грусть, гнев, страх, удивление, отвращение, презрение, а также непрерывные шкалы валентности и возбуждения) по видео с лицом, аудиозаписи речи, текстовым транскриптам или физиологическим сигналам. В научной литературе это также называют аффективными вычислениями, распознаванием аффекта или мультимодальным распознаванием эмоций (multimodal emotion recognition, MER).
Коммерческая постановка задачи уже определена. Обычно команды выпускают одно из четырёх: классификацию лицевых выражений в видеопотоке, распознавание эмоций по речи (speech emotion recognition, SER) на микрофонном фиде, анализ тональности по транскрибированному тексту или мультимодальный классификатор со слиянием, объединяющий две-три из этих модальностей. Исследовательское поле добавляет биосигналы (ЭЭГ, пульс, кожно-гальваническая реакция), но они редко выходят за пределы лабораторий, а EU AI Act теперь отдельно ограничивает их использование на рабочем месте.
Полезная ментальная модель: пайплайн берёт аудиовизуальный фрагмент, извлекает признаки для каждой модальности отдельно, обрабатывает их отдельной моделью и затем либо объединяет результаты по принципу мажоритарного голосования (позднее слияние), либо обучается на всех модальностях одновременно (раннее или гибридное слияние). На выходе — вероятностное распределение по набору эмоциональных меток и уровень уверенности. Что делать с этим распределением — оповестить клинициста, подсказать продажнику, перенаправить звонок в поддержку или изменить рекомендацию контента — и есть сам продукт.
Планируете фичу с распознаванием эмоций и не знаете, с чего начать?
Расскажите нам про задачу — мы подскажем, подходит ли ваш кейс, с каких модальностей начать и какой реалистичный срок с учётом Agent Engineering.
Где распознавание эмоций реально окупается в 2026
Рынок аффективных вычислений, по прогнозам, вырастет с 5,7 трлн ₽ в 2025 году до 14,4 трлн ₽ к 2030 году при CAGR 20%. Более половины узкой части — emotion-AI — приходится на контакт-центры и инструменты клиентского опыта. Честно говоря, не каждой отрасли это нужно, но в пяти направлениях — точно нужно, и именно там у нас заключаются реальные сделки.
1. Телемедицина и behavioral health. Мультимодальные сигналы эмоций — вокальная просодия, лицевые микровыражения, лингвистические маркеры в транскрипте — помогают выявлять риск депрессии, тревожности и тяжесть ПТСР во время виртуальных консультаций и позволяют клиницистам лучше выстраивать темп сессии. Быстрее всего такие технологии внедряются на платформах, где уже есть видеовизиты.
2. Мониторинг водителя и салона. Регуляторы вынуждают развивать эту тему. Покупка Affectiva компанией Smart Eye в 2021 году за 5,5 млрд ₽ была мотивирована требованиями к мониторингу салона в автомобилях; камеры теперь отслеживают состояние водителя, уровень когнитивной нагрузки и признаки агрессивного вождения — всё это входит в состав систем безопасности.
3. Контакт-центры. Коучинг операторов в реальном времени по эмоциям в речи — Cogito, Observe.AI, Uniphore — стал стандартным инструментом корпоративной поддержки. Одномодальный SER достигает точности 80–90% на хорошо подобранных тренировочных данных, и этого достаточно, чтобы корректировать поведение оператора.
4. Корпоративный sales-интеллект. Платформы вроде Gong, Chorus и наш собственный Meetric анализируют активность менеджеров и особенности речи, чтобы помогать им в работе, оценивать звонки и автоматически заполнять CRM. Meetric сообщает о росте конверсии в сделку на 25% и о 80–100% автозаполнении CRM у компаний, внедривших систему.
5. Маркет-рисёрч, тестирование медиа и UX. Анализ тональности видеоинтервью в больших масштабах, тестирование рекламы на панелях и изучение реакций игроков — всё это возможно с помощью браузерных SDK для анализа лица (MorphCast, Realeyes). Им не нужны серверные вызовы, и они обходят многие споры вокруг биометрических данных. VocalViews использует именно такой подход на базе 185 000+ бизнес-пользователей.
Как устроен современный пайплайн распознавания эмоций
Каждая продакшен-система, которую мы строили или проверяли, следует одной и той же пятиэтапной структуре: захват, предобработка, извлечение признаков, классификация, действие. Рисунок 1 показывает типичный пайплайн.
Рисунок 1. Типовой пайплайн мультимодального распознавания эмоций в продакшене.
Этап 1. Захват
Видео с частотой 10–30 кадров в секунду — этого достаточно, потому что изменения мимики происходят медленнее, чем смена кадров. Аудио обычно записывается в формате 16 кГц моно PCM и буферизуется в фрагменты длительностью 20–100 мс для стримингового SER. Чтобы минимизировать задержку — например, в контакт-центрах или системах мониторинга водителя — лучше обрабатывать данные прямо на устройстве: отправка необработанной биометрии в облако увеличивает риски, связанные с GDPR и AI Act.
Этап 2. Предобработка
Для лица: детекция (MTCNN, RetinaFace, YOLOv8-face), выравнивание в каноническую позу, нормализация освещения. Для аудио: определение активности речи, обрезка пауз, шумоподавление, мел-спектрограмма или MFCC. Для текста: транскрипция с помощью продакшен-ASR (Whisper, Deepgram, AssemblyAI), затем токенизация. Именно на этом этапе определяется точность в реальных условиях: слабый детектор лиц при плохом освещении превращает результат классификатора в бессмыслицу.
Этап 3. Извлечение признаков
Современные системы в основном end-to-end: CNN или Vision Transformer поверх выровненных кропов лица; энкодеры Wav2Vec2, HuBERT или Whisper поверх сырого аудио; BERT-подобный энкодер поверх транскрипта. Признаки, спроектированные вручную (Action Units для лица, просодия для голоса), по-прежнему важны для интерпретируемости и для развёртываний на edge-устройствах с низкой задержкой, где ViT слишком тяжёл.
Этап 4. Классификация и объединение
Каждая модальность либо выдаёт своё распределение меток (позднее слияние с последующим взвешенным усреднением или небольшой gate-сетью), либо признаки разных модальностей объединяются и проходят через общий трансформер (раннее или гибридное слияние). Выбор зависит не от принципов, а от задачи — подробности см. в разделе «Мультимодальное слияние» ниже.
Этап 5. Действие
Именно здесь сосредоточена 90% продуктовой ценности — а 90% инженерных команд в это недоинвестируют. Метка — это не просто фича. Ей нужна калибровка, временное сглаживание (например, скользящее окно 3–10 секунд), логика подавления, чтобы избежать алёрт-усталости, и состояние согласия для каждого пользователя. Без этого слоя вы запустите демо, а не настоящий продукт.
Четыре модальности — сравнение
У каждого входного сигнала — свои сильные стороны, стоимость и возможные режимы отказа. В таблице ниже показаны компромиссы, характерные для выпускаемых систем.
| Модальность | Что фиксирует | Типичный бенчмарк | Реальность в проде | Хорошо подходит для |
|---|---|---|---|---|
| Лицо (FER) | Микро- и макровыражения, взгляд, поза головы | 82–99% на AffectNet, CK+, RAF-DB | 60–80% в полях, ошибка более 70% при окклюзии и изменении освещения | Видеозвонки, маркетинговые исследования, контроль за водителем |
| Речь (SER) | Просодия, высота, энергия, темп речи, качество голоса | 84–97% на RAVDESS, EmoDB, IEMOCAP | 65–80%, чувствителен к акценту и языку | Колл-центры, IVR, аудиотелемедицина |
| Тональность текста | Смысл, валентность, тема, намерение | 85–93% на SST-2, MELD text | Самая стабильная между контекстами, но плохо распознаёт сарказм | Чаты, тикеты поддержки, разметка интервью |
| Физиология | Пульс, GSR, ЭЭГ, дыхание | 70–85% на DEAP, K-EmoCon | Нужен носимый датчик; ограничено AI Act | Клинические исследования, усталость водителя, VR UX-лаборатории |
| Мультимодальное слияние | Любая комбинация перечисленного | +3–8 п. п. по сравнению с лучшей одиночной модальностью | Самая устойчивая к шуму реального мира | Телемедицина: решения, где цена ошибки высока |
Берите только лицо, если: у вас уже есть видеопоток, нужна задержка меньше 200 мс и согласие пользователя получено явно (например, в платном телемедицинском визите).
Берите только речь, если: вы работаете в колл-центре, клиенты не включают камеру или сам телефонный канал — это и есть ваш продукт.
Берите мультимодальный подход, если: цена ложного срабатывания высока (клиническая разметка, коучинг, безопасность), а среда — неконтролируемая.
Стратегии мультимодального слияния — без жаргона
Раннее слияние объединяет исходные или промежуточные признаки от каждой модальности и обучает один большой классификатор. Плюсы: модель учится взаимодействиям между модальностями целиком, обычно показывает лучшие результаты на тестах. Минусы: если пропадает одна модальность, это портит работу модели, обучение нестабильное, а задержка зависит от самой медленной ветви.
Позднее слияние обучает отдельный классификатор для каждой модальности, а затем объединяет их результаты — например, с помощью взвешенного усреднения, голосования или небольшого MLP-штольника. Плюсы: система работает стабильно, даже если одна из модальностей недоступна; легко тестировать новые модальности через A/B-тесты; это единственный реалистичный подход для гибридных систем «на краю» и в облаке. Минусы: в идеальных лабораторных условиях такой подход уступает по точности более сложным методам.
Гибридное (трансформерное) слияние использует cross-attention между энкодерами разных модальностей: текстовый декодер обращает внимание на аудиотокены, аудио — на токены лица и так далее. Это лучший результат (SOTA) в 2025–2026 годах на датасетах CMU-MOSEI и MELD. Прирост точности на 3–8 пунктов по сравнению с использованием одной модальности — норма; однако затраты на разработку и инференс высокие.
Начинайте с позднего слияния. Выпустите отдельный классификатор для каждой модальности, объедините их на уровне API и переходите к гибридному решению только если A/B-тест покажет, что вы реально теряете деньги.
Бенчмарк против реальности — неудобный разрыв
Вендоры обещают точность до 90%. Литература подтверждает это — на тщательно отобранных бенчмарках. Современные модели распознавания эмоций, прошедшие рецензирование, показывают 99,26% на CK+ и 82% на RAF-DB; ансамбли для распознавания эмоций превосходят 95% на RAVDESS и 96% на IEMOCAP. Это — верхняя граница.
Опубликованные in-the-wild оценки показывают рост ошибки более чем на 70% при искажениях, окклюзии, смене освещения или сдвиге распределения. На действительно невиданных пользователях и средах точность в продакшене падает в диапазон 60–80% и для лица, и для речи; сложные или социальные эмоции (смущение, презрение, сарказм) опускаются ниже 75% независимо от размера модели.
Что это значит для продуктовых решений: никогда не обещайте точные метки эмоций. Выдавайте вероятности с откалиброванной уверенностью, делайте пороги настраиваемыми параметрами и воспринимайте результат как один из сигналов. Мы создаём клиентские дашборды, где уверенность в эмоции комбинируется с длительностью сессии, порядком реплик и темой — итоговое решение принимается на основе агрегированной метрики.
Бенчмарк показывает 90%, а в продакшене — всего 65%?
Наша команда уже помогала с проваленными проектами по распознаванию эмоций — проводили аудит датасета, переразмечали данные и переобучали модели на гибридном слиянии. Расскажем, как помочь и вам.
Датасеты, которые нужно знать перед обучением
Если вы строите датасет — фича ваша. Если покупаете — датасет становится смещением, которое вы унаследуете. Каждый API-провайдер обучен на каком-то подмножестве этих корпусов, и его режимы отказа отражают именно этот факт.
Лицо
AffectNet — более миллиона спонтанных интернет-изображений, размеченных по 8 дискретным эмоциям, а также по валентности и уровню возбуждения. Основной стандарт в индустрии, но с преобладанием западных данных. FER-2013 — 35 тысяч изображений, разметка с шумом, но до сих пор считается каноническим бенчмарком. CK+ и JAFFE — лабораторные съёмки с актёрской игрой, завышают точность моделей. RAF-DB — данные из реальной жизни. AFEW — выражения лиц, вырезанные из фильмов. Aff-Wild2 — самый сильный датасет для анализа эмоций в естественных условиях, особенно по непрерывным шкалам валентности и возбуждения.
Речь
IEMOCAP — 12 часов записи, 10 дикторов, речь по сценарию и импровизированная, используется как бенчмарк для распознавания эмоций. RAVDESS — постановочный, сбалансирован по полу, часто применяется в исследованиях. EmoDB (на немецком), CREMA-Д (этнически сбалансированный), MELD (диалоги из телешоу). Все они ориентированы на английский или немецкий языки.
Мультимодальные
CMU-MOSEI и MELD объединяют данные с лица, аудио и текстовые транскрипты — это основной выбор для исследований по слиянию данных. DEAP и K-EmoCon дополнительно включают физиологические каналы.
Строить или покупать — матрица решений
Команды почти всегда недооценивают операционные расходы на поддержку модели и переоценивают стоимость перехода, если начинают с API. Ниже — общая схема, по которой мы работаем с клиентами.
| Критерий | Купить (API/SDK) | Построить (custom) |
|---|---|---|
| Срок до первого пилота | 2–4 недели | 3–6 месяцев с Agent Engineering |
| Стартовая стоимость | Низкая (интеграция + UX) | Средняя (данные, разметка, инфраструктура) |
| Потолок точности | Сколько даст вендор | Выше — на вашей целевой аудитории |
| Контроль смещения | Чёрный ящик, аудит возможен редко | Аудит у вас в руках |
| Резиденция данных | Регион вендора или on-device SDK | Где хотите хостить |
| Операционные расходы | Поминутная или поразовая тарификация растёт вместе с объёмом | GPU-инфра, MLOps, циклы переобучения |
| Когда выигрывает | Скорость, не-ключевая фича, стандартная вертикаль | Конкурентное преимущество, нестандартная аудитория, edge и задержки, регуляторика |
Берите гибридную сборку, если: готовая модель показывает 80% точности на вашей аудитории, а дообученный финальный слой и ваша логика слияния закрывают оставшиеся 20% — это, как правило, оптимальная точка.
Ландшафт API и SDK
Рынок сконцентрировался вокруг небольшого числа универсальных облачных API, специализированных поставщиков решений для распознавания голоса и лиц, браузерных SDK для обработки данных на устройстве и игроков, ориентированных на конкретные отрасли — например, автопром или контакт-центры. Таблица ниже отражает текущее положение дел для анализа при выборе поставщика. Цены указаны ориентировочно и обновляются ежеквартально — всегда уточняйте актуальные условия у вендора.
| Вендор | Модальность | Развёртывание | Цена (ориентировочно) | Подходит для |
|---|---|---|---|---|
| AWS Rekognition | Эмоции по лицу | Облако | ~0,07 ₽ за изображение, 7,5 ₽ за минуту видео | Быстрые пилоты по лицу внутри AWS-инфраструктуры |
| Google Video Intelligence | Лицо, детекция кадров | Облако | Поминутно, объёмные скидки | Массовая разметка видео, пользователи GCP |
| Azure Face + Video Indexer | Лицо + речь + тональность | Облако | За вызов / за минуту | Корпоративные Azure-стеки; учтите вывод из эксплуатации API general-emotion |
| Hume AI | Голос + просодия лица | Облако, стриминг по WebSocket | Поминутно, есть исследовательский тариф | Мультимодальный анализ уровня research, выразительные голосовые интерфейсы |
| Affectiva / Smart Eye | Лицо, мониторинг салона | Встраиваемое решение / OEM | По лицензии, индивидуально | Автомобильный мониторинг водителя |
| MorphCast | Лицо | Браузерный JS SDK, on-device | Подписка, SDK <1 МБ | Маркет-исследование, электронное обучение, приватные сценарии |
| Realeyes | Лицо + внимание | Облако / SDK | Корпоративные лицензии | Тестирование рекламы, медиа-панели |
| Noldus FaceReader | Лицо, единицы действия | Десктоп | Годовая лицензия | Академические и поведенческие исследования |
| Symbl.ai / Deepgram / AssemblyAI | Тональность речи, транскрипт | Облако, стриминг | Поминутный ASR + надстройка по тональности | Встречи, звонки, стеки sales-интеллекта |
Регулирование: EU AI Act изменил рынок в феврале 2025
Самый крупный регуляторный сдвиг в сфере распознавания эмоций произошёл незаметно: 2 февраля 2025 года вступила в силу статья 5(1)(f) EU AI Act, которая запрещает продавать, использовать и внедрять ИИ-системы, определяющие эмоции по биометрическим данным — лицу, голосу, походке и физиологическим сигналам на рабочих местах и в образовательных учреждениях. Исключения для медицинских целей и обеспечения безопасности сформулированы очень узко. Руководящие материалы по применению закона опубликованы 4 февраля 2025 года.
Несколько моментов, на которых спотыкаются продуктовые команды. Запрет действует независимо от страны штаб-квартиры вендора, если система предлагается людям в ЕС. Он распространяется не только на лицо, но и на голос. Реклама, клиентская аналитика и нерабочие потребительские сценарии не попадают под статью 5, но всё равно регулируются GDPR и правилами классификации высокорисковых систем в других частях акта.
За пределами ЕС: GDPR по-прежнему относит вывод по биометрии к специальной категории данных по статье 9 — то есть требуется явное согласие или иное чёткое правовое основание. В США законы, подобные BIPA (Иллинойс), создают реальные судебные риски (Clearview и Facebook заплатили девятизначные суммы по мировым соглашениям), и несколько штатов приняли аналогичные нормы. Великобритания и Канада в целом следуют подходу GDPR. Китай регулирует распознавание лиц отдельно; индийский DPDP Act требует согласия и ограничения цели обработки.
Практическое правило: если ваш продукт — B2B для работодателей или образовательных учреждений в ЕС, не используйте анализ эмоций сотрудников или учащихся. Точка. Вместо этого рассмотрите метрики вовлечённости и внимания — они ориентированы на задачу, а не на эмоции.
Смещение, справедливость и что на самом деле говорит наука
Самая важная работа в этой области — обзор Барретт, Адольфса, Марселлы, Мартинеса и Поллака 2019 года в Psychological Science in the Public Interest. Их вывод: связь между движением мышц лица и категорией эмоции гораздо слабее, чем считалось в индустрии. Люди улыбаются, не испытывая при этом счастья; выражения лица зависят от культуры, контекста и индивидуальных особенностей; «универсальные базовые эмоции» — это спорная модель, а не общепринятая научная теория.
В переводе на продуктовые риски: готовые API эмоций, обученные на западных, более молодых и мужскоцентричных датасетах, ошибаются на темнокожих женщинах, носителях восточноазиатских языков, пожилых пользователях и вообще на тех, чей выразительный идиом отличается от обучающего распределения — измеримо и воспроизводимо. Задокументированные аудиты показывают разрыв в точности на 5–20 пунктов между демографическими группами на одном и том же бенчмарке. Просите у вендоров отчёты по точности в разрезе демографии — большинство их не предоставят.
Меры, которые реально работают: сбалансированные обучающие данные (CREMA-D, CAER-S для лица, подмножество MELD для текста), постфактум-калибровочный слой для каждого демографического сегмента, список «не выводить эмоции для…» (найм, оценка эффективности, поведенческая медицина без участия клинициста) и постоянный мониторинг дрейфа. Бесплатного тут ничего нет. Зато всё это дешевле, чем коллективный иск.
Эталонная архитектура продакшен-системы
Рисунок 2 показывает архитектуру, с которой мы начинаем разработку мультимодальных emotion-aware продуктов. Мы намеренно выполняем лёгкий анализ по лицу на устройстве пользователя, а более сложные модели для речи и текста обращаемся к облаку — такой подход является оптимальным компромиссом для телемедицины, контакт-центров и систем анализа продаж.
Рисунок 2. Эталонная архитектура продакшена для мультимодального распознавания эмоций.
Неочевидные части: слой согласия и аудита, который добавляется к каждому инференсу (статус согласия пользователя, юрисдикция, feature flag), feature store с TTL 30 дней — чтобы при переобучении не приходилось заново собирать данные, и канал обратной связи, где операторы отмечают ложные срабатывания. Без такой обратной связи модели могут годами медленно ухудшаться.
Мини-кейс: чему нас научил запуск распознавания эмоций в продажах по видеосвязи
Ситуация. Скандинавская B2B-платформа для sales-аналитики хотела получать live-сигналы вовлечённости во время звонков в Zoom, Teams и Google Meet — не распознанные эмоции, а измеримые поведенческие признаки (внимание, согласие, замешательство), которые можно было бы сразу передать менеджеру прямо в ходе разговора.
12-недельный план. Недели 1–2: поток согласий, мост кросс-платформенного захвата. Недели 3–6: пайплайн анализа интонации речи на базе Whisper + лёгкая SER-голова, плюс оценка вовлечённости по мимике (взгляд, улыбка, движение бровей) через WASM-модель на устройстве. Недели 7–9: позднее объединение в общий показатель вовлечённости, настройка порогов на реальных клиентских звонках. Недели 10–12: UX-коучинг менеджера во время звонка, краткое резюме после звонка, выгрузка данных в CRM.
Результат. Конверсия в сделку выросла на 25% по сравнению с базовым периодом до запуска; 80–100% полей в CRM автозаполняются на основе данных звонка и эмоциональных сигналов; менеджеры стали больше доверять engagement-скору, когда мы заменили оценки «счастливый / грустный» на более точные — «внимательный» и «возражающий». Продукт работает как Meetric. Если нужна похожая оценка вашего стека — звоните или пишите.
Модель стоимости — как выглядит реальный проект
Цифры ниже основаны на нашей ускоренной доставке через Agent Engineering: наши AI-решения внедряются быстрее и проще, чем при традиционной аутсорсинговой модели. Это ориентировочные диапазоны, а не коммерческое предложение; точные суммы зависят от вашего технологического стека, доступа к данным и требований по комплаенсу.
| Объём работ | Типичная длительность | Стоимость сборки | Операционные расходы |
|---|---|---|---|
| Интеграция API (лицо или речь) | 3–6 недель | 1,5–4,5 млн ₽ | Платежи вендору API растут с объёмом |
| Мультимодальный MVP на вашем видеостеке | 8–14 недель | 4,5–12 млн ₽ | Смешанная оплата за API + умеренная GPU-инфраструктура |
| Custom-модель со слиянием и дообучением | 4–8 месяцев | 11–33 млн ₽ | GPU-кластер, MLOps, абонемент на разметку |
| Регулируемый клинический запуск (близкий к SaMD) | 6–12 месяцев | 22–67 млн ₽ | Аудит, ревалидация, клинические операции |
Наш опыт: лучший ROI большинство покупателей получают от первых двух строк, а дообучение поверх — только когда появляются реальные продакшен-данные и конкретный режим отказа, который нужно закрыть.
Фреймворк решений — выбор пути за пять вопросов
1. Кто субъект? Клиенты, пациенты, учащиеся, сотрудники, водители или широкая публика? Если речь идёт о сотрудниках или учащихся в ЕС — остановитесь и пересмотрите объём: применяется статья 5.
2. Какое решение управляется сигналом? Это подсказка пользователю, решение о нём или что-то между ними? Решения, касающиеся людей — например, приём на работу, выдача кредита или клиническая сортировка — резко повышают регуляторные и этические требования. Подсказки и рекомендации несут куда меньший риск.
3. Какая модальность у вас уже есть? Если у вас есть видеопоток (телемедицина, sales-звонок), связка «лицо + голос» — недорогая; если есть только телефонный номер, скорее всего, правильный объём — SER.
4. Насколько необычна ваша аудитория? Дети, пожилые люди, люди в масках, носители других языков, с акцентом? Чем нестандартнее аудитория — тем больше нужен собственный пайплайн данных и тем меньше можно доверять заявленной точности готовых решений.
5. Какова ваша терпимость к ложным срабатываниям? Они есть у любой emotion-системы. Если ложная пометка «в дистрессе» для клинициста допустима — продолжайте; если та же пометка вызывает автоматическое действие с серьёзными последствиями, не запускайте систему без участия человека.
Ошибки, которые мы всё ещё видим
1. Категорические метки в UI. «Пользователь зол» — это хуже для UX, чем «тон голоса повышается, менеджеру стоит говорить спокойнее». Показывайте уровень уверенности и поведенческие сигналы, а не дискретные категории эмоций.
2. Пропуск слоя согласия. GDPR (статья 9) и AI Act требуют индивидуального согласия на биометрическую обработку — и пользователи могут его отозвать. Если ваша система не позволяет отключить анализ данных одного пользователя без обновления — это нарушение требований.
3. Восприятие демографического разрыва как ошибки округления. Падение точности на 15 пунктов в одной этнической группе — это не случайный шум, а повод для судебного иска. Проводите аудит ежеквартально, обновляйте обучающие данные, выпускайте внутренние отчёты по точности.
4. Игнорирование временного контекста. Классификация по одному кадру или одной реплике ненадёжна. Используйте сглаживание в окне 3–10 секунд, придавайте больший вес более свежим кадрам и требуйте устойчивости сигнала для срабатывания.
5. Недостаточное инструментирование. Emotion AI со временем теряет точность. Если вы не логируете предсказания, эталонные данные (где это возможно) и обратную связь от пользователей — проблему обнаружите только тогда, когда её заметят регулятор или клиент.
KPI: что измерять
KPI качества. Точность и полнота по классам на отложенной выборке из продакшена (цель — F1 ≥ 0,75 для основного класса). Демографическая парность: разница в точности не более 5 пунктов по расе, полу и возрастным группам. Ошибка калибровки (ECE) ≤ 0,05.
KPI бизнеса. Уровень подключения фичи, доля пользователей, использующих подсказку (проверяем, кто вообще ею пользуется), рост конверсии или улучшение результата в контролируемом запуске, доля согласившихся (здоровый поток согласия — 40–70%).
KPI надёжности. P95-задержка инференса (цель — <250 мс для real-time UX), алёрты дрейфа модели (еженедельные проверки распределения), частота инцидентов с ложными эскалациями и время отката версии модели.
Когда НЕ использовать распознавание эмоций
Не выпускайте фичу, если выполняется хотя бы одно из следующих условий. (а) Ваш кейс — сотрудники или учащиеся в ЕС, а вы не попадаете под медицинское или исключение по безопасности. (б) Сигнал должен принимать решение о человеке без участия человека в процессе. (в) Нет способа собрать сбалансированные по демографии данные для оценки — вы получите смещённый результат и не заметите этого. (г) Продукт уже работает; распознавание эмоций добавляется просто потому, что это модно. Стоп.
В большинстве этих случаев лучше выбрать поведенческую метрику — соотношение talk time, детекция тишины, латентность ответа, извлечение ключевых слов. Это дешевле, стабильнее и гораздо меньше регулируется.
Готовы протестировать распознавание эмоций или отслеживание вовлечённости для вашего продукта?
Проведём аудит вашего видео- и аудиостека, подскажем оптимальную модальность, оценим интеграцию с Agent Engineering и подготовим one-pager, который можно представить совету директоров.
FAQ
Насколько точно распознавание эмоций в аудио и видео работает на практике?
На курируемых бенчмарках современные модели достигают 82–99% по распознаванию лиц и 84–97% по речи. В реальных условиях (продакшен) точность для одной модальности обычно составляет 60–80%. Будьте готовы к резкому падению точности — на 70 пунктов и более — при изменении освещения, частичной закрытости объекта, акцентах или сдвиге в демографическом составе. Мультимодальное объединение данных обычно повышает точность на 3–8 пунктов по сравнению с лучшей одиночной модальностью.
Законно ли распознавание эмоций в ЕС?
Со 2 февраля 2025 года по статье 5(1)(f) EU AI Act запрещены ИИ-системы, распознающие эмоции по биометрическим данным на рабочих местах и в образовательных учреждениях. Исключения для медицинских и safety-применений сформулированы узко. Контексты, связанные с клиентами и потребителями, не попадают под статью 5, но остаются под контролем GDPR и других требований AI Act.
Строить свою модель или использовать API?
Начинайте с API или SDK. Создавайте или дообучайте модель, только если производительность готового решения на вашей аудитории явно недостаточна, у вас есть уникальные обучающие данные или требования к хранению данных и задержкам не позволяют использовать сторонние эндпойнты. Большинство наших развёртываний стартуют как интеграция API и переходят к гибридному варианту (дообученная голова + собственное слияние) только после замеров реального базового уровня.
Сколько стоит добавить распознавание эмоций в видеопродукт?
Интеграция API для одной модальности обычно стоит 1,5–4,5 млн ₽ и занимает 3–6 недель. Мультимодальный MVP на существующем видеостеке — 4,5–12 млн ₽ и 8–14 недель. Кастомная модель со слиянием и дообучением — 11–33 млн ₽ и 4–8 месяцев. Указанные диапазоны рассчитаны при нашей доставке и ускорённой разработке агентов (Agent Engineering).
На каких датасетах обучать?
Для лица: AffectNet и RAF-DB — как основа, Aff-Wild2 — для оценки валентности и возбуждения в реальных условиях, CREMA-Д — для более сбалансированной аудио- и видеоразметки по демографическим признакам. Для речи: IEMOCAP и RAVDESS — для тестирования моделей, MELD — для анализа разговорной речи. Для мультимодального анализа: CMU-MOSEI и MELD. Комбинируйте с собственными размеченными данными из продакшена — ни один публичный датасет не является глобально репрезентативным.
Как работать со смещением и справедливостью?
Запрашивайте у поставщиков разбивку точности по демографическим группам; настаивайте на сбалансированном обучении или калибровке по сегментам после обучения; проводите ежеквартальный аудит на реальных данных из продакшена; ограничивайте разницу в точности по расе, полу и возрасту не более чем 5 процентными пунктами; выпускайте внутренние отчёты об точности. Готовьтесь к переразметке и переобучению моделей минимум раз в год.
Можно ли запускать распознавание эмоций на устройстве ради приватности?
Да, всё больше. Браузерные SDK вроде MorphCast выполняют анализ лица прямо в браузере (на базе WASM/WebGL) с моделью объёмом менее 1 МБ, не отправляя биометрические данные на сервер. Мобильные фреймворки — Core ML, TensorFlow Lite, ONNX — позволяют запускать квантизованные модели распознавания лиц или речи непосредственно на устройстве. Точность таких решений на 5–10 пунктов ниже, чем у облачных аналогов, но выигрыш в приватности и скорости работы обычно это компенсирует.
Сколько реально занимает внедрение?
API-пилот — 2–4 недели; готовая к продакшену мультимодальная фича со слоем согласия, мониторингом и калибровкой — 10–16 недель; регулируемый клинический или safety-деплой — 6–12 месяцев, включая аудиты и ревалидацию. Agent Engineering заметно сокращает каждый из этих этапов по сравнению с классическим аутсорсингом.
Что почитать дальше
Распознавание эмоций в реальном времени
Real-Time AI Emotion Software
Подробнее о live-сигналах аффекта в видеозвонках и контакт-центрах.
Эмоции в речи
Audio Emotion Detection System Using AI
Как строятся SER-пайплайны end-to-end и какие признаки выбирают.
Эмоции по лицу
Machine Learning for Video Emotion Analysis
Сфокусированный обзор лицевой части пайплайна: модели, датасеты, развёртывание.
Видеоконференции
AI Emotion Detection in Video Conferences
Продуктовые шаблоны для интеграции аффект-сигналов в Zoom, Teams и Meet.
Услуги
Услуги Фора Софт по интеграции ИИ
Наш стек, кейсы и быстрый путь к оценке AI-проекта вместе с нами.
Готовы запустить распознавание эмоций, которое работает стабильно в продакшене?
Короткий ответ на вопрос «стоит ли добавлять распознавание эмоций в аудио и видео?» — только если это делает решение дешевле, безопаснее или лучше. И только после того, как вы выбрали модальность, поставщика или модель, а также определились с применимым комплаенс-режимом. Проблемы с отказами предсказуемы: переоценка по бенчмаркам, демографическое смещение, пробелы в согласиях, мёртвые метки вместо живых сигналов — и каждую из них можно решить инженерными методами, а не отказом от технологии.
Фора Софт выпускала AI-решения для распознавания эмоций в рекламных видео, видеомаркетинговых исследованиях, телемедицинских платформах и системах поведенческого видеонаблюдения. Мы знаем, где возникают риски, сколько времени реально займёт разработка через Agent Engineering, и честно скажем, когда правильнее отказаться от идеи. Если вам нужен такой разговор — звоните или пишите.
Получите второе мнение по распознаванию эмоций в аудио и видео
Кратко обсудим задачу, определим объём и диапазон стоимости, дадим честный совет — строить, покупать или отложить фичу.

