Эмоциональный анализ в видео: модели, точность, закон

Распознавание эмоций почти всегда попадает в план продукта для видеообучения, клиентского сервиса или прямых трансляций и почти так же часто выпадает из него, когда команда сталкивается с реальной точностью моделей и требованиями закона к обработке биометрии. Судьба такого проекта на практике решается тремя вопросами: законен ли сценарий с учётом того, что лицо и голос это биометрические персональные данные особой категории; сбалансированы ли обучающие данные по демографии настолько, чтобы не получить разницу в точности на десятки процентных пунктов между группами; и есть ли понятный ответ на вопрос "зачем", который выдержит проверку с точки зрения согласия пользователя.
Разберём, какие модели и таксономии реально используются, какая точность достижима в продакшене, а не только в лаборатории, что требует закон и сколько стоит разработка.
Три семейства моделей эмоционального анализа
Под общим названием "эмоциональный ИИ" сосуществуют несколько разных технологий, и выбор зависит от доступного сигнала и профиля риска.
Распознавание эмоций по лицу (FER) классифицирует микровыражения в базовые эмоции по модели Экмана: радость, печаль, гнев, удивление, страх, отвращение, нейтральное состояние. Современные решения используют MTCNN или RetinaFace для обнаружения лиц, а затем vision transformer или ансамбль свёрточных сетей, дообученных на AffectNet или FER+. Точность лучших моделей: около 75% на FER2013 (7 классов), около 66% на AffectNet (8 классов): и это в лабораторных условиях.
Распознавание эмоций по речи (SER) считывает эмоцию по просодии, высоте, громкости и темпу голоса. Базовые модели: wav2vec 2.0, WavLM, Whisper с эмоциональной "головой". Бенчмарки: около 85% на RAVDESS, 70-80% на IEMOCAP. Голос менее подвержен культурным различиям, чем выражение лица, поэтому в среднем стабильнее работает на разных демографических группах, но чувствителен к фоновому шуму.
Анализ эмоций в тексте определяет эмоцию в транскриптах и чатах. Доступные таксономии: 6 эмоций Экмана, 8 эмоций Плутчика, 28 классов GoEmotions от Google. Типичный стек: дообученный RoBERTa или few-shot промптинг через LLM. На GoEmotions современные модели показывают около 83-87% по macro-F1.
Физиологические сигналы: remote photoplethysmography извлекает пульс из видео лица с точностью выше 90% при хорошем освещении, а носимые устройства измеряют кожно-гальваническую реакцию и вариабельность сердечного ритма. Эти сигналы хорошо определяют возбуждение и стресс, но хуже различают тонкие эмоции.
Мультимодальное слияние: стандарт для продакшена в 2026 году: late-fusion ансамбли или трансформеры с cross-attention объединяют два и более канала. На IEMOCAP трёхканальная система (аудио, видео, транскрипт) превосходит одноканальные модели на 8-12 процентных пунктов.
Какая точность реально достижима в продакшене
Большинство маркетинговых заявлений про точность 90%+ опираются на лабораторные датасеты со сбалансированным освещением и фронтальными ракурсами. Реальные показатели продукта ниже.
| Бенчмарк | Модальность | Классы | Лучший результат | Реальность в продакшене |
|---|---|---|---|---|
| FER2013 | лицо | 7 | ~75% | 60-70% на бытовых веб-камерах |
| AffectNet | лицо | 8 | ~66% | 55-62% |
| RAVDESS | голос | 8 | ~85% | 70-78% на записях звонков |
| IEMOCAP | мультимодальный | 4-5 | ~80% | 70-75% |
| GoEmotions | текст | 28 | ~87% macro-F1 | 80-85% на данных из чатов |
Проектируйте продукт под правую колонку. Для бинарных сигналов (вовлечён/не вовлечён) реалистичны 90%+ точности; при детальном предсказании 7 классов закладывайте, что каждый третий инференс будет ошибочным. Агрегируйте сигнал во времени и по группе пользователей, а не показывайте метку по одному кадру как факт. Фраза "вовлечённость группы снизилась на 15% за последние 10 минут" это обоснованный вывод, а фраза "этот студент выглядит грустным" таковым не является.
Какую таксономию эмоций выбрать
Шесть базовых эмоций Экмана: самая распространённая таксономия с крупными размеченными датасетами, но она основана на западной культуре и не учитывает состояния вроде растерянности или скуки, важные для онлайн-обучения. Циркумплекс валентности и возбуждения Расселла (две непрерывные оси вместо дискретных категорий) хуже воспринимается нетехническими пользователями, но лучше подходит для агрегации на дашборде вовлечённости. Колесо Плутчика (8 эмоций) хорошо смотрится в интерфейсе, но датасетов под него меньше. GoEmotions Google (28 классов) даёт нюансы для текста, но датасеты для лица и голоса с этой таксономией не совпадают. Сколько категорий доживает до интерфейса, хорошо видно на распознавании эмоций в видеоконференциях: от всей таксономии пользователь получает одну сводку настроения по встрече.
Где эмоциональный анализ окупается
Вовлечённость и растерянность в онлайн-обучении: отслеживание сигналов вовлечённости у группы студентов помогает преподавателю корректировать темп занятия. Индивидуальный эмоциональный скоринг конкретного студента, а не агрегированная картина по группе, требует отдельной юридической проверки, поскольку затрагивает обработку биометрии несовершеннолетнего или взрослого учащегося. Агрегированная и анонимизированная аналитика на уровне группы в большинстве случаев проще с точки зрения права.
Клиентский сервис и контакт-центры: распознавание эмоций по голосу в реальном времени подсказывает супервизору вмешаться в эскалированный звонок, типичный прирост CSAT: 15-25% за полгода. Телемедицина и скрининг ментального здоровья: голосовые биомаркеры депрессии и тревожности показывают около 82% AUC в реальных условиях: это регулируемый сценарий, к которому стоит относиться как к медицинскому программному обеспечению с самого начала, включая 323-ФЗ и требования Росздравнадзора. Маркетинговые исследования тестируют реакцию на рекламу на панелях с явного согласия участников. Видеосвязь и анализ настроения на встречах добавляет обычно 2-4 недели разработки поверх существующей базы на WebRTC; агрегированный sentiment по встрече: общепринятая практика, индивидуальный эмоциональный анализ конкретных участников рабочей встречи это куда более рискованная территория. Мониторинг водителя (сонливость, отвлечение внимания): отдельная категория систем безопасности, а не эмоционального анализа как такового. Аналитика аудитории прямых трансляций: агрегированный sentiment чата не требует согласия и камеры, поэтому для стриминговых продуктов разумно начинать с текста и добавлять видеосигнал только после подтверждения продуктовой гипотезы. Во всех этих сценариях эмоция лишь один из сигналов, которые снимает ИИ-видеоаналитика в продукте, и окупаемость считается по общей для них логике: агрегат по группе приносит пользу, метка по одному человеку чаще приносит риск.
Смещение: проблема дня запуска, а не будущего
Известный аудит одной из коммерческих моделей распознавания эмоций по лицу в 2018 году выявил разницу в точности более чем на 25 процентных пунктов между демографическими группами. Последующие исследования подтвердили этот эффект на большинстве коммерческих API. К 2026 году ситуация улучшилась, но недостаточно.
Смещение возникает потому, что в обучающих данных обычно преобладают светлокожие лица, невербальные проявления эмоций различаются в разных культурах, освещение при сборе данных чаще всего студийное, а архитектуры моделей, оптимизированные под общую точность, скрывают провалы на отдельных группах. Все четыре фактора усиливают друг друга.
Что делать: считать точность отдельно для каждой демографической группы (тип кожи по шкале Фитцпатрика, пол, возраст); применять синтетическую аугментацию для недопредставленных групп, что сокращает разрыв в точности на 5-10%; публиковать открытую карточку модели с данными об обучении, метриками по подгруппам и известными случаями сбоя; тестировать модель на 50-100 примерах из реальной аудитории перед запуском, а не только на академических датасетах.
Чек-лист готовности по справедливости: покрывают ли обучающие данные типы кожи Фитцпатрика I-VI равномерно; воспроизводится ли заявленная точность на отложенной выборке, на которой модель не обучалась; есть ли публичная карточка модели с метриками по подгруппам; протестирована ли модель на 50+ реальных пользователях вне основной демографической группы. Если ответ "да" на все четыре вопроса, можно запускаться; если "нет" хотя бы на один, пункт закрывается до запуска.
Что требует закон
Лицо, голос и физиологические сигналы для распознавания эмоций: это биометрические персональные данные особой категории по 152-ФЗ, и их обработка требует отдельного, конкретного согласия субъекта данных, а не согласия общего характера в пользовательском соглашении. Базы с такими данными размещаются на серверах в России. Решение, которое существенно затрагивает права человека (приём на работу, допуск к обучению, доступ к услуге) и принимается исключительно на основе автоматической обработки без участия человека, требует отдельного обоснования.
Для несовершеннолетних учеников согласие на обработку биометрии даёт законный представитель. Для вуза или школы дополнительно действует 273-ФЗ "Об образовании": если эмоциональная аналитика влияет на индивидуальную траекторию ученика, это должно быть прозрачно для учебного заведения и учитываться в общей системе учёта, а не жить отдельным непроверяемым логом. Для медицинских сценариев (скрининг тревожности и депрессии по голосу) добавляется 323-ФЗ и требования к медицинским изделиям и программному обеспечению для поддержки клинических решений.
Практический вывод, который работает в любой юрисдикции: инференс на устройстве, при котором на сервер уходит только агрегированный результат, а сырые биометрические данные остаются на устройстве пользователя, снимает большую часть рисков обработки персональных данных и упрощает согласование с юридическим отделом заказчика.
Фора Софт в реестре отечественного ПО, реестровая запись № 21522.
Стек, который реально работает в продакшене
Захват и распознавание: MediaPipe Face Landmarker (468 точек) для лица, pyannote для разделения говорящих и голосовой активности в звуке. Оба работают в браузере через WebAssembly/WebGL или на устройстве в мобильном приложении. Инференс эмоций: облегчённый vision transformer, дообученный на AffectNet с добавлением разнообразных данных, для лица; wav2vec 2.0 или Whisper с классификационной "головой" для голоса; дообученный RoBERTa на GoEmotions или запрос к LLM для сложных случаев в тексте. Слой слияния: late-fusion взвешенный ансамбль для простых продуктов, трансформер с cross-attention для продакшен-систем, которым нужна оценка уверенности по каждой модальности, и всегда возвращайте вместе с предсказанием класс "неизвестно".
На устройстве или в облаке: в 2026 году обработка на устройстве это стандарт для потребительского продукта, поскольку ни один биометрический бит не покидает устройство и снимает основную часть вопросов к обработке персональных данных. Устройства среднего класса уже тянут модели уровня MobileViT на 30 кадрах в секунду. Облачный инференс должен давать заметный прирост точности по сравнению с локальным выполнением, чтобы его использование было осознанным выбором, а не выбором по умолчанию. Устройства отправляют на сервер уже обработанные агрегаты, а не исходные кадры или аудио; агрегация оседает в аналитической базе, дашборды строятся поверх неё. Границы между этими слоями стоит зафиксировать до первой строчки кода, и для этого достаточно ревью архитектуры ИИ-стека: поменять слой слияния на схеме дешевле, чем после интеграции с продуктом.
Пять инженерных привычек
Согласие показывается до, а не после захвата первого кадра: что делает функция, какие данные обрабатывает, где происходит распознавание, и понятная кнопка отказа. Мультимодальное слияние с мягким fallback по одному каналу: кто-то блокирует камеру, кто-то отключает микрофон, и система, которой обязательно нужны все каналы разом, откажет в заметной доле сессий. Приоритет обработке на устройстве, а облако только при необходимости и с осознанным выбором. Карточка модели и оценка по подгруппам с первого дня, а не как доработка перед аудитом. Человек в цикле для решений с высокими ставками: инференс эмоций информирует решение, но не принимает его сам, если на кону трудоустройство, допуск к обучению или медицинская помощь.
Разделяйте слой анализа эмоций и слой бизнес-логики: модель придётся заменить, чтобы улучшить метрики смещения или перейти на новую базовую архитектуру, и вызывающий код не должен это почувствовать.
Вендоры и инструменты
Специализированные emotion API покрывают анализ голоса и просодии с ценой в районе 20-40 ₽ за минуту, либо анализ выражения лица и физиологии для автомобильной отрасли и маркетинговых исследований с прайсингом по запросу. У крупных облачных провайдеров базовая классификация эмоций по лицу закрыта из-за проблем со смещением: остались только точки на лице, распознавание речи и анализ тональности текста, а построение эмоционального анализа поверх этого остаётся задачей разработчика. Open-source базовые модели (wav2vec 2.0, WavLM, MediaPipe FaceMesh, MobileViT, EfficientNet с весами AffectNet) дают самостоятельный хостинг и полный контроль над моделью и её оценкой: это путь, которым мы обычно идём с регулируемыми клиентами. Веса для них берут в открытых каталогах, где заодно сверяют открытые модели и расчёт стоимости их развёртывания до закупки железа. Вертикальные специалисты закрывают конкретные ниши: коучинг в контакт-центрах, клинические голосовые биомаркеры, мониторинг водителя, и их стоит применять там, где отраслевые требования важнее расчёта "разработать самому или купить готовое". LLM не позиционируются как emotion API, но хорошо справляются с контекстным рассуждением над транскриптом и уместны для сводок по сессии, хотя стоят слишком дорого для покадрового инференса в реальном времени.
Сколько стоит разработка
| Скоуп | Бюджет | Сроки | Что входит |
|---|---|---|---|
| Одномодальный MVP (лицо или текст) | 3-6 млн ₽ | 6-10 недель | предобученная модель, базовый интерфейс, процесс согласия, единый дашборд |
| Мультимодальная продакшен-система | 9-22 млн ₽ | 4-6 месяцев | слияние лица, голоса и текста, опция on-device, аудит смещений, карточка модели |
| Регулируемый сценарий (медицина) | 22-60 млн ₽ и выше | 8-12+ месяцев | клиническая валидация, регуляторное сопровождение |
| Видеосвязь с распознаванием эмоций | 6-13 млн ₽ | 3-4 месяца | интеграция с видеослоем, сводка настроения по итогам встречи, проверка приватности |
Список желаемых функций для оценки почти ничего не даёт, поэтому мы считаем иначе: описание требований, архитектуру и смету отдаём за 24 часа. План MVP, аудит кода и аудит архитектуры делаем бесплатно, за 3 рабочих дня.
В команде 50 специалистов в штате, без субподряда, а собственный процесс агентной разработки ускоряет такие проекты в 4-10 раз по сравнению с традиционным подходом, но под контролем ведущих инженеров. Видео и аудио занимаемся с 2005 года, за это время сделали 250+ проектов, включая заказчиков из 17+ стран. На Школарли, где платформа держит 2000+ студентов в одной сессии, любой сигнал вовлечённости обязан агрегироваться и обновляться на уровне группы, а не по одному студенту: на таком масштабе индивидуальный покадровый скоринг просто не выдержал бы нагрузки и не дал бы преподавателю ничего полезного.
Шесть ловушек, которые останавливают запуск на полпути
Обучение на лабораторных данных и тестирование в реальных условиях: модели теряют 10-20 пунктов точности на записях с обычных домашних веб-камер, поэтому небольшой тестовый набор от реальных пользователей с их согласия обязателен до релиза. Заявление "точность 93%" в маркетинге без возможности воспроизвести цифру на демографически сбалансированных данных. Индивидуальный скоринг в реальном времени на рабочем месте или в учёбе без согласия и без агрегации: территория повышенного юридического риска. Отсутствие возможности отказаться или постоянно включённая камера нарушает и закон, и доверие пользователей. Привязка значимых решений (приём на работу, поступление, лечение) напрямую к эмоциональному скору без клинической валидации и аудиторского следа. Игнорирование пользователей, для которых лицо или голос не работают как канал: незрячие пользователи, люди с прозопагнозией или лицевым параличом, те, кто носит закрывающую лицо одежду. Для них эмоции по голосу и по тексту остаются универсальной альтернативой.
Тренды 2026 года
Эмоциональное рассуждение с помощью LLM поверх узкого классификатора: модель лучше справляется с сарказмом и неоднозначностью, но стоимость растёт с объёмом. Синтетические данные для демографического баланса сокращают разрыв в точности на 5-10% для недопредставленных групп. Инференс с защитой приватности (федеративное обучение, чисто on-device-пайплайны) становится стандартным способом снять большую часть вопросов регулятора. Эмоциональные помощники в видеосвязи отслеживают ход встречи и подсказывают, как переформулировать фразу. Стандартизированные карточки моделей и шаблоны документации делают аудит предсказуемым, и начинать их вести стоит с первого дня, а не перед проверкой.
KPI с первой продакшен-сессии
Точность по демографическим группам (Фитцпатрик, пол, возраст), цель: разница не более 5 процентных пунктов. Задержка инференса p95: меньше 200 мс для on-device, меньше 500 мс для облака. Доля согласившихся на функцию: выше 60% для потребительских продуктов, выше 80% для корпоративных с панелью согласия. Доля ложных срабатываний по высокорисковым алертам: меньше 2%. Окно хранения данных: производные оценки не больше 90 дней, сырые биометрические данные не больше 7 дней или полное отсутствие хранения на устройстве. Полнота аудит-логов: 100% решений с высоким уровнем ответственности должны быть залогированы.
Частые вопросы
Можно ли выпустить распознавание эмоций в продукте для онлайн-обучения?
Да, если это агрегированная, анонимизированная аналитика на уровне группы, которая не позволяет определить эмоцию конкретного человека. Индивидуальный эмоциональный скоринг отдельного ученика требует отдельного обоснованного согласия и более тщательной юридической проверки по 152-ФЗ.
Какую точность стоит обещать?
Для лица на 7 классов реалистичны 70-75% на данных из реальной жизни, для голоса 75-80%, для текста 80-85% на небольшом числе категорий. Обещайте публично нижнюю границу и перевыполняйте её внутри.
Облачный API или собственный сервер?
При объёме меньше 10 000 часов в месяц облачный API обычно дешевле. Выше этого порога self-hosted на своих GPU выгоднее и даёт полный контроль над моделью и оценкой смещений. On-device выделяется в отдельную категорию: без затрат на облако, с потерей точности около 10 пунктов, оптимальна там, где важно соответствие требованиям к персональным данным.
Можно ли использовать LLM для распознавания эмоций?
Да, и часто это лучший выбор для рассуждения об эмоции в тексте: на GoEmotions современные LLM дают 83-87% macro-F1. Для лица и голоса они тоже способны рассуждать об эмоции, но дороги на больших объёмах и медленнее специализированных классификаторов. Рабочая комбинация: специализированные классификаторы для инференса в реальном времени, LLM для рассуждений над уже агрегированными данными.
Что делать с несовершеннолетними и уязвимыми группами?
Обработка биометрии несовершеннолетнего требует согласия законного представителя, минимизации данных и особенно осторожного хранения. Во многих случаях стоимость соблюдения требований превышает ценность самой функции, и отказ от неё для этой аудитории: обоснованное решение.
Сколько времени занимает разработка продакшен-функции распознавания эмоций для видео?
3-4 месяца для одномодальной функции с инференсом на устройстве поверх существующего видеопродукта, 4-6 месяцев для мультимодальной продакшен-системы, 8-12+ месяцев для регулируемых внедрений с медицинской валидацией.
Если нужна разработка ИИ-модуля распознавания эмоций для видеопродукта с обработкой на устройстве и размещением данных в России, расскажите задачу, и мы вернёмся с архитектурой и сметой за 24 часа.
