
Главное
• Универсальные алгоритмы детекции аномалий не работают в видеонаблюдении. Готовый isolation forest или one-class SVM, обученный на табличных данных, не справляется с изменениями освещения, погоды, перекрытиями объектов и сменой ракурса камеры. В продакшене нужны фичевые пайплайны, адаптированные под конкретный домен.
• У четырёх семейств алгоритмов очень разный профиль затрат. Статистические — дешёвые, но неустойчивые. Дистанционные — тоже дешёвые, но не учитывают временные изменения. Реконструктивные — средние по стоимости, требуют качественных данных. Последовательностные — дорогие, но хорошо ловят временные закономерности. Выбирайте подход в зависимости от ваших данных и допустимой задержки.
• Доля ложных срабатываний — единственная важная операционная метрика. Модель с полнотой 95 % и долей ложных срабатываний 30 % за две недели заставляет операторов игнорировать оповещения. Сначала настраивайте точность, а когда появится доверие — повышайте чувствительность.
• Обнаружение дрейфа — обязательно. Модели, обученные на летних данных, теряют точность зимой; модели, обученные на одном ракурсе, перестают работать, если камеру повернули. Контроль распределения уверенности модели позволяет выявить дрейф раньше, чем это заметят пользователи.
• EyeBuild снизил долю ложных срабатываний на 73 % за 6 недель — целенаправленный поиск сложных негативов и временное сглаживание, чисто алгоритмическая оптимизация без установки нового оборудования.
Почему этот плейбук написала Фора Софт
С 2005 года «Фора Софт» реализовала более 50 проектов в сфере видеонаблюдения. EyeBuild — наш флагманский продукт для развертывания системы обнаружения аномалий: автономные камеры на солнечной энергии с ИИ, охраняющие сотни строительных площадок, работают по 4G/5G и используют ансамбль YOLO + автоэнкодер прямо на устройстве. VALT обслуживает более 650 юридических лиц и обеспечивает поиск по событиям в записанных видео.
В 2024–2025 годах мы запустили четыре системы детекции аномалий в продакшене и провели аудит ещё двух. Паттерны из этого руководства основаны на этих проектах и открытых бенчмарках (UCF-Crime, ShanghaiTech, MVTec AD).
Если вы ML-инженер, CTO продукта в сфере видеонаблюдения или интегратор умных зданий и сейчас решаете, стоит ли внедрять детекцию аномалий, это руководство поможет выбрать подходящее семейство алгоритмов, определить, какая архитектура устойчива к дрейфу, и понять, на каких этапах чаще всего возникают проблемы.
Нужна система детекции аномалий, которая действительно работает?
Пришлите описание парка камер, среды и целевых событий. За 48 часов подготовим одностраничный прогноз по модели и архитектуре — бесплатно.
Почему универсальная детекция аномалий не работает в продакшене
Универсальная детекция аномалий (sklearn IsolationForest на плоских табличных фичах) подходит для выявления мошенничества с картами и анализа серверных метрик. Для видео она не подходит. Три причины:
1. Видео — это не табличные данные. Кадр — это 1920×1080×3 пикселя. Сначала модель должна преобразовать его в пространство признаков: сырые пиксели, эмбеддинги CNN, оптический поток, маски переднего плана, детекции объектов. Выбор способа обработки данных влияет на результат сильнее, чем выбор самого алгоритма обнаружения аномалий.
2. Норма нестационарна. Освещение, погода, время суток, сезон — «норма» в 6 утра летом — это не то же самое, что «норма» в 6 вечера зимой. Модели, обученные на статичном наборе данных, быстро теряют точность. В продакшене нужны скользящие базовые линии или модели, учитывающие контекст.
3. Аномалии редкие и асимметричные. Настоящие аномалии (проникновение, падение, пожар) — это 0,001 % кадров. Даже 1 % ложных срабатываний даёт более 1000 оповещений в день на 100 камер — это уже нереально для работы. Главное — точность, а не охват.
Четыре семейства алгоритмов
| Семейство | Примеры | Стоимость инференса | Когда подходит |
|---|---|---|---|
| Статистические | Z-оценка, межквартильный размах, расстояние Махаланобиса | Микросекунды | Очень узкие фичи (гистограмма движения, яркость) |
| Дистанционные | kNN, LOF, isolation forest, one-class SVM | Миллисекунды | Эмбеддинги детекций, признаки на уровне кадра |
| Реконструктивные | Автоэнкодер, VAE, GAN, U-Net | Десятки мс (NPU 1-го уровня) | Пиксельные аномалии, размеченные негативные примеры не требуются |
| Последовательностные | LSTM, Transformer, TimesNet, MAE-ST | Сотни мс | Поведенческие паттерны во времени |
Статистические методы. Дёшево, понятно, хрупко. Z-оценка по гистограммам движения ловит резкие изменения; расстояние Махаланобиса по небольшому набору признаков выявляет многомерные выбросы. Применяются как первичный фильтр перед более сложным анализом.
Дистанционные методы. Обучаются на эмбеддингах детекций (векторы признаков на основе CNN) и выделяют сэмплы, сильно отличающиеся от обучающего распределения. Isolation forest — надёжный выбор: работает быстро, устойчив к шуму и обучается только на нормальных данных. One-class SVM хорошо справляется с небольшими датасетами, но плохо масштабируется. Local Outlier Factor (LOF) эффективен там, где плотность данных сильно различается — в таких условиях он превосходит другие методы.
Реконструктивные методы. Автоэнкодер обучается сжимать и восстанавливать «нормальные» кадры: если ошибка реконструкции высока — это признак аномалии. Обучение проходит на неразмеченных нормальных данных — большой плюс для видеонаблюдения, где размеченные примеры аномалий встречаются редко. Вариационные автоэнкодеры (VAE) и подходы на основе GAN обеспечивают более высокое качество, но требуют больше вычислительных ресурсов.
Последовательностные методы. Выявляют временные закономерности — например, людей, которые долго стоят на месте, оставленные вещи или необычные маршруты движения. Архитектуры LSTM и Transformer предсказывают следующий кадр: большая ошибка предсказания означает аномалию. TimesNet и MAE-ST (masked autoencoder spatio-temporal) — лучшие решения 2026 года на бенчмарках вроде UCF-Crime.
Берите дистанционные методы (isolation forest), когда: у вас есть эмбеддинги детекций от YOLO и нужен быстрый и надёжный способ оценки аномалий на устройствах с ограниченными ресурсами.
Берите реконструктивные методы (автоэнкодер), когда: размеченных аномалий мало или их вообще нет. Обучайте модель на нормальных данных — высокая ошибка реконструкции будет сигнализировать о ненормальных сценах.
Берите последовательностные методы (Transformer), когда: аномалия временная — например, люди, которые долго стоят на месте, оставленные предметы, необычные маршруты движения. Такие модели требуют больше вычислительных ресурсов; обычно их используют на стороне облака для проверки.
Берите ансамбль (несколько семейств), когда: доля ложных срабатываний критична. Два независимых детектора, согласных между собой, надёжнее, чем каждый из них в отдельности.
Что специфично именно для видео
Разделение переднего и заднего плана. Большинство алгоритмов обнаружения аномалий должны работать с движущимися объектами (передним планом), а не со всем кадром. Вычитание фона с помощью MOG2 или специализированной сети сегментации сокращает размер пространства признаков на 90 % и значительно улучшает соотношение сигнал/шум.
Движение и аномалия — не одно и то же. Все аномалии связаны с движением, но не всякое движение — аномалия. Человек, идущий по улице, — это нормально. А вот человек, перелезающий через забор в три часа ночи, — уже аномалия. Чтобы отличать одно от другого, детектор должен учитывать движение в сочетании с контекстом: тип объекта, место и время.
Сдвиги по освещению, погоде и времени суток. Обучающие данные должны охватывать весь рабочий диапазон использования модели. Обильно применяйте аугментации — по яркости, контрасту, погодным условиям (дождь, туман), в ИК- и видимом спектрах, а также в «золотой час». Доменную рандомизацию используйте и для синтетических данных, если реального покрытия недостаточно.
Инвариантность к ракурсу и зуму. Модель, обученная на одном ракурсе, перестаёт работать, если изменить положение камеры или масштаб. Либо используйте геометрическую аугментацию при обучении — перспективные сдвиги, разные уровни зума, различные варианты кадрирования, — либо обучайте отдельную модель для каждой камеры с последующей онлайн-адаптацией.
Эталонная архитектура
Рисунок 1. Продакшен-детекция аномалий — инференс на edge, edge-фильтр, верификация в облаке, разбор оператором, телеметрия и петля дообучения.
В архитектуре пять активных слоёв и одна петля дообучения. На edge работает облегчённая детекция (YOLO + автоэнкодер) со скоростью 30 кадров в секунду. Edge-фильтр использует порог уверенности и временное сглаживание — оповещение срабатывает только при совпадении в трёх из пяти подряд идущих кадров. Облачный верификатор запускает более тяжёлые модели — Transformer или Vision-Language Model — на загруженных снимках, а также проверяет корреляцию между камерами. Очередь оператора приоритизирует события с высокой уверенностью. Телеметрия отслеживает распределение уверенности по каждой камере и времени суток; пайплайн обучения принимает размеченные ложные срабатывания и каждую неделю запускает дообучение.
Пайплайн данных — разметка, аугментация, синтетика
Разметка. Активное обучение напрямую решает проблему разметки. Модель выбирает кадры, в которых она не уверена, и человек их размечает. Время разметки сокращается в 5–10 раз по сравнению со случайным выбором. CVAT, Roboflow Annotate и Label Studio поддерживают активное обучение в режиме обратной связи.
Аугментация. Изменение яркости и контраста, добавление эффектов погоды (дождь, туман), перспективные искажения, размытие движения, имитация шума сенсора. Albumentations — надёжная и популярная библиотека на Python. Увеличивайте объём датасета в 5–10 раз с помощью аугментации.
Синтетические данные. Unity, Unreal Engine, NVIDIA Omniverse и BlenderProc создают физически достоверные синтетические записи видеонаблюдения. Используйте их для моделирования редких ситуаций — драк, краж, пожаров, — когда реальных примеров недостаточно. Доменная рандомизация помогает плавно смешивать синтетические и реальные данные. SyntheticAIData и Datagen — компании, предлагающие готовые синтетические датасеты.
Майнинг сложных негативов. Самый эффективный метод. Периодически собирайте ложные срабатывания из продакшена, помечайте их как «норму» и дообучайте модель. Это сдвигает границу принятия решений в нужную сторону. Снижение ложных срабатываний на 73 % в EyeBuild — почти полностью результат майнинга сложных негативов.
Контроль ложных срабатываний — единственная важная метрика
Модель с полнотой 95 % и долей ложных срабатываний 30 % за две недели заставляет операторов игнорировать оповещения. Когда доверие утрачено, модель становится бесполезной в работе, даже если её полнота достигает 99 %. Три приёма, чтобы снизить количество ложных срабатываний:
1. Пороги уверенности. Настройте порог для каждой камеры, исходя из доли ложных срабатываний. У камер с большим количеством ложных срабатываний установите более строгий порог, у камер с низким — оставьте чувствительность. Настройка под каждую камеру даёт выигрыш в 3–5 раз по сравнению с единым порогом для всех.
2. Временное сглаживание (3 из 5). Чтобы система сработала, детекция должна подтвердить наличие объекта на 3 из 5 подряд идущих кадров. Это позволяет отфильтровать артефакты — например, шум сенсора или кратковременное перекрытие. Такой подход добавляет задержку 100–200 мс, но снижает ложные срабатывания на 60–80 %.
3. Корреляция между камерами. Проникновение по периметру должно быть видно с соседних камер. Если движение обнаружено только на одной камере, но не подтверждается другими, такая тревога получает меньший приоритет. Такой подход снижает количество ложных срабатываний, хотя и приводит к небольшой потере полноты обнаружения.
Детекция дрейфа и расписание дообучения
Модели, обученные на летних данных, теряют точность зимой. Новые ракурсы камер, этапы строительства и типы техники постепенно снижают надёжность. Сигнал о проблеме — изменение распределения уверенности модели со временем. Следите за средним значением и разбросом уверенности по каждой камере раз в неделю: резкое падение или рост разброса указывают на дрейф.
Расписание дообучения. В стабильной продакшн-среде дообучение проводится раз в месяц на новой партии сложных негативных примеров. После нового деплоя или смены окружения — раз в неделю первые два месяца, затем — раз в месяц. Инфраструктура дообучения должна быть автоматизирована: ручные циклы не успевают за дрейфом данных.
Canary-деплой. Новая модель запускается на 5 % камер; в течение 7 дней отслеживайте долю ложных срабатываний, полноту на размеченной валидационной выборке и распределение уверенности. Если всё в порядке — постепенно увеличивайте нагрузку до 25 %, а затем до 100 %. Всегда храните предыдущую версию модели на диске для возможности отката.
Модель детекции аномалий выдаёт ложные срабатывания?
Пришлите нам выборку продакшен-данных за две недели. За 5 рабочих дней мы найдём причину ложных срабатываний и предложим план исправления. Бесплатно.
Реальные бенчмарки — UCF-Crime, ShanghaiTech, EyeBuild
UCF-Crime. Открытый бенчмарк с 13 классами аномалий (насилие, арест, поджог, нападение, ДТП, кража со взломом, взрыв, драка, дорожная авария, ограбление, стрельба, магазинная кража, кража, вандализм). 1900 обучающих видео, 290 тестовых. Лучшие современные методы по AUC на уровне кадра в 2026 году показывают результат около 88–90 %; слабосупервизорные подходы — около 84–86 %.
ShanghaiTech Campus. 437 видео с 13 фиксированных камер на университетском кампусе. Классы аномалий: катание на скейте, езда на велосипеде, прыжки, драки. State-of-the-art по AUC на уровне кадра в 2026: ~95 %.
MVTec AD. Промышленный датасет с дефектами (15 категорий, 5354 изображения). Это не видео, а отдельные кадры — он хорошо подходит для тестирования автоэнкодеров. Методы PaDiM, PatchCore и EfficientAD в 2026 году показывают AUROC выше 99 % на этих изображениях.
Наши данные по EyeBuild (под NDA, обезличенные). Около 220 камер на 18 строительных площадках. До настройки: точность 28 % при полноте 80 % при обнаружении проникновений в нерабочее время. После настройки (анализ сложных отрицательных примеров + временное сглаживание): точность 73 % при полноте 78 % — улучшение в 2,6 раза по ключевым категориям, где важно доверие оператора, при почти неизменной полноте.
Своя разработка или готовое решение
Предобученные модели в коммерческих камерах (Axis, Hanwha, Avigilon). Привязаны к железу и вендору, хорошо справляются с базовой детекцией людей и машин. Не справляются с задачами, специфичными для вертикалей (соблюдение СИЗ, цепочка хранения вещдоков, поведение строительной техники).
Облачные API (AWS Rekognition, Google Cloud Vision). Просто начать; стоимость становится важной при масштабировании парка устройств (см. наш гид по edge AI). Только базовая детекция; нет специализации под конкретные отрасли.
Open-Source-модели и предобученные веса. YOLO26, MMDetection, библиотека anomalib — отличные точки старта. Требуется файнтюнинг на ваших данных и MLOps для поддержки.
Кастомная разработка. Это правильный выбор, когда: (а) у вас есть специфичная модель обнаружения аномалий, которой нет в готовых решениях; (б) требования комплаенса или локализация данных требуют запуска инференса на собственных серверах или в вашем VPC; (в) масштаб парка оборудования делает инвестиции в разработку оправданными.
Мини-кейс — EyeBuild снизил ложные срабатывания на 73 %
EyeBuild устанавливает ИИ-камеры на солнечных батареях на стройплощадках — связь по 4G/5G, проводного интернета нет, поэтому обработка данных должна происходить прямо на устройстве. Первоначальная модель (YOLOv8n + простой порог уверенности) генерировала около 120 событий за ночь на одну площадку. Операторы отмечали более 70 % ложных срабатываний — в основном из-за белок, енотов, колышущихся тентов и фар проезжающих машин.
Шестинедельная работа. Недели 1–2: подключили телеметрию по распределению уверенности на каждой камере в продакшене. Недели 3–4: спринт по сбору сложных негативных примеров — собрали 2800 снимков ложных срабатываний, разметили их как «норму» и дообучили YOLO с использованием focal loss. Неделя 5: внедрили временное сглаживание (объект фиксируется, если он обнаружен на 3 из 5 кадров). Неделя 6: запустили canary-реплику на 12 площадках, после чего полностью раскрутили обновление до 100 %.
Результат. Количество событий на одну площадку за ночь снизилось с ~120 до ~32; точность выросла с 28 % до 73 %; полнота осталась на уровне 78 % (потеряно 2 процентных пункта). Субъективная оценка доверия операторов увеличилась с 2,4 из 5 до 4,2 из 5. Хотите провести подобный аудит в своём парке камер? Позвоните нам.
Как выбрать алгоритм за пять вопросов
В1. Есть ли у вас размеченные аномалии? Нет: реконструкция (автоэнкодер). Да, но мало: слабосупервизорные методы. Да, много: супервизорный классификатор.
В2. Аномалия временная? Покадровые аномалии (нарушитель, видимый в момент X): автоэнкодер или дистанционные методы. Эволюционирующие во времени аномалии (слоняющиеся люди, оставленные предметы): последовательностные.
В3. Бюджет задержки? <10 мс: статистические или дистанционные методы. 10–100 мс: автоэнкодер или неглубокий Transformer. >100 мс: полный Transformer или VLM в облаке.
В4. Инференс на edge или в облаке? Edge (NPU 1-го уровня): автоэнкодер или дистанционные модели. Облако: ансамбль из полного Transformer и VLM.
В5. Профиль дрейфа? Стабильная сцена, неподвижная камера, постоянное освещение — с такими условиями справятся даже простые модели. Улица, разные сезоны, камера на ходу — здесь стоит задействовать механизм дообучения, чувствительный к дрейфу.
Подводные камни
1. Оптимизировать полноту до того, как поднимется точность. Полнота звучит важно, но операторов держит в работе именно точность. Сначала настраивайте точность; повышайте чувствительность, когда появится доверие.
2. Обучение на одной камере и деплой на много. Модели, обученные на одном ракурсе, не работают на других. Либо включайте многоракурсные данные в обучение, либо обучайте отдельную модель под каждую камеру с онлайн-адаптацией.
3. Нет мониторинга дрейфа. Без отслеживания распределения уверенности вы узнаете о падении качества модели только по жалобам клиентов. Заложите телеметрию с самого начала.
4. Пропуск временного сглаживания. Детекции по кадрам слишком шумные. Требуйте подтверждения сигнала на нескольких кадрах (например, 3 из 5) перед оповещением — ложные срабатывания сократятся на 60–80 % при минимальной потере полноты.
5. Забыть про приватность и GDPR. Детекция аномалий часто требует распознавания лиц или анализа поведения. С самого начала предусмотрите удаление персональных данных прямо на устройстве, работу с биометрией в соответствии со статьёй 9 GDPR (особые категории данных) и соблюдение правил хранения информации.
Какие KPI измерять
KPI качества. Точность (цель: >70 % до появления доверия, >85 % после). Полнота (цель: >75 % по критичным событиям). Доля ложных срабатываний на камеру в день (цель: <3). AUC на валидационной выборке (цель: >0,85).
Бизнес-метрики. Доля оповещений, обработанных оператором в срок (в процентах от общего числа оповещений). Количество ложных срабатываний, подтверждённых жалобами клиентов. Среднее время выявления критических инцидентов.
KPI надёжности. Сигнал дрейфа модели (изменение средней уверенности с недели на неделю более чем на 5 % — триггер оповещения). Успешность OTA-обновления моделей (цель: 99,8 %). Задержка инференса p99 (цель: менее 50 мс на edge 1-го уровня).
FAQ
Isolation forest или one-class SVM — что лучше?
Isolation forest лучше масштабируется и быстрее обучается на больших датасетах (миллионы сэмплов). One-class SVM показывает более высокую точность на небольших датасетах, но его качество резко падает при объёмах больше 50 тыс. сэмплов. Для видеонаблюдения по умолчанию используйте isolation forest, если в обучающем наборе не менее 5 тыс. примеров.
Можно ли использовать Vision-Language Model (GPT-4V, Gemini) для детекции аномалий?
Да, для верификации в облаке. Отправьте помеченный кадр в GPT-4V с промптом: «Этот человек делает что-то необычное?» — и используйте ответ как второе мнение. Добавляет задержку 1–3 секунды и поэтапную стоимость; применяйте только к событиям, отмеченным на edge, а не ко всем кадрам подряд.
Сколько занимает обучение кастомной модели?
С нуля на ваших данных: 6–10 недель. Дообучение предобученных YOLO и автоэнкодера под ваш домен: 2–3 недели. Запуск в продакшен с мониторингом и циклом дообучения: ещё 4–6 недель. Быстрее — за счёт использования готовых решений из Agent Engineering в EyeBuild и VALT.
Какой объём датасета нужен?
Для автоэнкодера: 50–100 часов нормальных записей, охватывающих все условия (день/ночь, погода). Для супервизорной модели: более 500 размеченных примеров аномалий на класс. Аугментация увеличивает объём данных в 5–10 раз. Синтетические данные помогают восполнить недостаток редких событий.
Соответствуют ли системы детекции аномалий требованиям GDPR?
Если система собирает данные лиц или биометрию, применяется статья 9 GDPR (особые категории персональных данных). Меры: обработка персональных данных прямо на устройстве (например, размытие лиц до отправки кадра с камеры), минимизация данных (передача событий, а не исходных видео), ограничение сроков хранения, проведение DPIA. Если система используется для контроля на рабочем месте, может потребоваться оценка уровня риска в соответствии с EU AI Act.
Что такое anomalib и стоит ли его использовать?
anomalib — это open-source-библиотека от Intel/OpenVINO с реализациями PaDiM, PatchCore, EfficientAD и других современных алгоритмов детекции аномалий. Отлично подходит для промышленной диагностики дефектов (в стиле MVTec AD) и является хорошей отправной точкой для подходов с автоэнкодерами в задачах видеонаблюдения.
Может ли инференс на edge справиться с детекцией аномалий на 30 fps?
Да — на NPU 1-го уровня (Hailo-8, Jetson Orin Nano, Coral). YOLO26 + лёгкий автоэнкодер обеспечивают 30 кадров в секунду при разрешении 1080p и энергопотреблении менее 10 Вт. На оборудовании 2-го и 3-го уровня приходится либо пропускать кадры, либо использовать более лёгкие модели.
Как оценить, какой вендор детекции аномалий лучше?
Запустите 4-недельный пилот с двумя-тремя финалистами на ваших реальных данных. Оценивайте точность и полноту на размеченной валидационной выборке, долю ложных срабатываний за две недели в продакшене и поведение модели при изменении условий. Бенчмарки вендоров, полученные на их собственных данных, не применимы к вашей задаче.
Что почитать дальше
Edge AI
Edge AI для видеонаблюдения
Парный гид по уровням железа и развёртыванию.
AI
ИИ-система детекции аномалий
Более ранний обзор той же темы на высоком уровне.
VMS
Видеоаналитика и наблюдение
Куда уходят события аномалий после детекции.
Архитектура
Масштабируемый дизайн VMS
Архитектура VMS для парков камер.
AI Infra
MCP для видеоприложений
Как добавить слой LLM-агента поверх событий детекции.
Готовы запустить детекцию аномалий, которой будут доверять операторы?
Универсальные алгоритмы не работают с видео. У четырёх подходов — статистических, дистанционных, реконструктивных и последовательностных — сильно различаются требования к ресурсам и точность. Выбирайте метод под свои данные и допустимую задержку; чтобы снизить количество ложных срабатываний, рассмотрите использование ансамбля.
В первые 90 дней точность важнее полноты. Майнинг сложных негативов и временное сглаживание стабильно снижают ложные срабатывания на 60–80 % в продакшене. Детекция дрейфа обязательна. Петля дообучения должна быть автоматизирована — ручные циклы не успевают за реальным дрейфом.
Хотите шестинедельный план по улучшению детекции аномалий?
Пришлите описание парка камер, текущую модель и долю ложных срабатываний. За 5 рабочих дней вернёмся с планом повышения точности — бесплатно.
