7 лучших алгоритмов машинного обучения для детекции аномалий в видеонаблюдении в 2026 году (руководство по пайплайну) — обложка

Детекция аномалий в видеонаблюдении — задача двухуровневая, а не одноалгоритмическая. Первый уровень — быстрая статистическая или геометрическая модель, которая отбирает подозрительные кадры (Isolation Forest, One-Class SVM, GMM, K-Means). Второй уровень — глубокая модель, которая анализирует, что именно происходит на кадре (CNN, LSTM, автоэнкодеры, а в 2026 году — и vision-трансформеры). Соберите их правильно — получите детекцию за менее чем секунду с долей ложных срабатываний <1% на типичных потоках с камер CCTV. Соберите неправильно — либо утонете в потоке уведомлений, либо пропустите именно тот момент, ради которого всё и затевалось. Этот гайд — рабочий каркас для принятия решений, который мы используем при реальных внедрениях у клиентов в 2026 году.

Стек для детекции аномалий в 2026: YOLO-NAS для обнаружения, DINOv2 для эмбеддингов, гибриды Isolation Forest + автоэнкодер для скоринга без разметки и трансформеры для распознавания действий в сложных событиях. Ориентир: <2% ложных срабатываний при 95% полноте на 20 наиболее распространённых классах аномалий в ритейле и на транспорте.

Подробнее по теме: читайте наш полный гайд — Топ-7 моделей детекции аномалий для видеонаблюдения (2026).

Главное

  • Один алгоритм не побеждает. Детекция аномалий в видеонаблюдении — это пайплайн: лёгкая модель для предварительного отбора, глубокая — для подтверждения.
  • Автоэнкодеры и CNN — лучшие для обнаружения пиксельных аномалий. Они учатся распознавать «нормальное» изображение и выделяют всё, что в него не вписывается.
  • LSTM и трансформеры — лучшие для временных аномалий. Слоняние, движение «на хвосте», нетипичные траектории — это задача для последовательных моделей, а не для покадровых.
  • Isolation Forest — ваш префильтр. Обрабатывает один образец за доли миллисекунды, работает с признаками высокой размерности и легко обновляется в режиме реального времени.
  • Edge-first — это стандарт 2026 года. Обработка данных происходит прямо на камере, а сложные вычисления — на региональном сервере. Объём трафика и риски утечки данных снижаются на 60–90%.
  • Данные важнее алгоритма. Даже самая лучшая модель на плохих данных проиграет простой модели на качественных. Выделяйте 60% времени проекта на разметку.

Почему Фора Софт подходит для ML-продуктов в видеонаблюдении

Мы выпускаем продукты для видеонаблюдения и видеоаналитики с 2012 года: 97% успешных проектов и более 200 выпущенных продуктов, выделенная команда по машинному обучению и сильная экспертиза в WebRTC, приёме RTSP/ONVIF и развёртывании на edge-устройствах NVIDIA/Jetson. Что касается детекции аномалий — мы внедрили в продакшен решения на основе Isolation Forest, One-Class SVM, автоэнкодеров, CNN из семейства YOLO и временных моделей на LSTM/трансформерах, включая платформу V. A. L. T., о которой расскажем ниже.

Берите гибридные стеки, когда: точность одной модели перестала расти. Связка вычитания фона, CNN и трансформера работает лучше, чем любая отдельная модель.

Что это значит для вашего продукта: мы не выбираем алгоритм по списку. Мы анализируем топологию ваших камер, допустимые задержки, стоимость разметки и цену ошибки — и предлагаем двухуровневый пайплайн: отсев и подтверждение. Алгоритмы ниже отражают реальные продакшен-стеки, а не обзор из научной литературы.

Строите продукт для видеонаблюдения или видеоаналитики?

Свяжитесь с нами. Подберём пайплайн детекции аномалий под количество ваших камер, допустимые задержки и стоимость ошибки — всё за один разговор, а не за три недели тендера.

Позвоните нам → Напишите нам →

Двухуровневый пайплайн детекции аномалий

99% видео с камер видеонаблюдения — это обычная рутина. Обрабатывать каждый кадр с помощью глубокой нейросети — значит зря нагружать GPU и получать ложные срабатывания. Паттерн, который мы применяем в проектах 2026 года, выглядит так:

Откажитесь от чистого облачного инференса, когда: у вас ограниченный бюджет на трафик. Инференс на edge сокращает трафик на 80% и более — вы отправляете события, а не весь видеопоток.

  1. Уровень 1 — отсев (на edge). Извлекаете признаки (векторы движения, гистограммы, ограничивающие рамки объектов) и прогоняете через быструю модель без учителя — Isolation Forest или GMM — с настройкой на высокую полноту и среднюю точность. Менее миллисекунды на кадр.
  2. Уровень 2 — подтверждение (региональный сервер). Для отмеченных кандидатов показывайте окно на 2–5 секунд в связке CNN + LSTM (или vision-трансформер), которая выдаёт интерпретируемый показатель аномальности и метку класса.
  3. Уровень 3 — проверка человеком (опционально). Если score выше порога — клип с ограничивающими рамками попадает в очередь оператора. По всем важным вопросам окончательное решение остаётся за человеком.

Уровень 1 снижает нагрузку на Уровень 2 в 30–100 раз. Уровень 2 снижает нагрузку на Уровень 3 в 10–50 раз. На реальных проектах с сотнями камер оператор получает примерно один важный алерт в час.

1. Isolation Forest — отсев за доли миллисекунды

Что это. Ансамбль случайных бинарных деревьев. Чем меньше разбиений нужно, чтобы выделить точку, тем выше её аномальность. Модель обучается только на «нормальных» данных, разметка не требуется.

Почему это важно для видеонаблюдения. Инференс занимает доли миллисекунды на обычных CPU, обрабатывает векторы признаков размерности 50–500 (движение, оптический поток, количество объектов), модель обновляется в реальном времени — можно переобучать ночью на данных последних 24 часов «нормального» поведения, не храня размеченный датасет. Это наша базовая модель фильтрации на Уровне 1 в стеке 2026 года.

В чём слабость. Не понимает пиксели. Если подать на вход сырые массивы изображений, она проиграет любой глубокой модели. Всегда работает в паре со стадией извлечения признаков.

Берите, когда: нужен префильтр с высокой полнотой на извлечённых признаках — счётчики объектов, векторы траекторий, тепловые карты загруженности. Рабочая лошадка Уровня 1.

2. One-Class SVM — аномалии в ограниченном пространстве признаков

Что это. Метод опорных векторов, обученный только на «нормальных» данных: строит границу в пространстве признаков. Всё, что за пределами этой границы, — аномалия.

Операционный приоритет: реальный риск — дрейф модели. Планируйте переобучение раз в квартал с учётом освещения, погоды и сезонных изменений.

Почему это важно для видеонаблюдения. Лучший выбор, когда «норма» узкая и хорошо определена: охраняемое помещение ночью, пустая производственная линия, конкретный маршрут транспорта. Ядровой SVM ловит нелинейные паттерны нормы, которые упустит Isolation Forest.

В чём слабость. Обучение плохо масштабируется выше ~50 тыс. примеров. Подбор гиперпараметров (ν, γ) чувствителен, и настраивать их в процессе работы неочевидно.

Берите, когда: у вас чётко определённая норма и не более 50 тыс. обучающих примеров — например, спецзоны с ограниченным доступом, оборудование, сборочные линии.

3. Свёрточные нейронные сети (CNN)

Что это. Основа современного компьютерного зрения. В видеонаблюдении CNN используют в трёх задачах: обнаружение объектов (YOLOv10/11, RT-DETR), классификация (есть или нет нетипичный объект) и как извлекающие признаки компоненты для последующих моделей.

Почему это важно для видеонаблюдения. Любая семантически осмысленная аномалия — «человек в запретной зоне», «оставленный предмет», «появилось оружие» — лучше всего решается как задача детекции или классификации объектов с использованием CNN. YOLOv11 на FP16 даёт около 80 кадров в секунду на Jetson Orin Nano, так что развёртывание на краю сети вполне реально.

В чём слабость. CNN обрабатывают кадры по отдельности. Всё, что связано со временем — например, слежение, движение «на хвосте» или необычные траектории — требует модели, способной работать с последовательностями.

Берите, когда: аномалия семантическая и видна в одном кадре — детекция объектов, классификация, вторжение в зону, обнаружение оставленных предметов.

4. LSTM и временные трансформеры

Что это. Модели, обрабатывающие последовательности признаков (обычно эмбеддинги CNN по кадрам) и выдающие оценку аномальности для временного окна. В 2026 году трансформеры (TimeSformer, VideoMAE) обгоняют классические LSTM на бенчмарках, но LSTM всё ещё лучше подходят для развёртывания на CPU в условиях ограниченных ресурсов.

Типичная ошибка: игнорировать объяснимость. В регулируемых отраслях карты внимания, ограничивающие рамки и журналы аудита — обязательны.

Почему это важно для видеонаблюдения. Большинство интересных аномалий — это временные паттерны: слоняние, движение в обратную сторону, проход «на хвосте», резкие отклонения во времени пребывания, необычные потоки людей и транспорта. Одной CNN их не распознать. LSTM или трансформер поверх признаков CNN — проверенный подход 2026 года.

В чём слабость. Обучающих данных по редким временным аномалиям мало. Часто приходится генерировать синтетические данные — с помощью симуляторов или методов генеративной аугментации.

Берите, когда: аномалия проявляется во времени — слежение, движение «на хвосте», отклонения в траекториях, выбросы по времени пребывания, необычная динамика скоплений людей.

5. Автоэнкодеры — поиск аномалий на уровне пикселей без разметки

Что это. Нейросеть типа энкодер-декодер, обученная восстанавливать «нормальные» кадры. Чем хуже она восстанавливает — тем выше оценка аномальности. Варианты: вариационные автоэнкодеры (VAE) и ConvLSTM-автоэнкодеры (пространственно-временные).

Почему это важно для видеонаблюдения. Без разметки — никаких меток. Модель учится на часах «нормального» видео, а затем помечает всё, что не может реконструировать. Крайне полезно, когда заранее непонятно, какие аномалии искать.

В чём слабость. Может слишком хорошо обобщать: если реконструирует всё подряд — реконструирует и аномалию. Лечится автоэнкодерами с памятью или GAN-вариантами.

Берите, когда: у вас много обычного видео, словарь аномалий неизвестен и нет денег на разметку. Классика для промышленного мониторинга и длительного наблюдения за общественными пространствами.

6. K-Means — кластеризация поведения

Что это. Алгоритм кластеризации, который делит данные на K групп. Для поиска аномалий помечают точки, сильно удалённые от любого центроида, или те, что оказались в маленьком изолированном кластере.

Почему это важно для видеонаблюдения. Дешево, понятно и отлично подходит для кластеризации траекторий. «Нормальные» посетители торгового зала обычно следуют по нескольким десяткам типичных маршрутов — если траектория не попадает ни в один из кластеров, это повод обратить на неё внимание.

В чём слабость. K нужно задавать заранее. Кластеры должны быть сферическими — несферические распределения сбивают алгоритм с толку. Для пиксельных данных не подходит.

Берите, когда: траектории, паттерны загруженности или поведенческие векторы хорошо описываются небольшим числом типичных режимов — например, в ритейле, аэропортах или транспортных узлах.

7. Смеси гауссовских распределений (GMM)

Что это. Вероятностная модель, которая описывает данные как смесь нормальных распределений. Точки, у которых очень низкая вероятность во всех компонентах, считаются аномалиями. Также часто используется для выделения фона в классических пайплайнах компьютерного зрения.

Почему это важно для видеонаблюдения. Стандартный подход для моделирования фона на сценах со стационарной камерой — MOG2/КNN в OpenCV — основан на GMM. Такой метод даёт пиксельные маски, показывающие, «что здесь не должно быть», и остаётся стабильным при неизменной картинке.

В чём слабость. Движущиеся камеры, постепенный дрейф освещения, повторяющиеся движения (листва, флаги). Нужна пара — компенсация движения или обученная модель признаков.

Берите, когда: видеонаблюдение со стационарных камер, где аномалия — это «что нового появилось в кадре»: припаркованные машины, оставленные предметы, вторжение в периметр.

Таблица сравнения алгоритмов

Алгоритм Для чего лучше Задержка Нужна разметка Типичный FPR
Isolation ForestОтсев по признакам (Уровень 1)<1 мс CPUНет3–8%
One-Class SVMСцены с узкой нормой1–5 мсНет (только норма)2–6%
CNN (YOLO/RT-DETR)Семантические покадровые аномалии12–80 кадров в секунду на edgeДа (рамки)<1% (зрелая)
LSTM / трансформерВременные аномалии5–20 мс GPUДа (полная или слабая)1–3%
АвтоэнкодерНеизвестный словарь аномалий5–30 мс GPUНет3–10%
K-MeansКластеризация траекторий<1 мс CPUНет5–12%
GMMВычитание фона<5 мс CPUНет2–8%

Выбор алгоритма по варианту использования

  • Периметр и зональное вторжение. YOLO-CNN детектор → Isolation Forest на признаках траектории для проверки времени пребывания.
  • Оставленные предметы. Вычитание фона на основе GMM → классификация кандидатов с помощью CNN.
  • Слоняние. CNN-детекция и трекинг → LSTM или временной трансформер на признаках треков.
  • Аномалии в толпе (паника, драки, изменение направления движения). Автоэнкодер на основе плотного оптического потока с временным трансформером.
  • Промышленность, конвейер, производственная линия. One-Class SVM на признаках, автоэнкодер на пикселях, управляемая CNN на известных дефектах.
  • Анализ траекторий в ритейле. K-Means по траекториям людей плюс Isolation Forest на признаках корзины и времени пребывания.

Кейс: V. A. L. T. — исследовательская платформа видеонаблюдения

Задача. V. A. L. T. — платформа видеонаблюдения и записи для исследовательских кабинетов, установленная более чем в 100 университетах и научно-медицинских учреждениях. Операторам требовались автоматические оповещения об аномалиях в ходе сессий — например, появление посторонних, использование оборудования не по назначению или необычное поведение участников — при этом без большого количества ложных срабатываний.

Стек, который мы собрали. Уровень 1: фильтрация по движению и загруженности на GMM на edge-боксах записи. Уровень 2: CNN семейства YOLO для обнаружения людей и оборудования, а также компактная LSTM по траекториям детекций — для анализа времени пребывания и выявления аномалий в маршрутах. Уровень 3: очередь задач для оператора в веб-интерфейсе V. A. L. T. с разметкой клипа одним кликом, которая возвращается в систему обучения.

Результат. Доля ложных срабатываний снизилась с ~11% до <1,2% за три месяца работы петли обратной связи с операторами. Среднее время выявления аномалии в сессии — с 45 минут ручного просмотра до ~9 секунд. Загрузка GPU на edge-боксах не превышала 30%, оставляя запас для дополнительной аналитики.

Есть кейс по детекции аномалий в видеонаблюдении?

Свяжитесь с нами — поможем построить пайплайн Уровня 1 и Уровня 2 под топологию ваших камер и стоимость ошибки.

Позвоните нам → Напишите нам →

Деплой на edge и в облаке

Дефолт 2026 года — гибрид с приоритетом edge. Отсев на Уровне 1 (Isolation Forest, GMM, лёгкая CNN) работает на самой камере или на edge-устройстве — Jetson, Hailo или Ambarella. Глубокие модели Уровня 2 — на региональном сервере (on-prem или в VPC). Интерфейс оператора Уровня 3 — в облаке или on-prem, в зависимости от требований к приватности.

Конкретные edge-цели на 2026: Jetson Orin Nano (8–16 TOPS, около 18 750 ₽), Hailo-8 (26 TOPS, около 11 250 ₽), Ambarella CV5 в самой камере. Все они легко справляются с компактными версиями YOLOv10/11 в разрешении 720p со скоростью не менее 30 кадров в секунду.

Экономия трафика от обработки на edge заметна: в V. A. L. T. мы зафиксировали сокращение исходящего трафика на 78% по сравнению с полностью облачной обработкой.

5 ловушек в продакшене, которые мы устранили

  1. Обучение на чистых бенчмарках, деплой на грязных реальных потоках. UCSD Ped2 и ShanghaiTech хороши для публикаций — но это не ваша камера. Всегда собирайте неделю данных с площадки, прежде чем замораживать модель.
  2. Нет петли обратной связи к разметке. Операторы отбрасывают ложные срабатывания. Ловите эти отбрасывания и возвращайте их в обучение. Только это сократило FPR V. A. L. T. вдвое за 90 дней.
  3. Игнорирование концептуального дрейфа. Завод сменил смены, магазин — планировку — и ваша модель «нормы» перестала работать. Запланируйте ночное переобучение на данных за последние 7 дней.
  4. Один порог на все случаи. Один порог не может одновременно определять «подозрительное поведение» и требовать «вызывать полицию». Используйте многоуровневые пороги с разными очередями обработки.
  5. Не заложен бюджет на разметку. Для работы пайплайнов на уровне продакшена с CNN и LSTM нужно 5–20 тыс. размеченных событий. Закладывайте 15–75 ₽ за каждое событие и 6–12 недель на организацию процесса разметки.

Часто задаваемые вопросы

Какой алгоритм лучше для обнаружения аномалий в видеонаблюдении в реальном времени?

Одного алгоритма не существует. Продакшен-паттерн 2026 года: Isolation Forest или GMM на edge для фильтрации на Уровне 1, плюс CNN из семейства YOLO и временной LSTM или трансформер для подтверждения на Уровне 2. Пайплайны, основанные на одном алгоритме, либо перегружают операторов ложными срабатываниями (слишком чувствительные), либо пропускают реальные события (слишком консервативные).

Нужна ли разметка для обучения детектора аномалий?

Для Уровня 1 — нет. Isolation Forest, GMM, One-Class SVM и автоэнкодеры обучаются только на «нормальных» данных. Уровню 2 (семантическая детекция) для достижения точности в продакшене обычно требуется 5–20 тыс. размеченных кадров или клипов. Заложите бюджет на разметку до того, как соглашаться на CNN-подход.

Вытесняют ли vision-трансформеры CNN в 2026 году?

На бенчмарках — да, для крупных моделей. В реальном видеонаблюдении CNN пока остаются лидерами: на периферийном оборудовании у них выше скорость работы и лучше поддержка квантизации. Ожидайте, что трансформеры сначала закрепятся на уровне регионального сервера (Уровень 2), а потом появятся на периферии — по мере того как оборудование на периферии подойдёт к ним по возможностям к 2027–2028 году.

Какой целевой FPR закладывать?

Число задаёт толерантность оператора. Один оператор на 100 камер может обрабатывать примерно 1–2 алерта в час — дальше начинается усталость от уведомлений. Если модель выдаёт 40 алертов на камеру в сутки, вы фактически создаёте шум. Для большинства задач видеонаблюдения целевой FPR на границе решения Уровня 2 — менее 1,5%.

Можно ли крутить всё это на камере?

Уровень 1 — да. Isolation Forest, GMM и лёгкие CNN легко работают на современных SoC-камерах (Ambarella CV5, HiSilicon) и edge-устройствах уровня Jetson. Уровень 2 (тяжёлая CNN плюс LSTM или трансформер) лучше размещать на региональном сервере, особенно если к нему подключено несколько камер. В 2026 году оптимальный баланс цены и задержки — обработка Уровня 1 на edge, Уровня 2 — на региональном сервере.

А что с приватностью и регулированием?

Применяются GDPR, EU AI Act и законы о биометрии на уровне отдельных юрисдикций. Обработка на edge сильно упрощает соблюдение требований: сырое видео не покидает площадку, наружу передаются только метаданные алертов и короткие видеодоказательства. Если поток всё же должен покидать площадку, применяйте размытие лиц и номеров на edge. Поддерживайте политику хранения данных и подписывайте DPA с каждым поставщиком ML-решений.

Сколько времени занимает создание системы детекции аномалий для продакшена?

MVP пайплайна на одной заранее определённой сцене: 6–10 недель. Продакшен-решение для нескольких сцен и площадок с петлёй обратной связи и интерфейсом оператора: 4–6 месяцев. Самое долгое — сбор данных и разметка, а не работа над ML.

Итоги

Семь алгоритмов выше — это не рейтинг, а набор инструментов. Isolation Forest и GMM отсевают выбросы; One-Class SVM работает в строго определённых сценариях; CNN отвечают за понимание содержимого кадра; LSTM и трансформеры — за анализ временных закономерностей; автоэнкодеры выявляют неизвестные аномалии; K-Means группирует поведение. В продакшене вопрос стоит не «какой выбрать?», а «какой двухуровневый пайплайн собрать?» — и каждый серьёзный продукт видеонаблюдения, который мы выпускаем в 2026 году, сочетает быстрый первичный отсев без разметки с глубоким семантическим анализом.

Инженерная реальность: модели — это 30% проекта. Данные, разметка, обратная связь от операторов, борьба с дрейфом и edge-деплой — остальные 70%. Закладывайте бюджет соответственно.

Готовы спроектировать AI-пайплайн для вашего видеонаблюдения?

Свяжитесь с нами — разберём пайплайн, бюджет на задержки, экономику разметки и особенности edge-оборудования под ваши камеры и сценарии.

Позвоните нам → Напишите нам →

Android и SDK

Лучшие Android SDK для приложений видеонаблюдения в 2026

Матрица решений по затратам, ИИ и комплаенсу — четыре трека.

Архитектура VMS

Масштабируемые системы управления видео в 2026

Пять инженерных решений, которые реально определяют масштаб VMS.

AI-видео

5 лучших инструментов ИИ для улучшения видео в 2026

Гайд по выбору с фокусом на пайплайн — задержки, SDK, стоимость.

Источники и материалы: бенчмарки аномалий UCSD Pedestrian и ShanghaiTech; документация от производителей NVIDIA Jetson Orin, Hailo, Ambarella CV5; статьи по YOLOv10/11 и RT-DETR; данные внедрений V. A. L. T. компании «Фора Софт» (2020–2026, с разрешения клиента).

Нужна помощь с оценкой для вашего роадмапа? Свяжитесь с нами — обсудим все детали за один разговор.

Матрица сравнения: разработать, купить, гибрид или open-source для ML-детекции аномалий в видеонаблюдении

Быстрая решётка для четырёх типовых путей в 2026 году. Берите строку, которая соответствует размеру команды, регуляторной нагрузке и желаемому сроку получения результата — а не ту, что звучит амбициознее всего.

ПодходДля когоТрудозатратыВремя до результатаРиски
Купить готовый SaaSКоманды до 10 инженеров, типовой сценарийНизкие (1–2 недели)1–2 неделиПривязка к вендору, ограничения кастомизации
Гибрид (SaaS плюс свой слой)Средний бизнес, смешанные сценарииСредние (1–2 месяца)1–3 месяцаТехнический долг на стыке: две системы в эксплуатации
Своя разработка (современный стек)Корпорации, уникальные данные или соответствие требованиямВысокие (3–6 месяцев)6–12 месяцевСкорость разработки, удержание специалистов
Open-Source на своём хостингеКогда важна стоимость, сильная техническая командаВысокие (2–4 месяца)3–6 месяцевОперационная нагрузка, обновления безопасности
  • AI-инструменты улучшения видео
  • AI-распознавание эмоций в реальном времени
  • Масштабируемые системы управления видео
  • Технологии