
Главное
• YOLO — это детектор. Продукт делает трекер. ByteTrack, BoT-SORT и DeepSORT решают разные задачи в продакшене: ошибётесь с выбором — и доля ложных идентификаций удвоится.
• BoT-SORT + YOLOv11 — выбор по умолчанию в 2026 году. Показывает более высокий MOTA, чем ByteTrack, на плотных сценах и работает быстрее, чем вычисление внешних эмбеддингов в DeepSORT. Используйте его, если нет веских причин выбрать что-то другое.
• Edge выигрывает по стоимости и приватности. Jetson Orin Nano (15 тыс. ₽, 40 TOPS) справляется с YOLOv11 + BoT-SORT на 30 fps в разрешении 1080p. Облачный GPU обходится в 5–10 раз дороже на одну камеру в год и создаёт риски с точки зрения GDPR.
• Мульти-камерная ре-идентификация — вот где системы дают сбой. Передача ID между камерами требует использования эмбеддингов внешнего вида (фичи в стиле DeepSORT) и стратегии хеширования, которая не передаёт персональные данные между объектами.
• Соответствие требованиям — часть архитектуры, а не «фаза 2». Требования EU AI Act для высокорисковых систем вступают в силу с 2 августа 2026 года. Размытие данных на edge, аудит-логи и телеметрию для DPIA закладывайте с самого начала.
Почему этот гид по сборке YOLO + трекера написала Фора Софт
Мы выпускаем видеопродукты с интеграцией ИИ с 2005 года и поддерживаем 100% успешность выполнения заказов на Upwork. Наша практика охватывает видеостриминг, видеонаблюдение, телемедицину, судебные системы и live-торговлю — сферы, где даже небольшая ошибка в трекере может за несколько дней привести к конфликту с клиентами или юристами.
Конкретика: AI-видеонаблюдение, работающее 24/7 в более чем 650 организациях, плюс продакшен-проекты для Sprii (ведущая в Европе платформа live-торговли, более 365 млн евро продаж), TransLinguist (контракт с NHS-UK) и BrainCert (LMS на WebRTC промышленного масштаба).
Этот гид — чек-лист сборки, который мы передаём продуктовым командам при сдаче кастомной AI-системы видеонаблюдения. Он охватывает детектор, трекер, оборудование edge-уровня, мультикамерную реидентификацию, панель оператора и инструменты обеспечения соответствия — примерно в том порядке, в котором всё это собирается.
Делаете кастомный AI-продукт для видеонаблюдения?
Расскажите, сколько у вас камер, какие требования к задержкам и по соответствию стандартам. Набросаем пайплайн на базе YOLO и трекера — и смету — за 30 минут.
Пайплайн в общих чертах
Современный пайплайн AI-видеонаблюдения состоит из шести этапов. Большинство сбоев в продакшене, с которыми мы сталкивались, связаны с экономией на этапе 4 (re-ID) или этапе 6 (инструменты соответствия). Все шесть этапов закладывайте с самого начала.
1. Захват. IP-камеры, передающие видео в форматах H.264 или H.265 по протоколу RTSP. ONVIF — чтобы не зависеть от производителя. Частоту кадров подбирайте в зависимости от скорости детекции (10–30 кадров в секунду — оптимально для большинства задач видеонаблюдения).
2. Детекция. YOLOv9, v10 или v11 на edge-GPU. Один проход детекции на кадр. На выходе — bounding box, метка класса и уровень уверенности.
3. Трекинг. ByteTrack, BoT-SORT или DeepSORT связывают обнаруженные объекты между кадрами, присваивая им стабильные ID. Именно трекер позволяет сказать: «человек 47 вошёл в 14:32 и вышел в 14:47».
4. Ре-идентификация. Эмбеддинги внешнего вида (в стиле DeepSORT или на основе VLM), которые передают идентификаторы треков между камерами и позволяют сохранять их при коротких перекрытиях.
5. Детекция поведения и событий. На основе правил, базовой модели аномалий и (по желанию) обогащения через VLM. Именно отсюда формируются алерты.
6. Инструменты соответствия. Размытие лиц и номеров на edge, аудит-логи с append-only, телеметрия для DPIA, операторская панель с объяснимостью. Встроены в пайплайн, а не добавлены отдельно.
Какую версию YOLO выбрать в 2026 году
С 2024 года YOLO разделился на несколько веток. Несколько исследовательских групп развивают совместимые, но всё же различающиеся варианты. Для видеонаблюдения в продакшене реалистичный шорт-лист — три версии.
| Версия | Авторы | Когда подходит | Производительность (Jetson Orin Nano, 1080p) |
|---|---|---|---|
| YOLOv8 | Ultralytics | Зрелый, простой экспорт в ONNX, большая экосистема | 35–45 fps |
| YOLOv9 | WongKinYiu и соавторы | Лучшая точность на мелких объектах, бэкбон GELAN | 25–35 fps |
| YOLOv10 | Tsinghua | Без NMS, ниже задержка, силён на плотных сценах | 40–50 fps |
| YOLOv11 | Ultralytics | Лучший баланс mAP и задержки; выбор по умолчанию для новых проектов | 30–40 fps |
Наш выбор по умолчанию в 2026 году — YOLOv11 small или medium для новых edge-сборок. Более крупные версии (l, x) используем только в тех случаях, когда точность имеет решающее значение и доступен достаточно мощный GPU.
Совет. Всегда экспортируйте модель в ONNX и запускайте через TensorRT или ONNX Runtime на edge-устройствах. Нативный PyTorch при инференсе работает в 2–3 раза медленнее и привязывает вас к стеку обучения.
Берите YOLOv11, когда: собираете новый пайплайн в 2026 году и хотите оптимальный баланс точности и задержки на железе уровня Jetson.
ByteTrack — простой и быстрый трекер
Ключевая идея ByteTrack — использовать как высокоуверенные, так и низкоуверенные детекции, чтобы сохранять треки при перекрытиях. Это простой трекер на основе фильтра Калмана и венгерского алгоритма назначения с двухэтапной ассоциацией: сначала обрабатываются высокоуверенные детекции, затем — низкоуверенные, чтобы восстановить частично скрытые объекты. Модель не использует внешние признаки и эмбеддинги.
Зачем брать
Скорость и простота. ByteTrack добавляет менее 5 мс на кадр к работе детектора и не требует дополнительных моделей. В простых одно-камерных сценариях со средней плотностью людей мало конкурентов.
Ограничения
Без памяти внешнего вида он не сможет снова распознать объект после длительного перекрытия или при переходе между камерами. Количество ошибок в отслеживании ID растёт в плотных толпах. Если в кадре одновременно находится более 20 объектов, расположенных близко друг к другу, ByteTrack в одиночку уже не справится.
Берите ByteTrack, когда: одна камера, низкая или средняя плотность людей и важна каждая миллисекунда. Такой сценарий часто встречается в промышленной безопасности и системах учёта трафика.
BoT-SORT — трекер по умолчанию в 2026 году
BoT-SORT («Better-on-Top SORT») расширяет ByteTrack тремя идеями: компенсация движения камеры, более богатая фича внешнего вида и более умное состояние фильтра Калмана. Результат — стабильно более высокие показатели MOTA на бенчмарках MOT17/20, чем у ByteTrack на плотных сценах, при контролируемой стоимости по задержке.
Зачем брать
Лучшая точность из коробки. Камерная компенсация движения (CMC) — ключевая функция для подвижных камер: PTZ, дроны, видеорегистраторы, нагрудные камеры; полезна и на стационарных камерах при наличии вибраций. Лёгкие ReID-эмбеддинги позволяют находить объекты после кратковременных перекрытий.
Ограничения
CMC добавляет 8–15 мс на кадр на Jetson. Для сценариев с очень высокой частотой кадров это заметная нагрузка. ReID-эмбеддинг добавляет ещё 5–10 мс, но он не обязателен: BoT-SORT можно запустить и без ReID, чтобы получить более лёгкий пайплайн.
Берите BoT-SORT, когда: собираете новую систему в 2026 году и хотите универсальный трекер — для одной камеры, нескольких камер (с подключённым re-ID) и подвижных камер. Выбор по умолчанию для большинства проектов.
DeepSORT — классика с упором на внешний вид
DeepSORT — классика жанра. Он объединяет фильтр Калмана с глубоким дескриптором внешности (изначально — признаки на WideResNet) и сопоставляет обнаруженные объекты между кадрами в первую очередь по визуальному сходству. Алгоритм тяжелее, чем ByteTrack и BoT-SORT, но даёт лучшие результаты при длительных перекрытиях и при переходе объектов между камерами.
Зачем брать
Сильное моделирование внешнего вида. Для мультикамерных систем, где нужно распознавать одного и того же человека при переходе между непересекающимися ракурсами (вход, проход, выход), использование головы с эмбеддингами в стиле DeepSORT обязательно. Современные варианты применяют эмбеддинги OSNet или TransReID вместо исходных признаков и повышают точность ещё больше.
Ограничения
Стоимость вычислений. Каждая детекция проходит через сеть эмбеддинга — это ещё 10–30 мс на кадр в зависимости от модели. Эталонный код DeepSORT является исследовательским — для использования в продакшене его придётся дорабатывать вручную.
Берите DeepSORT (или BoT-SORT с ReID в стиле DeepSORT), когда: мульти-камерная реидентификация — часть продукта, и у вас есть бюджет на GPU для инференса эмбеддингов.
Сравнение трекеров: какой подойдёт для вашей задачи
| Трекер | Стоимость на кадр | Плотная сцена | Межкамерный ReID | Лучше всего подходит |
|---|---|---|---|---|
| ByteTrack | < 5 мс | Средне | Нет | Промышленная безопасность, трафик |
| BoT-SORT | 15–25 мс | Сильно | С ReID-надстройкой | Большинство ритейл-проектов, smart city |
| DeepSORT (современный) | 25–40 мс | Сильно | Да — нативно | Сети ритейла, кампусы |
Совет: не комбинируйте трекеры между камерами. Выберите один трекер на весь проект — тогда операторская панель, метрики и отчёты по инцидентам будут согласованы.
Edge-железо: где на самом деле работают YOLO + трекер
Инференс на edge — архитектура по умолчанию для биометрического и чувствительного к приватности видеонаблюдения в 2026 году. Три платформы покрывают 95% проектов.
NVIDIA Jetson Orin Nano (40 TOPS, ~15 тыс. ₽, 25–50 Вт). Идеальный выбор для серьёзных проектов. Обрабатывает YOLOv11 + BoT-SORT на 30 fps в разрешении 1080p с использованием TensorRT. Поддерживает зрелый стек CUDA и легко интегрируется с DeepStream SDK.
Hailo-8 (13 TOPS, 3 Вт). Подходит для работы от батареи или при жёстких температурных ограничениях. Пропускная способность ниже, зато энергоэффективность отличная. Инструменты появились в 2025–2026 годах, но пока уступают NVIDIA по зрелости.
Аппаратные модули Ambarella, Hikvision и Dahua. Часто используются при апгрейде старых систем видеонаблюдения. Плюсы: всё уже готово к работе. Минусы: зависимость от производителя и проприетарные форматы. Выбирайте модели с поддержкой ONVIF и возможностью экспорта в ONNX — это позволит в будущем заменить оборудование без потерь.
Застряли между edge и облаком или с выбором трекера?
Мы принимали такие решения на продакшен-проектах. Обычно 30 минут обсуждения всё проясняют.
Мульти-камерная ре-идентификация — самая сложная
Трекинг в одной камере — решённая задача. Системы ломаются на ре-идентификации между камерами. Задача такая: когда человек 47 исчезает с камеры А, а через 30 секунд на камере Б появляется кто-то визуально похожий, нужно решить — присваивать ли ему тот же ID.
Архитектурный паттерн. Edge-трекер выдаёт трек и эмбеддинг внешнего вида. Центральный re-ID-сервис хранит эмбеддинги за короткое время по локациям. При поступлении нового трека с любой камеры система ищет в хранилище ближайший эмбеддинг в пределах временного окна. Если косинусная схожесть выше заданного порога — новому треку присваивается существующий глобальный ID.
Выбор эмбеддинга. OSNet или TransReID — подходят для ре-идентификации людей в продакшене. Обе модели представлены в формате ONNX, объёмом 1–2 МБ, и обрабатывают одну детекцию за 5–15 мс на edge-устройстве с GPU.
Подвох с PII. Эмбеддинги — это биометрические данные. Хешируйте глобальные ID по площадке или региону; никогда не передавайте сырые эмбеддинги в операторскую панель; не делитесь эмбеддингами между организациями без законного основания по статье 9 GDPR.
Подбор порога. Типичная рабочая точка по косинусной схожести — около 0,65–0,75. Прогоните валидацию на отложенной выборке реальных записей с ваших камер: распределения одежды в торговом центре отличаются от аэропортных, а вместе с ними — и оптимальные пороги.
Детекция поведения и событий: правила, аномалии, VLM
Когда у вас есть стабильные треки, возникает другой вопрос: что считать событием? В продакшене обычно используют три парадигмы одновременно.
1. Правила. Пересечение виртуальной линии, превышение времени пребывания, ограничение по числу людей, вход в запрещённую зону. Быстро, понятно, хорошо работает с известными угрозами. Легко объяснить командам по соблюдению норм.
2. Базовая модель аномалий. Обучите автоэнкодер или одноклассовую модель на данных о нормальном поведении за 30 дней. Отмечайте отклонения. Модель выявляет «неизвестные неизвестности» и снижает количество ложных срабатываний на 30–40% по сравнению с использованием только правил.
3. Обогащение через VLM (опционально). Отправьте 5-секундный клип с высокоуверенным аномальным событием в VLM (Qwen-VL, дообученная Florence-2 или облачная GPT-4o), чтобы получить описание на естественном языке. Это полезно для операторской панели и отчётов об инцидентах. Никогда не позволяйте VLM выполнять действия по реагированию — у моделей бывают галлюцинации.
Инструменты соответствия, встроенные в пайплайн
Обязательства EU AI Act для высокорисковых систем вступают в силу 2 августа 2026 года. GDPR действует с 2018 года. ISO/IEC 42001 становится обязательным требованием при закупках. Заложите соответствие с самого начала — иначе доработки позже обойдутся в 5–10 раз дороже.
Размытие лиц и номеров на edge. Распознаём, размываем без возможности восстановления, отправляем дальше. На Jetson — 5–10 мс. Риск повторной идентификации снижается почти до нуля.
Аудит-логи — только для добавления. Каждый доступ к данным, каждое решение модели и любое изменение оператора фиксируются в подписанной записи. Хранение — от 3 до 7 лет.
Минимизация данных. Сырой видеофайл хранится 7–14 дней, метаданные — 90 дней, дольше — только при наличии задокументированной цели.
Дезагрегированный мониторинг искажений. Еженедельные автоматические отчёты о работе детектора и трекера по демографическим группам. Триггер срабатывает, если худшая группа по уровню ошибок опережает лучшую более чем в 1,5 раза.
Телеметрия под DPIA. За один клик можно получить карточку модели, демографию обучающих данных, политику хранения и актуальный аудит искажений. Аудиторы перестают пугать, когда у вас всё это под рукой.
Наша смежная статья по регуляторике — «AI Surveillance Trends 2026: доверие через качество данных и этику» — подробно рассматривает положения EU AI Act и стандарта ISO 42001.
Модель затрат: edge против облака на 200 камерах
Разберём пример: 200 камер, YOLOv11 + BoT-SORT, правила поведения и базовая модель аномалий, размытие на edge, полное аудит-логирование.
| Подход | Капитальные | Операционные расходы в год | Соответствие |
|---|---|---|---|
| Гибрид с приоритетом edge | 3–22,5 млн ₽ (Jetson + монтаж) | 5,4–27 млн ₽ (эксплуатация и индекс в облаке) | Сильно — биометрия не покидает площадку |
| Только облако | 375 тыс. – 1,1 млн ₽ (загрузка с NVR) | 15–37,5 млн ₽ (GPU и хранение) | Слабо — сырое видео по умолчанию уходит вовне |
Edge выигрывает по совокупной стоимости владения примерно от 50 камер и по соответствию — почти всегда. Облако выигрывает по скорости запуска пилота и там, где соответствие не является приоритетом (что в 2026 году встречается редко).
Фреймворк решения: пять вопросов, чтобы выбрать стек
Вопрос 1. Какова ваша юрисдикционная поверхность? EU, UK, Иллинойс, Калифорния — гибрид с приоритетом edge единственный безопасный вариант по умолчанию. Только США без Калифорнии — облако допустимо, но мода на него уходит.
Вопрос 2. Сколько одновременных объектов на камеру в пике? Меньше 15 — справится ByteTrack. От 15 до 40 — BoT-SORT. Больше 40 (стадионы, транспортные узлы) — BoT-SORT с ReID в стиле DeepSORT.
Вопрос 3. Нужен ли мульти-камерный re-ID? Нет — используйте BoT-SORT или ByteTrack. Да — добавьте эмбеддинги OSNet или TransReID к BoT-SORT или применяйте современный DeepSORT.
Вопрос 4. Каков ваш бюджет по задержкам? Меньше 100 мс end-to-end — edge с ByteTrack. 100–300 мс — edge с BoT-SORT. Более 500 мс — гибридный подход допустим.
Вопрос 5. Собирать самим или покупать? В стандартном сценарии (например, защита периметра или предотвращение потерь в ритейле) готового решения может быть достаточно. Если же речь идёт о специфичном отраслевом контексте, этически чувствительных задачах или мультиплощадочном re-идентифицировании — лучше собирать систему вместе с партнёром.
Мини-кейс: запуск 200 камер для ритейла, end-to-end задержка меньше 100 мс
Ситуация. Розничным сетям требовались алерты по защите от потерь в реальном времени для 18 магазинов и 200 камер. Конкуренты предлагали только облачные решения и оценивали годовую эксплуатацию в 36 млн ₽ — с передачей необработанного видео в регион US-East-1, что не соответствовало требованиям GDPR для европейских подразделений.
План на 12 недель. На каждую камеру развернули Jetson Orin Nano (200 устройств по 15 тыс. ₽ каждое) с YOLOv11-medium и BoT-SORT с эмбеддингами OSNet для межкамерного re-ID. Размытие лиц и номеров происходит на устройстве — до того, как данные покинут камеру. Для каждого магазина обучили базовую модель аномалий на 30 днях нормального трафика. Центральное облако хранит метаиндекс и обогащает клипы с помощью дообученного Qwen-VL, генерируя описания поведения. DPIA, согласование с ISO/IEC 42001 и дезагрегированный мониторинг искажений — внедрены с первой недели.
Результат. Сквозная задержка алертов — 70–90 мс (от камеры до операторской панели). Точность межкамерного re-ID — 87% на отложенной выборке. Уровень ложных срабатываний — 12 алертов на камеру в день, что в 8 раз лучше, чем у предыдущей готовой системы клиента. Годовая эксплуатация — 13,5 млн ₽, или около 38% от стоимости облачного решения, при этом вся биометрия остаётся на локальной площадке.
Пять провалов, которые мы видим в продакшене снова и снова
1. Зацикленность на детекторе. Команды настраивают YOLO под конкретный датасет, но при этом игнорируют трекер. В большинстве задач видеонаблюдения трекер важнее, чем несколько дополнительных процентов точности у детектора.
2. Пропуск экспорта в ONNX. Нативный PyTorch на edge работает в 2–3 раза медленнее и привязывает к стеку обучения. Всегда экспортируйте модель в ONNX и запускайте через TensorRT или ONNX Runtime.
3. Несогласованные частоты кадров. Детекция на 30 fps + трекер на 30 fps + детекция поведения на 1 fps — рецепт ошибок с таймингом. Выберите одну частоту обработки и придерживайтесь её на всём протяжении пайплайна.
4. Утечка PII через эмбеддинги. Эмбеддинги внешнего вида — это биометрические данные. Не передавайте их в операторскую панель и не делитесь между площадками без чётко зафиксированного законного основания.
5. Соответствие во «второй фазе». Аудит-логи, DPIA, мониторинг искажений, размытие на edge — если отложить, переделка потом обойдётся в 5–10 раз дороже, чем если закладывать всё с самого начала.
Какие KPI отслеживать после запуска
Качество. mAP детектора по когортам (целевой разрыв < 1,5×), MOTA трекера (> 65 на репрезентативных сценах), количество переключений ID в минуту (< 2 на камеру в пиковые моменты), точность межкамерного re-ID (> 80%).
Бизнес. Ложные срабатывания на камеру в день (цель < 25), доля реальных инцидентов среди всех срабатываний по сравнению с предыдущей базой, среднее время реакции (цель < 5 мин), снижение потерь в ритейле (обычно 5–15%).
Надёжность. Аптайм edge на камеру (> 99%), задержка инференса P99 (в рамках бюджета), целостность аудит-лога (100%), время подготовки отчёта для DPIA (< 1 час).
Когда НЕ нужно собирать кастомный пайплайн YOLO + трекер
Три сценария, когда мы советуем клиентам подождать или выбрать готовое решение.
Меньше 30 камер. Стоимость инженерных работ съедает выгоду. Готовый аппаратный модуль от Hikvision или Dahua и тонкая кастомная панель почти всегда оказываются выгоднее.
Стандартный сценарий без отраслевой специфики. Базовая периметральная детекция, простая защита от потерь, обычный подсчёт трафика — рынок готовых решений зрелый.
Нет ML-инженерной команды. Кастомный пайплайн, который вы не сможете поддерживать, быстро окажется заброшенным. Сначала купите, а собирать начнёте, когда появится команда, способная его вести.
Как протестировать пайплайн YOLO + трекер до запуска
Соберите отложенную тестовую выборку на реальных записях с ваших камер — с разной демографией, освещением, погодой и плотностью толпы. Не используйте цифры по MOT17 из статьи как ориентир — они не обобщаются.
Детекция. mAP@0.5 в среднем и по отдельным когортам. Целевой разрыв на худшей когорте — менее чем в 1,5 раза.
Трекинг. MOTA, IDF1, количество переключений ID в минуту. MOTA выше 65 — хороший показатель для большинства сцен видеонаблюдения.
End-to-end. Уровень ложных срабатываний на стороне оператора при рабочем пороге; среднее время обнаружения на наборе известных событий; задержка P50/P95/P99 по всему пайплайну.
FAQ
Какая версия YOLO лучше для видеонаблюдения в 2026 году?
YOLOv11 small или medium — наш выбор по умолчанию для новых edge-сборок: лучший баланс mAP и задержки на железе уровня Jetson. YOLOv10 (Tsinghua) хорошо работает на плотных сценах благодаря архитектуре без NMS. YOLOv8 до сих пор часто используется в унаследованных стеках. Для продакшена всегда экспортируйте модель в ONNX и запускайте через TensorRT.
ByteTrack, BoT- SORT или DeepSORT — что выбрать?
ByteTrack: простой, быстрый, подходит для одной камеры, работает при низкой и средней плотности объектов. BoT-SORT: выбор по умолчанию в 2026 году для большинства проектов в ритейле и smart city — хорошо справляется с компенсацией движения и лёгкой реидентификацией. DeepSORT (современная версия с OSNet/TransReID): когда нужна мультикамерная реидентификация и это ключевой продукт. Один трекер на проект — для согласованности.
Можно ли запустить YOLO с трекером на Jetson Orin Nano?
Да. YOLOv11 small/medium с BoT-SORT обрабатывает видео в 1080p со скоростью 30 кадров в секунду через TensorRT. При добавлении эмбеддингов OSNet для межкамерного re-identification производительность падает до 20–25 кадров в секунду. На одну камеру требуется 25–50 Вт, поэтому заранее продумайте систему охлаждения на месте установки.
Как делать межкамерную реидентификацию без утечек PII?
Относитесь к эмбеддингам внешнего вида как к биометрическим данным. Хешируйте глобальные ID по локациям; никогда не передавайте сырые эмбеддинги в операторскую панель; не делитесь эмбеддингами между организациями без документально подтверждённого законного основания по статье 9 GDPR или BIPA. Сравнивайте в коротком временном окне (5–30 минут) и храните в re-ID-хранилище, привязанном к конкретной площадке.
Как этот пайплайн соответствует EU AI Act?
Высокорисковые обязательства EU AI Act вступают в силу 2 августа 2026 года. Описанная архитектура — выполнение инференса в первую очередь на edge, необратимое размытие данных до передачи, аудит-логи с возможностью только добавления записей, дезагрегированный мониторинг искажений, телеметрия, подготовленная для DPIA — спроектирована так, чтобы соответствовать этим требованиям. Соответствие стандарту ISO/IEC 42001 — наиболее прозрачный способ подтвердить соответствие при аудите в ходе закупок.
Стоит ли использовать облачный VLM (GPT-4o, Claude, Gemini) для детекции поведения?
Для обогащения высокоуверенных аномальных событий описаниями на естественном языке — да, но с осторожностью. Для запуска действий по реагированию — нет: VLM склонны «галлюцинировать» описания на кадрах с камер видеонаблюдения. Гибридный подход: на первом этапе — правила и базовая модель обнаружения аномалий на edge-устройствах, опциональное обогащение через VLM — только для выборки, отображаемой на операторской панели, с порогами уверенности и контролем «человек в петле».
Сколько занимает сборка кастомной AI-системы на 200 камер?
Пилот (10–30 камер, одна площадка) — 3 месяца. Региональный запуск (50–100 камер, 5–10 площадок) — 6 месяцев. Полная продакшен-система на 200 камер с согласованием по EU AI Act — 9–12 месяцев в формате Agent Engineering, 12–18 месяцев — по классическим агентским срокам.
Сколько стоит кастомный AI-продукт для видеонаблюдения на 200 камер?
Капитальные затраты на edge-сборку: 3–22,5 млн ₽ на оборудование и монтаж плюс стоимость инженерной разработки самой сборки (обычно это значительная часть кастомной разработки — 37,5–112 млн ₽). Операционные расходы в год — 5,4–27 млн ₽, в зависимости от уровня облачного обогащения и политики хранения данных. С Agent Engineering мы стабильно работаем в нижней части этих диапазонов.
Что почитать дальше
Соответствие
Доверие к AI-видеонаблюдению: данные, искажения и EU AI Act
Регуляторная карта, контроль искажений и паттерны privacy-by-design.
Edge AI
Edge AI против Cloud AI для видеонаблюдения
Компромиссы между задержкой и стоимостью, определяющие архитектуру выше.
Найм
Когда нанимать разработчиков computer vision
Фреймворк «строить или нанимать» для инженеров под ваш продукт на основе резюме.
Видео-ИИ
Как работают видео-агенты на основе ИИ в 2026 году
Архитектура, бюджеты задержек и поминутная экономика видеоАИ.
Архитектура
Масштабирование видеостриминга до 1 миллиона зрителей
Стриминговый слой — основа любого крупного проекта видеонаблюдения.
Готовы запустить кастомный пайплайн YOLO + трекер?
YOLOv11 + BoT-SORT на edge-устройстве Jetson, с эмбеддингами внешнего вида для межкамерного re-ID и полным набором инструментов соответствия — это готовый рецепт для продакшена 2026 года. Детектор — самая простая часть. Выбор трекера, архитектура edge против облака, мультикамерный re-ID и соответствие с первого дня — вот где рождается настоящий продукт.
Если хотите проверить текущий пайплайн или получить план на 9–12 месяцев под продакшен на 200 камер — мы готов работать вместе с вами. У нас 20 лет опыта в мультимедиа и ИИ, 100% успешных проектов на Upwork, Agent Engineering для быстрой поставки. Приведите количество камер и требования по соответствию — мы предложим архитектуру.
Хотите настроить собственный AI-пайплайн видеонаблюдения с YOLO и трекером?
Мы оценим, рассчитаем и запустим — с инструментами по приватности, искажениям и соответствию, которые помогут соблюдать требования EU AI Act, GDPR, BIPA и HIPAA.
