
Главное
• Облачный инференс не справляется с масштабом флота. 10 000 камер × 30 инференсов в секунду = 26 млрд вызовов API в сутки. Даже по 0,07 ₽ за вызов это 58 млн ₽ в месяц только на инференс. Edge AI запускает те же модели за счёт стоимости камер и электроэнергии.
• 4 мс на инференс на устройстве — реальная цифра. Современные NPU (Hailo-8, Coral TPU, Jetson Orin Nano) классифицируют кадр 1080p за менее чем 5 мс. Детекция и трекинг в реальном времени на 30 кадрах в секунду — всё происходит прямо в камере.
• Экономия трафика — второй приз. Edge AI отправляет события, а не сырые кадры. Камера, работающая 24/7 и передающая только события движения, снижает объём данных с ~1,5 ТБ в месяц до ~30 ГБ — в 50 раз меньше. Больше всего выигрывают сотовые сети.
• YOLO26 в INT8-квантизации — надёжный инструмент. Обнаружение людей, машин и аномалий в реальном времени на мобильных устройствах. Экспорт в CoreML, TFLite и ONNX поддерживает Apple, Android и встраиваемый Linux.
• Приватность по умолчанию работает на устройстве. Исходные кадры никогда не покидают камеру. В облако передаются только метаданные событий и снимки по запросу. Такая архитектура значительно упрощает соблюдение GDPR, CCPA и других нормативов в области видеонаблюдения.
Почему этот плейбук написала Фора Софт
Фора Софт с 2005 года реализовала более 50 проектов в сфере видеонаблюдения и VMS (Video Management Systems). EyeBuild — солнечное AI-видеонаблюдение для строительных площадок и центральный пример этого гайда, VALT — система записи юридических заседаний, используемая более чем в 650 организациях США, Live Eye Surveillance, NetCamStudio, Mindbox и Doorbell App.
EyeBuild — нестандартный кейс: камеры на солнечных панелях с 4G/5G, без проводного интернета, выпускаются клиентом и работают полностью офлайн на батарее с автономностью 14 дней плюс 3 дня аварийного резерва. Обнаружение движения на базе ИИ работает прямо на устройстве, потому что передать 4K@60fps по 4G невозможно, а ждать 200 мс ответа от облака нельзя — нарушители уже лезут через забор. Цифры в этом гайде взяты из этого продакшена и ещё четырёх проектов AI-видеонаблюдения, которые мы выпустили в 2024–2025 годах.
Если вы внедряете или покупаете AI-видеонаблюдение и у вас более 50 камер, этот гайд расскажет, когда edge-обработка оказывается выгоднее, какой NPU выбрать, как развернуть YOLO26 на тысячах устройств и где чаще всего возникают проблемы в таких проектах.
Счёт за облачный инференс растёт быстрее флота?
Пришлите количество камер, частоту событий и текущий бюджет на облако. За 48 часов мы подготовим одностраничный прогноз по реализации edge AI — бесплатно.
Юнит-экономика, которая меняет расчёты
Облачные сервисы видеоаналитики (AWS Rekognition, GCP Vision, Azure Computer Vision) берут плату за каждый инференс. Цены отличаются, но реалистичный диапазон 2026 года для детекции объектов — 0,07–0,37 ₽ за вызов. На уровне парка устройство арифметика рассыпается:
Флот из 10 000 камер по 30 инференсов в секунду. 10 000 × 30 = 300 000 вызовов в секунду = 26 млрд вызовов в сутки. По 0,07 ₽ за вызов — 1,9 млрд ₽ в день. Даже по 0,007 ₽ за вызов (объёмный тариф) — 195 млн ₽ в день. На таком масштабе подход «облачный API» принципиально невозможен.
Сабсэмплинг помогает, но только до определённого предела. Большинство продакшен-деплоев не запускают инференс на каждом кадре. Они снижают частоту до 1–5 fps при движении и до 0,1 fps в простое. Даже на 1 fps в активном режиме флот из 10 000 камер выдаёт 10 000 инференсов в секунду — 864 млн в сутки. Это обходится в 6,4 млн ₽ в день при цене 0,007 ₽ за вызов. Всё равно слишком дорого.
На edge арифметика другая. Железо NPU стоит 3 750–22 500 ₽ на камеру (разово). Электричество для инференса — около 5–15 Вт на камеру, 375–1 125 ₽ в год. Маржинальная стоимость дополнительного инференса — ноль.
Трафик — вторая статья экономии. Камера 1080p H.264, работающая 24/7 на 4 Мбит/с, выгружает около 43 ТБ в год. С edge AI, который передаёт только события: около 360 ГБ в год. В 120 раз меньше. Для сотовых флотов (750–2250 ₽ за ГБ) именно эта экономия становится ключевой.
Тиры железа — NPU, мобильные чипы, CPU
| Тир | Чипы | Стоимость на камеру | Возможности |
|---|---|---|---|
| Тир 1: NPU | Hailo-8, Google Coral, Jetson Orin Nano | 6 000–22 500 ₽ | YOLO26 на 30 fps в 1080p, несколько моделей |
| Тир 2: мобильные чипы | Snapdragon 8 Gen 1+, Apple ANE | 15 000–60 000 ₽ | Детекция и трекинг на уровне смартфона |
| Тир 3: средний SoC | Rockchip RK3588, Ambarella CV5 | 3 750–9 000 ₽ | Только лёгкая детекция |
| Тир 4: только CPU | Универсальный ARM Cortex-А | 750–3 000 ₽ | Детекция движения, базовая классификация |
Берите Тир 1 (NPU), когда: нужна детекция в реальном времени на 4K-потоках, несколько модельных голов (человек, транспорт, аномалии, лица) или высока цена ошибки — например, при охране периметра или борьбе с потерями в ритейле.
Берите Тир 2 (мобильные чипы), когда: «камера» — на самом деле смартфон или планшет (например, для охраны, носимых устройств или мобильной инспекции). Apple ANE особенно хорошо справляется с распознаванием объектов на видео в разрешении 1080p.
Берите Тир 3 (средний SoC), когда: вы создаёте камеру для массового рынка по потребительским ценам (вроде Wyze или Reolink). RK3588 — фактически стандарт для самодельных решений и недорогого производства.
Берите Тир 4 (только CPU), когда: сценарий — бинарная детекция движения, а флот большой и чувствителен к цене. Это простое решение, которое достаточно для ответа на вопрос: «Что-то происходит?»
Выбор модели в 2026 году — YOLO26 и не только
YOLO26 (Ultralytics). Новая модель из семейства YOLO, оптимизированная для мобильных NPU. Поддерживает нативный экспорт в CoreML, TFLite и ONNX. Обнаруживает объекты со скоростью 30+ fps на NPU Тира 1. Стандартный выбор 2026 года для универсального видеонаблюдения.
Квантизованная YOLOv8/в9. Готовое решение с поддержкой большого числа устройств. Точность ниже, чем у YOLO26, но примеров развертывания больше. Используйте, когда нужно быстро запустить модель, а инструментарий YOLO26 на вашем оборудовании ещё не отработан.
Детекция аномалий. Связка ResNet50 и автоэнкодера. Обучаем на «нормальной» съёмке, помечаем любое отклонение. Работает с нетипичными паттернами движения, оставленными предметами, попытками проникновения через периметр. Контролирует ложные срабатывания лучше, чем правила-«будильники».
Классификаторы людей и транспорта. Самая распространённая задача в видеонаблюдении. Нужно отделить людей от животных (чтобы снизить количество ложных срабатываний) и определить тип транспорта — например, грузовик или легковой автомобиль на стройплощадке. Модели MobileNetV3 или EfficientNet в INT8-квантизации отлично справляются с этим на оборудовании уровня Тира 2–3.
Распознавание лиц. ArcFace или FaceNet в INT8. Здесь возникают вопросы приватности и соблюдения норм — статья 9 GDPR относит биометрию к специальной категории данных. Обычно такую систему применяют только для проверки по белому списку (например, сопоставление с пропуском сотрудника) и запускают на NPU уровня 1.
Пайплайн деплоя — обучение, квантизация, OTA
1. Обучение в облаке. Обучайте модели на размеченных данных с помощью PyTorch или TensorFlow. Активно используйте аугментации — изменение освещения, погоды и ракурсов, чтобы обучающая выборка лучше соответствовала реальным условиям эксплуатации.
2. INT8-квантизация. Большинство NPU работают с точностью INT8, а не FP32. Квантизация после обучения (PTQ) выполняется быстрее, а квантизация с учётом обучения (QAT) обеспечивает более высокую точность. Цель — сохранить точность не хуже, чем на 2 % ниже, чем у модели в FP32.
3. Экспорт. CoreML — для iOS и устройств на Apple Silicon. TFLite — для Android и встраиваемых систем на базе Linux. ONNX — для работы на разных платформах (у Hailo, Coral и Jetson есть свои ONNX-рантаймы). TensorRT — для максимальной производительности на NVIDIA Jetson.
4. OTA-доставка. Подпишите артефакт модели приватным ключом, загрузите в реестр моделей и разверните на устройствах через OTA-агента (Mender, Balena или собственный MQTT). Выполняйте поэтапное обновление (canary → 10 % → 50 % → 100 %) с возможностью отката.
5. A/Б-тесты в продакшене. Запустите новую модель на 5 % трафика, логируйте её решения и сравнивайте с контрольными данными (ручная проверка или теневой запуск проверенной модели). Переводите на 100 % после 7–14 дней без ошибок.
6. Детекция дрейфа. Отслеживайте распределение уверенности модели по каждой камере во времени. Резкое падение средней уверенности говорит о дрейфе данных — модель столкнулась с новыми условиями, которых раньше не встречала. Это сигнал к дообучению.
Архитектура: edge ↔ VMS ↔ оповещения
Рисунок 1. Архитектура AI-видеонаблюдения на edge — камера, брокер, VMS, рассылка оповещений, уровни хранения.
Приватность и соответствие требованиям — минимизация данных
1. Минимизация данных по GDPR — по умолчанию. Edge AI передаёт только метаданные событий, а не исходные видео. Полные видеозаписи отправляются в центр только по запросу, а действия оператора фиксируются в логах. С такой архитектурой проще соблюдать статью 5 GDPR — минимизацию данных и ограничение целей обработки, чем при хранении всего в облаке.
2. Маскирование PII прямо на устройстве. Лица и автомобильные номера можно размывать на камере до отправки кадра куда-либо. Открытые модели (mask-rcnn, дообученные под лица) и эффекты на встроенном GPU позволяют делать это в реальном времени. Это обязательно для ритейла, транспортных хабов и школ.
3. Аудит решений модели. Каждое оповещение должно фиксировать: какая модель, с какой степенью уверенности, по какому хешу входного кадра. Это нужно и для анализа инцидентов, и часто — для юридической цепочки доказательств.
4. Осторожно с биометрией. Распознавание лиц относится к специальной категории данных по статье 9 GDPR. Во многих юрисдикциях ЕС для таких систем требуется отдельный DPIA, публичное уведомление и чёткие сроки хранения данных. Подумайте, действительно ли вам нужно именно сравнение лиц — часто достаточно просто обнаружения человека.
5. Политики хранения, которые соблюдает само устройство. Кольцевые буферы на SSD камер автоматически перезаписывают старые записи. Тиринг облачного хранилища перемещает видео в холодное хранилище через N дней и удаляет его по истечении срока юридического хранения. Документируйте и подтверждайте, что хранение ограничивается автоматически, а не вручную.
Мини-кейс: как EyeBuild запускает ИИ на солнечных 4G-камерах
EyeBuild охраняет сотни строительных объектов с активами на миллиарды долларов. Камеры работают от солнечных батарей, автономны до 14 дней плюс 3 дня резерва, снимают в разрешении 4K UHD, подключаются через 4G/5G без проводного интернета, поворачиваются на 360 градусов и оснащены двумя режимами ночного видения — инфракрасным и цветным. Архитектура edge здесь не обсуждается: передать 4K@60fps по LTE невозможно, а ждать 200 мс ответа от облака, пока нарушители уже лезут через забор, — нереально.
Ключевые элементы архитектуры. Кастомное железо камеры с NPU Hailo-8, на котором работает квантизованная YOLOv8, дообученная на снимках со стройплощадок (тяжёлая техника, каски, люди вне рабочего времени). Инференс — 4 мс на кадр в разрешении 1080p. Локальный SSD-буфер хранит 14 дней нарезанных событий. В облако через 4G/5G передаются только снимки с движением и 30-секундные видео. Дашборд оператора работает в браузере; полное разрешение по запросу загружается отдельно.
Результат. Установка в день обращения. 18 600 ₽ в месяц за камеру «под ключ». Ежемесячные контракты без долгих обязательств. Включено 30 дней облачного хранения. Трафик на камеру — около 2 ГБ в месяц против примерно 600 ГБ в месяц для необработанного 4K-стриминга. Флот обслуживает элитную жилую недвижимость, промышленные объекты, инфраструктуру и модульное строительство.
Что мы выпустили. Кастомную прошивку для камер, пайплайн инференса на Hailo-8, инфраструктуру обучения моделей для постоянного улучшения флота, OTA-агента, облачную VMS, дашборд оператора и мобильное приложение. Свяжитесь с нами, если хотите аналогичный продукт для своего видеонаблюдения.
Делаете кастомную AI-камеру или VMS?
Мы выпустили EyeBuild, VALT и ещё четыре системы AI-видеонаблюдения для продакшена. Присылайте ТЗ — за 48 часов подготовим одностраничную архитектуру и план на 16 недель.
Build vs buy — Axis, Hikvision, кастомный white-лейбл
Готовые AI-камеры (Axis, Hikvision, Bosch, Hanwha). 30 000–150 000 ₽ за камеру. На устройстве уже установлены предобученные модели и используется VMS от производителя. Такой вариант подойдёт, если вы используете камеры как клиент сервиса — например, охранная компания или ритейлер — и вам не нужны собственные модели или оборудование под бренд. Обратите внимание: Hikvision и Dahua не продаются на федеральных рынках США.
White-label камеры с кастомной прошивкой. Заказываете оборудование у ODM (TVT, OEM Hikvision, универсальные ODM в Шэньчжэне) по цене 6 000–22 500 ₽ за камеру и устанавливаете свою прошивку и ИИ-стек. Такой подход подходит, если ключевые преимущества — ваши AI-функции, а сами камеры вы продаёте клиентам (паттерн EyeBuild). Требуются большие инвестиции в разработку, но вы получаете полный контроль над интеллектуальной собственностью.
Платформа BYOC (bring-your-own-camera). Камеры остаются у клиента — он передаёт RTSP-потоки, а ИИ работает на нашей платформе. Такой подход подходит, если вы продаёте только программное обеспечение, а у клиента уже есть камеры. Edge-обработка здесь сложнее: обычно инференс запускается в облаке или на локальных GPU.
Модель затрат — облако против edge
| Размер флота | Облако: годовая стоимость | Edge AI: годовая стоимость | Экономия |
|---|---|---|---|
| 100 камер | ~4,5 млн ₽ | ~1,8 млн ₽ (с учётом износа оборудования) | ~58 % |
| 1 000 камер | ~43 млн ₽ | ~13 млн ₽ | ~69 % |
| 10 000 камер | ~412 млн ₽ | ~105 млн ₽ | ~75 % |
| 100 000 камер | Структурно нежизнеспособно | ~825 млн ₽ | N/A |
Расчёт ведётся исходя из обработки видео в 30 кадров в секунду, стоимости NPU — от 3 750 до 9 000 рублей за камеру с амортизацией на 5 лет, расхода электроэнергии — 375 рублей в год, облачной системы видеонаблюдения и оповещений — 375 рублей в месяц за камеру, сотового трафика — 150 рублей за гигабайт (при наличии). Для облачного варианта учтена стоимость инференса — 0,03 рубля за операцию (по объёмному тарифу), работа 24/7 с понижением частоты кадров до 5 в секунду в активном режиме.
Фреймворк решения — выберите edge за пять вопросов
В1. Размер флота? Если камер больше 50 — edge-решение выгоднее. Меньше 50 — проще использовать облако.
В2. Связь? Сотовая связь или нестабильный Wi-Fi → edge обязателен (трафик и надёжность). Гигабитный Ethernet по кабелю → облако или гибрид допустимы.
В3. Чувствительный к задержке сценарий? Охрана периметра, детекция падения, обнаружение огня и дыма → нужен edge для отклика менее 100 мс. Общий мониторинг с оператором в цикле → облако подойдёт.
В4. Регулирование приватности? GDPR с жёсткими требованиями к локализации данных или чувствительный контент (школы, здравоохранение) → edge заметно проще.
В5. Кастомный или коммодити-ИИ? Вертикальные задачи (например, контроль потока в ритейле, медицина) — лучше использовать кастомные решения. Общие задачи, например распознавание людей и транспорта — обычно хватает готовых камер.
Подводные камни, которых стоит избегать
1. Игнорировать OTA. Без надёжного OTA-канала вы не сможете исправлять ошибки моделей, выпускать обновления безопасности и развивать продукт. Создавайте OTA до масштабирования, а не после.
2. Закрывать глаза на дрейф моделей. Модель, обученная на летних снимках, теряет точность зимой. Новые ракурсы, освещение, этапы строительства — всё это постепенно снижает качество. Следите за распределением уверенности и переобучайте модель регулярно.
3. Недооценивать поток оповещений. 10 тысяч камер генерируют столько тревог, что операторская команда не справляется. На таком масштабе нужны правила приоритезации, удаление дубликатов оповещений и ранжирование с помощью машинного обучения.
4. Ложные срабатывания, из-за которых операторы перестают реагировать. Если 30 % тревог — ложные, операторы перестанут их проверять. В первые 90 дней настраивайте систему на точность, а не на полноту; чувствительность можно будет повысить позже, когда доверие к системе уже установится.
5. «Кирпичить» устройства неудачным OTA. Сбойное обновление прошивки на 10 тысячах устройств — катастрофа. Всегда запускайте canary-когорту, A/В-тестирование по диапазонам серийных номеров и проверяйте, что откат работает, ещё до раскатки на весь флот.
KPI для измерения
Качество. mAP при IoU 0,5 на эталонном датасете (целевой показатель: 0,85+). Доля ложных срабатываний на камеру в день (целевой показатель: менее 0,5). Задержка инференса p50 (целевой показатель: менее 10 мс на Тире 1, менее 50 мс на Тире 3). Стабильность средней уверенности во времени (тревога, если месячная средняя падает более чем на 5 %).
Бизнес. Время работы оператора с камерой в день (целевой показатель — менее 5 минут при флоте от 100 камер). Годовая стоимость на одну камеру. Отток клиентов (качественная детекция значительно снижает отток).
Надёжность. Доступность парка камер (целевой показатель: 99,5 %). Доля успешных обновлений по воздуху (OTA) (целевой показатель: 99,8 %). Трафик на одну камеру в месяц (тревога, если превышает базовый уровень более чем в 2 раза — это может означать, что в облако передаются не события, а полные видеопотоки). Распределение состояний питания (актуально для камер на солнечных батареях).
Когда edge AI разворачивать НЕ стоит
Маленький флот (меньше 30 камер). Стоимость облачного анализа невелика, инвестиции в edge-решения не окупятся. Используйте AWS Rekognition или аналоги.
Разовый ретроанализ архива. Обработать шесть месяцев записи в поисках одного события — облачный GPU-инференс легко масштабируется, а edge-решение — нет.
Модели, которые меняются еженедельно. Если вы всё ещё обновляете ИИ-модель, OTA-цикл будет вас тормозить. Пока модель не стабилизируется, держите инференс в централизованной точке, а потом уже переносите на edge.
Камеры, которыми вы не управляете. Если ваша платформа принимает RTSP-потоки от сторонних камер разного типа, установить свою прошивку не получится. Выполняйте инференс на региональном GPU-кластере.
FAQ
Hailo-8 vs Coral TPU vs Jetson?
У Hailo-8 лучшая производительность на ватт — идеально подходит для камер на солнечных батареях. Coral TPU дешевле и хорошо поддерживается экосистемой TensorFlow. Jetson Orin Nano — самый гибкий вариант (полный Linux, широкий выбор программного обеспечения), но потребляет больше энергии. В EyeBuild мы выбрали Hailo-8 из-за ограничений по питанию.
YOLO26 или модель, обученная под конкретную задачу?
Преднатренированный YOLO26 покрывает около 80 % типичных задач видеонаблюдения — людей, транспорт, базовые объекты. Для оставшихся 20 % — специфичных объектов на стройке, поведения в ритейле и других — дообучите YOLO26 на своих данных. Полностью обучать модель с нуля обычно не требуется.
Как соблюдать GDPR при детекции лиц?
Избегайте распознавания лиц без явной бизнес-необходимости: определение наличия лица (детекция) — более мягкая операция, чем идентификация (распознавание). Размывайте лица на устройстве в любом кадре, который вы передаёте. Обязательно информируйте пользователей. Подумайте, не хватит ли вам просто обнаружения человека.
А ночное видение и плохая погода?
Обучайте на аугментированных данных: слабое освещение, дождь, туман. У части камер есть IR-фильтр, и ночью они переключаются в ИК-режим. Модели нужно обучать и на видимых, и на ИК-кадрах — воспринимайте их как разные распределения входных данных.
Как выкатывать модели по OTA?
Подпишите артефакт модели, раздайте через OTA-агента (Mender, Balena или собственный MQTT), проводите поэтапный релиз (canary → 10 % → 100 %) с проверкой работоспособности на каждом этапе. Всегда предусматривайте возможность отката к последней стабильной версии. На устройстве зарезервируйте достаточно флеш-памяти под две версии модели.
Можно ли использовать несколько моделей на одной камере?
Да, на NPU Тира 1. Типичный сценарий: лёгкий детектор движения работает постоянно, более тяжёлый YOLO26 запускается при обнаружении движения, а опциональный детектор аномалий — периодически. Оркестрация нескольких моделей — стандартная практика для Hailo-8 и Jetson Orin Nano.
А что насчёт гибрида edge и облака?
Гибридный паттерн: edge быстро обнаруживает события, а облако получает метаданные и ключевые кадры. По подозрительным событиям запускается более тяжёлая модель на трансформерах — она дополнительно фильтрует ложные срабатывания. Получаем лучшее из двух миров, а трафик при этом в 50 раз меньше, чем при передаче всего видео подряд.
Сколько занимает разработка кастомной AI-камеры?
Прошивка, ИИ-пайплайн и облачная VMS для запуска решения класса EyeBuild: 16–24 недели на первую версию силами 2–4 сеньоров. Параллельный подбор оборудования добавит 8–12 недель, если вы работаете через ODM. Мы обычно укладываемся ближе к нижней границе диапазона за счёт использования наработок Agent Engineering.
Что почитать дальше
ИИ
AI-детекция аномалий в видеонаблюдении
Сопутствующий материал по дизайну модели аномалий на автоэнкодере и ResNet.
VMS
Видеоаналитика и видеонаблюдение
Паттерны интеграции аналитических событий со стороны VMS.
Архитектура
Масштабируемая архитектура VMS
Облачная и on-prem архитектура VMS для больших флотов.
Сравнение
Edge AI и cloud AI — сравнение
Соседняя статья о бинарном выборе.
AI-инфра
MCP для видео и приложений в реальном времени
Как добавить слой LLM-агента поверх вашей VMS.
Готовы запустить флот, который масштабируется?
Свыше 50 камер edge AI остаётся единственным экономически оправданным решением. Аппаратная часть — Hailo-8, Coral и Jetson — к 2026 году будет полностью зрелой; YOLO26 в INT8-квантизации покрывает большинство задач. Инструменты OTA (Mender, Balena, собственные разработки) позволяют эффективно поддерживать обновление парка устройств. Сам подход хорошо отработан: основные инженерные риски связаны не с моделью, а с операционной стороной — уведомлениями, дрейфом данных, сроками хранения и надёжностью обновлений.
Для сотовых флотов edge выигрывает уже за счёт экономии трафика — в 50 раз меньше. В сценариях, где ошибка стоит дорого, edge выигрывает по задержке. В задачах, где важна приватность, edge выигрывает благодаря минимизации передаваемых данных. На стороне «только облака» остаются небольшие флоты и быстрое обновление моделей.
Хотите план запуска edge AI на 16 недель для вашего парка камер?
Пришлите целевой размер флота, условия эксплуатации и сценарии обнаружения. За 48 часов мы подготовим одностраничную архитектуру, шортлист оборудования и план на 16 недель.
