Обнаружение аномалий в видео – инженерный плейбук 2026 года

Автор: Николай СапуновОбновлено: август 202644 мин чтения
Содержание статьи +

TL;DR

Обнаружение аномалий в видео в 2026 году – это уже не одна модель, выбирающая «странные» кадры в потоке, а многоуровневый пайплайн, объединяющий быстрый edge-детектор, слабо контролируемый классификатор и VLM-рескорер, объясняющий каждое срабатывание понятным языком. Ландшафт моделей разделился на четыре production-уровня семейства: 3D-Convolutional Neural Networks на базе I3D и SlowFast с головами multiple-instance learning по-прежнему лидируют в бенчмарке UCF-Crime, демонстрируя AUC около 97%, методы на основе CLIP (VadCLIP, TPWNG) позволяют начинать работу с двух-трёх примеров на класс аномалии, frontier-VLM (Gemini 2.5, GPT-5, Claude Opus 4.7) превращают каждое срабатывание в проверяемый текст, а edge-NPU (Jetson Orin, Hailo-8) запускают всю систему прямо на камере с задержкой менее 200 мс. Рынок вырос соответственно: глобальный рынок video analytics прогнозируется в размере $14,65 млрд в 2026 году с ростом до $41,39 млрд к 2031 году, а рынок обнаружения аномалий в данных растёт со скоростью 19,5% в год. Правильная архитектура для вашего продукта зависит от четырёх ключевых параметров – допустимой задержки, количества камер, числа размеченных примеров и регуляторных требований – и эта статья подробно рассматривает каждый из них, пока вы не сможете уверенно оперировать данными из таблицы.

Зачем это нужно

Если вы выпускаете видеопродукт в 2026 году – surveillance, OTT, телемедицину, e-learning, conferencing – и не обнаруживаете аномалии, конкуренты уже это делают. Обнаружение аномалий за 2023–2025 годы перешло из исследовательского курьёза в строчку RFP, а в 2026-м это уже вопрос: выиграете ли вы корпоративную сделку по видеонаблюдению или проиграете. Хорошая новость – базовая технология наконец готова к продукту: академические бенчмарки стабилизировались, API вендоров стали зрелыми, edge-решения подешевели, а регуляторная рамка хотя и не стабильна, но уже видна. Плохая новость – поле стало настолько насыщенным, что продакт-менеджер, ориентирующийся только на маркетинговые тексты, выберет неправильную архитектуру и будет платить за это три года. Эта статья для продакт-менеджера, которому нужно обосновать архитектурный выбор перед советом директоров, для основателя, выбирающего между SaaS-решением по $50 за камеру в месяц и кастомной разработкой, и для инженера, объясняющего основателю, почему «просто возьмём VLM» иногда работает, а иногда сжигает runway. Предполагается, что вы уже читали урок 1.2 о латентности и топологии деплоя и урок 1.4 о стоимости ИИ в видеопродуктах, потому что любое решение в этой статье сводится либо к цифре задержки, либо к цифре в долларах.

Что на самом деле означает «аномалия» в видеопродукте

Слово «аномалия» в большинстве продуктовых спецификаций делает слишком много работы, а выбор модели целиком зависит от того, какую именно аномалию вы имеете в виду. Приведённая ниже таксономия – та, которой мы пользуемся в Фора Софт, когда начинаем работать с новым клиентом и просим его указать на проблему, которую он хочет решить. Пока эта таксономия не ясна, никакой разговор о выборе модели не имеет смысла.

Поведенческая аномалия – это ситуация, когда человек или объект совершает действия, запрещённые политикой пространства: покупатель бежит в зоне «no running» на складе, кто-то перелезает через забор, бродит по закрытому коридору или падает на платформе метро. Это ключевая категория как в академической среде, так и в разработке продуктов для видеонаблюдения. Такие события носят временной характер – для их распознавания требуется несколько секунд контекста – и поэтому идеально подходят для анализа с помощью 3D-свёрточных нейронных сетей (I3D, SlowFast) и видео-трансформеров (TimeSformer, VideoSwin, VideoMAE).

Физическая аномалия – это объект, который не должен существовать, или который должен быть, но отсутствует: оставленная сумка на станции, лужа в цеху, пропавший огнетушитель в коридоре больницы, упавший дорожный знак. Это проблема, связанная с временным слоем устойчивости (persistence); правильная архитектура включает детектор объектов (например, YOLO, RT-DETR), подающий данные в слой отслеживания состояния, который срабатывает, когда объект присутствует дольше заданного порога.

Аномалия плотности или толпы – количество людей или объектов в заданном регионе превышает установленный порог: переполненная очередь, формирующаяся давка, чрезмерно загруженная платформа, опустевшая холодильная секция. Это задачи регрессии тепловых карт плюс пороговое значение по регионам; современные модели подсчёта толп из семейства MMDetection CrowdNet справляются с обработкой на скорости 30 кадров в секунду даже на скромной GPU.

Расписание / темпоральная аномалия – движение, присутствие или отсутствие, нарушающие нормы времени суток или дня недели: активность в здании в 03:00, автомобиль на пожарном проезде более пяти минут, пропускная дверь, оставленная открытой в рабочее время. В основном такие ситуации регулируются правилами и дополнительным обучением систем распознаванию типичных паттернов; ценность ИИ здесь – в подавлении ложных срабатываний за счёт обучения, например, «движение на loading-dock в 06:00 по вторникам – норма», а не в самой детекции событий.

Статистическая / сигнальная аномалия – отклонение на уровне потока данных: внезапное падение качества, замёрзший видеопоток, зависший энкодер, резкий всплеск джиттера в сети, метрика внутри пайплайна, пересекающая установленный порог. Это уже не вопрос «что происходит в кадре», а задача анализа временных рядов, для которой применяются методы вроде Isolation Forest, ошибки реконструкции автоэнкодера или LOF на инженерных признаках. Это важно, потому что один из типичных сценариев отказа любого vision-пайплайна – «камера тихо зависла, а система продолжает выдавать предсказания на основе последнего корректного кадра» – и только детекция на уровне сигнала способна это обнаружить.

Самый большой выигрыш в RFP по детекции аномалий – сразу указать класс аномалии. «Нам нужно real-time anomaly detection» – это не спецификация; «нам нужно обнаруживать человека, бегущего в зоне, где бег запрещён, за 250 миллисекунд на Jetson Orin Nano при 30 кадрах в секунду» – вот это уже спецификация.

Рисунок 1. Пять классов аномалий в видеопродукте и лучшие семейства моделей для каждого.

Бюджет латентности 2026 – первое число, которое вы согласуете

«Real-time» означает «достаточно быстро, чтобы успеть среагировать до завершения события» – и это напрямую определяет конкретные временные ограничения, которые должна соблюдать вся архитектура. Пропустите эту цифру – и каждая последующая ошибка будет только нарастать; попадёте точно – и выбор модели, аппаратной платформы и топологии становится очевидным.

Падение на платформе метро, которое должно вызвать закрытие гейта или удержание состава, должно обрабатываться за 150 миллисекунд end-to-end – от момента события до команды актуатору. В этот временной бюджет укладываются примерно 33 мс на захват и кодирование, 50 мс на инференс, 30 мс на шину тревог и 30 мс запаса. На сетевой round-trip времени не остаётся; инференс должен выполняться на устройстве рядом с камерой.

Прорыв периметра или лазание через забор, которое должно вызвать срабатывание сирены и вызов охраны, происходит в пределах 200–300 мс. В этот временной бюджет укладывается тонкий edge-to-edge переход или жёстко настроенный LAN-обратный путь к on-site NVR с GPU.

Воровство в ритейле, которое должно быть обнаружено вовремя, чтобы персонал успел выйти на торговый зал и перехватить нарушителя, – в диапазоне 300–500 мс. Это оптимальная зона для гибридной архитектуры: быстрый детектор на edge с высоким recall и cloud-рескорер, подтверждающий тревогу перед отправкой персонала.

Тревога плотности толпы или очереди, запускающая решения о персонале или маршрутизации, – в диапазоне 500–1000 мс. Обработка в облаке здесь допустима; время прохождения сигнала по WAN и небольшая очередь на GPU всё ещё укладываются в секунду.

Forensic-переанализ не требует обработки в реальном времени – минуты или часы вполне допустимы, – и архитектура оптимизируется под стоимость и точность, а не под задержку. Здесь frontier-VLM оправдывают свои токены.

Следствие острее, чем кажется. Если ваше целевое событие – «человек может предотвратить ситуацию, если получит оповещение за 10 секунд», вам нужен edge inference. Если же речь идёт о расследовании постфактум – облачная обработка подойдёт, она дешевле и проще в обновлении. Архитектуры для этих двух сценариев не имеют общих компонентов, кроме камеры; не позволяйте поставщику продать вам одну систему вместо другой.

Камера 1080p с частотой 30 кадров в секунду выдаёт кадр каждые 33 мс. Jetson Orin Nano Super с квантованной моделью SlowFast выполняет инференс примерно за 25–35 мс на клип. Публикация события ONVIF в локальный брокер занимает около 5 мс. Реле-актуатор рядом с камерой реагирует примерно за 10 мс. Общая задержка end-to-end: 33 + 30 + 5 + 10 = 78 мс. Тот же пайплайн, проложенный через облачный регион с задержкой WAN в 50 мс туда и обратно, даёт 33 + 50 + 30 + 50 + 10 = 173 мс – и 150-миллисекундный бюджет на удержание состава оказывается превышен. Аппаратное обеспечение не изменилось – изменилась топология.

Рисунок 2. Полосы бюджета латентности и единственная топология развёртывания, которая соответствует каждой из них.

Семейства моделей, важные в 2026 году, – это слоистый стек, а не конкурс красоты

Ландшафт моделей дважды изменился с 2023 по 2026 год. В 2023 году на переднем плане были 3D-нейросети и первые видео-трансформеры; в 2024-м на лидерборды вышли методы на основе CLIP; в 2025-м мультимодальные LLM (Holmes-VAD, AnomalyRuler, VadCLIP++) начали генерировать объяснения, полезные для реальных пользователей; к 2026 году консенсусной архитектурой для продакшена стал многоуровневый стек, а не единая модель. Разберём каждый из его слоёв.

Первый слой – быстрый и дешёвый покадровый детектор, работающий на каждом кадре на edge-устройствах. Его задача – выделять кандидатские клипы – временные окна, статистически настолько необычные, что заслуживают более пристального анализа. Используются два подхода: квантованный 3D-нейросетевой классификатор (I3D или SlowFast в INT8) на Jetson Orin Nano Super или Hailo-8, и автоэнкодер (ST-AE, MemAE), помечающий кадры, у которых ошибка реконструкции превышает заданный порог. Подход на основе 3D-нейросети работает быстрее и точнее при наличии разметки; автоэнкодер – единственный вариант, когда разметки нет вообще. Оба решения обрабатывают видео со скоростью 30 кадров в секунду на устройстве стоимостью $250.

Второй слой – слабо контролируемый классификатор, перепроверяющий кандидатские клипы и присваивающий им классы аномалий. Именно на этом уровне реализуется современный академический уровень (state of the art). Методы множественного обучения (Multiple Instance Learning, MIL) – такие как RTFM, MGFN, Unbiased MIL и более свежий подход Multi-Timescale Feature Learning (MTFL, 2024) – позволяют обучать классификатор на уровне отдельных кадров, используя метки на уровне видео. Именно это и определяет успех проекта: либо он «плавает», либо тонет из-за высокой стоимости разметки. На датасете UCF-Crime текущий SOTA составляет около 88–90% AUC для новых вариантов MIL на сырых признаках и более 95% AUC при добавлении трансформера сверху. На XD-Violence аналогичная метрика – 85–86% AP.

Третий слой – CLIP- или VLM-основанный рескорер, выполняющий две задачи, недоступные для MIL-слоя: детекция с открытым словарём (обнаружение аномалий, на которых модель не обучалась, по их текстовому описанию) и адаптация к новым площадкам в режиме few-shot. VadCLIP – первый слабообучаемый метод VAD на основе CLIP – объединяет текстовые и визуальные промпты и превосходит более старый SOTA на основе только MIL на датасете UCF-Crime. TPWNG (Text Prompt with Normality Guidance, CVPR 2024) объединяет визуальные признаки с текстовыми эмбеддингами CLIP, чтобы генерировать псевдо-метки для обучения. VadCLIP++ и TrCLIP-VAD (2025–2026) идут дальше – используют динамические vision-language модели и улучшенную дообучку CLIP с помощью переформулировки текста. Практическая выгода – две вещи: вы описываете новый класс аномалии одним предложением и получаете разумную детекцию без переобучения, а также сокращаете затраты на разметку примерно на 80% в «длинном хвосте».

Четвёртый слой – frontier-VLM, обрабатывающий самые сложные запросы и выдающий объяснение. Holmes-VAD построил первый крупномасштабный мультимодальный бенчмарк для instruction-обучения VAD (VAD-Instruct50k) и показал, что дообученная мультимодальная языковая модель способна не только точно локализовать аномалию во времени, но и сгенерировать связный рассказ о произошедшем. AnomalyRuler использует few-shot prompting с нормальными reference-сэмплами, чтобы сформировать правила, которые LLM затем применяет к новой видеозаписи. Статья Cerberus 2025 года продемонстрировала, что каскадная архитектура VLM может достигать точности 97,2% на датасете UCF-Crime, при этом работая со скоростью 57,68 кадров в секунду на NVIDIA L40S – что соответствует real-time производительности для моделей класса VLM. В реальных условиях сегодня применяется следующий паттерн: небольшая VLM (Llama 3.2 Vision, Qwen-VL, LLaVA) работает на устройстве для объяснения, а frontier-VLM (Gemini 2.5 Pro, Claude Opus 4.7) – в облаке, обрабатывая пограничные случаи, когда маленькая модель не уверена в результате.

Пятый слой, который часто упускают, – детектор сигнальных аномалий, наблюдающий за самим пайплайном. Isolation Forest или LSTM-автоэнкодер на инженерных признаках (длительность зависшего кадра, дисперсия битрейта энкодера, доля потерянных пакетов, гистограмма confidence модели) выявляют сбои, которые визуальные слои не замечают: заклинивший энкодер, камера, медленно теряющая фокус, модель, которая начинает предсказывать один и тот же класс на каждом кадре из-за тихого дрейфа данных. Мы видели production-системы, которые неделями работали с зелёными индикаторами всех визуальных слоёв, пока камера в цикле подавала в пайплайн статичную картинку парковки на закате. Сигнальный слой – не опция.

СлойЗадачаТиповая модельГде работаетЗачем нужен
1 – Candidate filterПоднимать необычные окнаI3D / SlowFast INT8, MemAEEdge NPU30 fps на железе за $250
2 – Class classifierПрисвоить класс аномалииMIL (RTFM, MGFN, MTFL)Edge или cloud GPU90% AUC на UCF-Crime
3 – VLM rescorerOpen-vocabulary + few-shotVadCLIP, TPWNG, VadCLIP++Cloud GPUДлинный хвост, мало меток
4 – ОбъяснениеЧеловеческий нарративHolmes-VAD, Gemini 2.5, ClaudeCloudAudit trail, ревью регулятора
5 – Signal anomalyНаблюдать pipelineIsolation Forest, LSTM-AEEdge / cloud sidecarЛовить тихие отказы

Рисунок 3. Пятислойный стек, который будет внедрён в production-пайплайн обнаружения аномалий в 2026 году. Большинство провальных кейсов связаны с отсутствием одного из слоёв или с неудачной передачей данных между ними.

Форма этого стека – это форма диалога с вендором. Если вендор предлагает одну модель – «наш трансформер детектит аномалии» – он фактически продаёт только второй слой и делает вид, что всё остальное уже решено. Если же вендор предлагает готовый пайплайн по единой цене – уточните, какие из пяти слоёв он предоставляет, а какие предполагает, что вы реализуете самостоятельно. Как правило, он контролирует слои 1 и 2, а остальное становится вашей интеграционной задачей.

Датасеты и бенчмарки, которые стоит знать – и те, что вам соврут

Бенчмарки задают тон обсуждению моделей, хотя поведение в продакшене они не предсказывают. Референсные цифры 2026 года ниже – те, что должен знать инженер, чтобы читать статью или оценивать вендора, и те же цифры, которые невнимательный читатель использует неправильно.

UCF-Crime – доминирующий бенчмарк с weakly supervised обучением: 1 900 видео с наблюдениями, 13 классов аномалий, включая abuse, arrest, arson, assault, burglary, fighting, road accidents, robbery, shooting, shoplifting, stealing и vandalism. За последние два года SOTA показал диапазон 84–90% AUC для методов только на основе MIL на сырых признаках, тогда как лучшие CLIP- и transformer-усиленные подходы достигают примерно 95–97% AUC. Когда вендор приводит результат на UCF-Crime, обращайте внимание на два момента: тестировался ли он на стандартном тестовом разделении или на отобранном подмножестве, и отчитывается ли он по AUC на уровне видео или на уровне кадров – разница может достигать 8 пунктов.

ShanghaiTech Campus – датасет из 437 видео с повседневной жизнью кампуса, преимущественно с пешеходными сценами. На стандартном сплите SOTA достигает 95–96% AUC с использованием VideoSwin и VideoMAE. Обратите внимание: версия датасета включает оригинальный вариант (одноклассовое обучение, без аномалий в обучающей выборке) и слабо контролируемую реорганизацию (Zhong et al.), которые различаются по сложности.

Avenue – 47-видеосет с необычным пешеходным поведением. Достаточно мал, чтобы всё в нём переобучилось; SOTA – выше 98% AUC. Относитесь к отчётам с AUC выше 98% на Avenue как к «модель прошла датасет», а не «модель работает».

XD-Violence – набор данных из 4 754 видео с аудио, 6 классов, многометочный. Наилучшие результаты (SOTA) составляют около 85–86% AP для современных подходов на основе CLIP и MIL.

Street Scene – кросс-доменный бенчмарк, который большинство отчётов игнорируют. Та же модель, что показывает 97% AUC на UCF-Crime, обычно теряет 10–15 пунктов на Street Scene. Этот разрыв – тот самый, который вы можете ожидать между производительностью на бенчмарке и результатами в первый месяц работы у клиента.

Честная оценка бенчмарков выглядит так: модель с 97% на UCF-Crime потребует до 2–6 недель fine-tuning на ваших реальных кадрах, прежде чем достичь customer-grade производительности на ваших камерах. Заложите сбор данных и переразметку в бюджет заранее – и вы не будете удивлены. Любой вендор, который не спрашивает про ваши site-данные, – это вендор, который никогда не отгружал в прод.

Как CLIP и VLM изменили поле – и когда за ними тянуться

Самый значительный инженерный сдвиг в области обнаружения аномалий в видео между 2024 и 2026 годами – появление методов на основе CLIP и VLM. Они настолько отличаются от традиционного стека на основе MIL, что для их понимания требуется отдельная ментальная модель.

CLIP – это контрастивная модель визуального и языкового анализа, обученная на парах «изображение–текст» из открытого интернета. Она преобразует картинки и короткие текстовые описания в единое пространство эмбеддингов, где семантически близкие объекты группируются вместе. Применение для обнаружения аномалий очевидно: вы описываете тип аномалии текстом («человек лезет через забор», «человек дерётся», «человек падает»), получаете эмбеддинги и для текста, и для видеоклипа, а затем сравниваете их по косинусной близости с заданным порогом. Даже без единого примера целевого класса вы получаете надёжный детектор – не такой точный, как полностью обученная модель, но достаточно хороший, чтобы запустить процесс разметки или запустить v1 за неделю.

VadCLIP (AAAI 2024) – первый метод слабого обучения на основе CLIP для обнаружения аномалий в видео, попавший в топ-лидербордов. Он интегрирует текстовые априорные знания через текстовые и визуальные промпты и превосходит предыдущий SOTA на основе MIL на несколько пунктов на датасете UCF-Crime. TPWNG (Text Prompt with Normality Guidance, CVPR 2024) объединяет визуальные признаки с текстовыми эмбеддингами CLIP для генерации псевдо-меток, что позволяет сократить разрыв с полностью контролируемыми методами на редких классах. VadCLIP++ (2025) вводит динамическую визуально-языковую модель, адаптирующую CLIP во время инференса. TrCLIP-VAD (2026) улучшает обучение CLIP с помощью переформулировки текста и сейчас демонстрирует результаты, близкие к SOTA, в задаче слабого обучения на UCF-Crime. WSVAD-CLIP (2025) добавляет обучение промптов с учётом временной динамики и фьюзию с учётом кадров. AVadCLIP (2025) расширяет подход на аудиовизуальное взаимодействие, что особенно эффективно для детекции насилия в стиле XD-Violence.

Приход мультимодальных LLM в качестве детекторов аномалий – второй сдвиг. Holmes-VAD (2024–2025) дообучает мультимодальный LLM на наборе данных VAD-Instruct50k и обеспечивает как точную временную локализацию, так и связный нарратив. AnomalyRuler (ECCV 2024) рассматривает задачу VAD как задачу few-shot-вывода: модель получает несколько примеров нормального поведения, затем выводит правила и применяет их к новой видеозаписи. Cerberus (2025) комбинирует малые и крупные VLM в каскадной архитектуре, балансируя точность и частоту кадров – 97,2% точности при 57,68 fps на GPU L40S.

Практический вопрос – когда обращаться к какому слою. В Фора Софт мы придерживаемся простого правила. Если у вас менее 100 размеченных примеров целевого класса аномалии – начинайте с zero-shot подхода на базе CLIP: используйте VadCLIP или TPWNG в зависимости от степени доверия к текстовым промптам. Если у вас от 100 до 1 000 примеров – обучайте слабо контролируемый MIL-слой поверх признаков CLIP. Если у вас более 10 000 примеров – обучайте полностью контролируемый классификатор и используйте CLIP лишь как страховку для редких случаев (long-tail safety net). Если ваш продукт должен объяснять, почему событие было помечено – например, для суда, регулятора или аналитиков безопасности, проверяющих события вручную – интегрируйте frontier-VLM в слой объяснения. Если продукт должен отвечать на произвольные запросы по архиву («оставлял ли кто-то сумку у южного входа в прошлый вторник?») – добавьте multimodal RAG поверх архива (см. урок про video RAG в Phase 4).

Подводный камень VLM-методов – стоимость. Frontier-VLM по $1,25 за миллион входных токенов, обрабатывающий 30-секундный клип в стандартном разрешении (около 9000 входных токенов), обходится примерно в $0,011 на клип – назовём это одним центом. Умножьте на тысячу событий в день – и получите $10 в день на одну камеру, или $300 в месяц только за слой интерпретации. Это больше, чем большинство SaaS-контрактов на видеонаблюдение. Решение – направлять на frontier-VLM только пограничные случаи (уровень уверенности от 0,4 до 0,7 из MIL-слоя), а для остальных объяснений использовать компактные локальные VLM (например, Qwen-VL 7B, Llama 3.2 Vision 11B, Moondream 2B). Полный расчёт стоимости см. в уроке 1.4.

Решение edge-vs cloud по топологии

Три топологии развёртывания охватывают практически любую систему обнаружения аномалий в продакшене в 2026 году. Выбор между ними зависит от бюджета на задержку, количества камер, степени связности на объекте и регуляторных требований. Положите эти четыре параметра перед собой – и выбор топологии становится очевидным.

Только edge. Jetson Orin Nano Super ($249), модуль Hailo-8 ($150–300) или Google Coral Dev Board ($150) – рядом с каждой камерой или по одному на группу из 4–16 камер. Orin Nano Super обеспечивает производительность около 67 TOPS под AI; Hailo-8 – 26 TOPS при энергопотреблении 2,5 Вт. Латентность инференса квантованных моделей SlowFast или I3D составляет 30–80 мс; end-to-end задержка до локальной шины тревог – уверенно ниже 200 мс. Стоимость оборудования – $200–600 на устройство плюс разовые затраты на интеграцию. Плюс жёсткий: кадры не покидают территорию (сильнейшая история приватности в регулируемых отраслях), отсутствует зависимость от WAN, след под EU AI Act значительно меньше. Минус операционный: каждое устройство – это отдельная сущность, которую нужно поддерживать, мониторить, обновлять и заменять.

Только cloud. Стриминг каждой камеры на NVIDIA L4 ($1–1,50/час аренды), L40S ($1,80–2,20/час) или A100 ($1,30–2,50/час) в managed-регионе. Одна L4 обрабатывает более 100 потоков 1080p при 30 кадрах в секунду для object detection; L40S справляется с примерно 60 потоками для более тяжёлых 3D-Convolutional Neural Networks. Затраты на вычисления на самой GPU составляют 20–50 мс; конечная задержка полностью зависит от WAN. Плюсы: единое место для развёртывания, переобучения и мониторинга, возможность горячей замены моделей, централизованное хранилище аудита. Минусы – задержка в сети (50 мс RTT + 30 мс на инференс + 30 мс на отправку оповещений – уже 110 мс, что не оставляет места для соблюдения SLA в 200 мс) и стоимость трафика. Камера 1080p H.264 с битрейтом 4 Мбит/с потребляет около 1,3 ТБ данных в месяц; умножьте это на 100 камер – и получите 130 ТБ в месяц, что становится доминирующим фактором в уравнении стоимости при тарифе egress $0,05/ГБ.

Гибрид – дефолт 2026. Edge-устройства обрабатывают слой 1 (candidate filter) и слой 2 (MIL-классификатор) с высокой точностью и умеренной полнотой. Пограничные события – обычно 5–20% кандидатов, в которых edge-модель не уверена, – направляются в облако, где слой 3 (CLIP rescore) и слой 4 (VLM-объяснение) уточняют вердикт и формируют audit trail. Команда Qdrant опубликовала прорабатываемый пример, где развертывание на 50 камер генерирует 432 000 клипов в день; паттерн edge-to-cloud эскалации снижает нагрузку на облако примерно в 6 раз, при этом выявляя 95% реальных аномалий. Такой сплит подходит практически для любой production-системы из более чем 20 камер: латентность остаётся в допустимых пределах на edge, а обновления моделей с длинным хвостом и слой объяснения – в облаке.

Наиболее распространённый анти-паттерн – отправка сырых 1080p-потоков в облако для сценариев, критичных к задержкам, ради использования уже имеющейся GPU в облаке. Вы платите за пропускную способность, теряете в латентности, рискуете регуляторными последствиями и, как правило, нарушаете SLA уже на первом стресс-тесте. Решение – не увеличивать пропускную способность, а перенести слой 1 на edge.

Рассматриваем пример развёртывания в рознице: 50 камер, бюджет задержки – 300 мс, режим соответствия EU AI Act. На edge – 50 модулей Hailo-8 по $200 = $10 000 капитальных затрат, выполняющих квантованный SlowFast для детекции краж на 30 fps с задержкой 70 мс на камеру. Локальная шина оповещений работает через MQTT. В облаке – эскалация пограничных событий на один GPU L40S с пересчётом через VadCLIP и вызовом Gemini 2.5 Pro для анализа топ-1% самых неоднозначных случаев. Полный цикл до оповещения персонала: медиана – 180 мс, p95 – 240 мс. Пропускная способность: фильтрация на edge снижает объём данных, передаваемых в облако, до ~5% от исходного – 1,5 ТБ в месяц на всю площадку вместо 65 ТБ. Ежемесячные расходы: ~$1100 на облако + ~$200 амортизации edge-оборудования = $1300 против $2500 при использовании SaaS-альтернативы по $50 на камеру в месяц. Кастомное решение выигрывает по стоимости, задержке и соответствию требованиям EU AI Act; SaaS остаётся выгодным только при масштабировании ниже 20 камер.

Рисунок 3. Гибридная edge+cloud топология, соответствующая стандарту 2026 года. На edge-уровне работают candidate filter и классификатор; на cloud-уровне – rescorer, система объяснений и audit trail.

Протоколы интеграции – как детектор подключается к остальному миру

Детекция без интеграции – это демонстрация. Детектор должен публиковать события в VMS, SIEM, мобильное приложение охраны, актуатор, систему уведомлений, тикетинг и аудит-лог – по разным протоколам, с различными требованиями к задержке и надёжности доставки. Четыре протокола покрывают production-стек 2026.

ONVIF Profile M – профиль метаданных и аналитики спецификации ONVIF, ратифицированный в 2022 году и широко принятый такими системами, как Milestone XProtect, Genetec Security Center, Avigilon Unity, Hikvision Bricks и Axis Communications Camera Station в период с 2023 по 2026 год. Если ваш детектор не поддерживает отправку ONVIF-событий, он не сможет подключиться к корпоративным VMS без индивидуальной интеграции под конкретного производителя. Profile M определяет формат JSON для полезной нагрузки событий, шаблон подписки на уведомления по стандарту WS-BaseNotification и XML-схему метаданных; стоимость соответствия включает однократную интеграцию продолжительностью 2–3 инженеро-недели и ежегодную плату за членство в ONVIF для прохождения тестов на соответствие.

RTSP по-прежнему остаётся протоколом по умолчанию для передачи потока от камеры к pipeline. Задержка составляет 30–50 мс в локальной сети и 100–300 мс в WAN. Устройства на краю сети (edge-боксы) получают RTSP-поток, декодируют его (часто с использованием аппаратного декодера на том же NPU-модуле) и запускают inference. RTSP старше современного стека WebRTC, но остаётся универсальным решением на рынке IP-камер, а стандарт ONVIF определяет сторону потоковой передачи как RTSP ради обратной совместимости.

WebRTC – более современный слой для потоковой передачи с задержкой 20–100 мс, лучшим прохождением через фаерволы, усиленным шифрованием и адаптивным битрейтом. Он поддерживается новыми облачными VMS и интерфейсами операторов, которые мы используем, когда критически важна доставка с задержкой менее секунды на удалённую консоль. Интеграция сложнее (требуется сигнальный сервер, TURN, SFU при масштабировании), но по задержкам WebRTC однозначно превосходит альтернативы.

MQTT – шина для тревог. Детектор аномалий публикует сообщение в топик типа event/shoplift/zone-5/conf-0.87 в брокер; подписчики – SIEM, система тикетов, мобильное приложение, актуатор, аудит-лог – обрабатывают событие и раздают его по всем каналам. MQTT – де-факто стандарт на уровне IoT для передачи тревог благодаря низкому накладным расходам и гарантиям качества доставки; это правильный выбор вместо HTTP-вебхуков при любом развертывании, превышающем дюжину камер.

Паттерн, который мы используем в продакшене: ONVIF Profile M – для интеграции с клиентским VMS (так как он уже поддерживается, а любой другой выбор вызывает сложности интеграции), MQTT – для высокочастотной шины оповещений в on-site-системы реагирования, и отдельная запись аудита в неизменяемое хранилище объектов (S3 Object Lock, Azure Blob WORM) – для регуляторных доказательств. Сам детектор подключается к камере по RTSP или WebRTC – в зависимости от поколения камеры.

Цены вендоров и арифметика build-vs buy в мае 2026

Решение «построить или купить» в детекции аномалий зависит от количества камер, горизонта планирования и ценности владения данными. При менее чем 20 камерах и горизонте до 18 месяцев SaaS-подход почти всегда предпочтительнее. При более чем 100 камерах и горизонте свыше 3 лет преимущество обычно на стороне собственной разработки. А вот в промежуточной зоне выбор действительно неоднозначен.

Текущая ценовая полоса SaaS на май 2026 года:

ВендорИндикативная ценаТиповая нишаНа что смотреть
BriefCam$50–200/камера/месEnterprise, investigation + liveFootprint под AI Act, vendor lock-in
Motorola Avigilon$30–150/камера/месГоссектор, большие кампусыПривязка к железу
Milestone XProtect + plugin$200–400/сервер/месVMS-led shopsКачество плагина варьируется
Verkada$25–75/камера/месSMB, cloud-firstПроприетарные камеры
Eagle Eye Networks$10–30/камера/месCloud VMS, базовая аналитикаОграниченный advanced AD
iOmniscient$40–120/камера/месТранспорт, плотная аналитикаМеньше интеграторов
Genetec Security Center + KiwiVision$40–150/камера/месEnterprise, large-scale opsAnnual maintenance ~20% list
AnyVision (Oosto)$50–200/камера/месIdentity-aware retail, venuesБиометрический режим
Custom build (Фора Софт)Проект + infra100+ камер, специфичные классы, regulator-grade auditTime-to-first-pilot vs SaaS

Цифры выше – это list-price полосы на май 2026 года; согласованные enterprise-контракты на крупном масштабе обычно заключаются на 30–50% ниже list. Относитесь к таблице как к оценке порядка величины, а не точной цитате.

Прорабатываемый анализ точки кроссовера. Деплой 100 камер, горизонт – 3 года, соответствие EU AI Act. SaaS-подход (BriefCam по $100 за камеру в месяц, включая часть документации по AI Act): $100 × 100 × 36 = $360 000 за три года. Кастомный путь: инженерная разработка 12 недель по ставкам mid-market service, плюс $25 000 на edge-оборудование, плюс $30 000 в год на облачные сервисы и эксплуатацию. Итого за три года – около $200 000–280 000, в зависимости от скорости команды и степени переиспользования существующего VMS. Точка кроссовера – примерно на 1,7–2,1 год: после неё кастомное решение становится дешевле, и вы получаете полный контроль над данными, моделью, audit trail и интеграцией. При горизонте менее 18 месяцев оптимальный выбор – SaaS-контракт: у вас недостаточно времени, чтобы окупить разработку.

Контекст роста рынка. Рынок data anomaly detection при CAGR 19,5% – один из самых быстрорастущих сегментов в сфере ИИ-инструментов. Рынок intelligent video analytics оценён в $14,65 млрд в 2026 году с прогнозом роста до $41,39 млрд к 2031 году (CAGR 23,1%). Общий рынок video surveillance составит $95 млрд в 2026 году и достигнет $261 млрд к 2034 году (CAGR 13,5%). Возможность обнаружения аномалий становится ключевым дифференциатором, который крупные игроки закладывают в новые контракты; уже через 24 месяца она станет стандартом – table stakes, и продукты, поставляемые без этой функции, будут вынуждены адаптироваться под требования клиентов.

EU AI Act, GDPR и compliance-инженерия, которую должна нести кодовая база

EU AI Act (Регламент 2024/1689) – крупнейшее изменение в экономике video anomaly detection за последнее десятилетие. Частично вступил в силу в августе 2025 года; обязательства по системам с высоким уровнем риска полностью вступают в силу в августе 2026 года. Если ваш продукт работает в ЕС или имеет клиентов в ЕС, теперь соответствующие разделы становятся инженерной задачей, а не юридической формальностью.

Реальное время биометрической категоризации физических лиц в публично доступных пространствах строго ограничено по статье 5 (о запрещённых практиках). Исключения узки: поиск пропавших, предотвращение конкретной непосредственной террористической угрозы, идентификация виновного в тяжком преступлении – и требуют судебного разрешения. Обнаружение аномалий на основе распознавания лиц в реальном времени – это высокорисковая сфера Акта; многие поставщики в 2025 году покинули рынок ЕС именно потому, что их продукты не соответствовали требованиям статьи 5.

Приложение III перечисляет высокорисковые ИИ-системы. Сюда входят системы наблюдения за критической инфраструктурой, биометрическая идентификация и системы, связанные с правоохранительной деятельностью. Для высокорисковых систем обязательства статей 9–15 включают документированную систему управления рисками, управление данными с фиксацией предвзятости, техническую документацию по модели и обучающему набору, автоматическое логирование, механизмы контроля со стороны человека, требования к точности и устойчивости, а также оценку соответствия. Эти артефакты – не продукт юридической команды, а инженерные документы, которые должна генерировать кодовая база. Карточки моделей, листы данных, логи обучения, логи дрейфа, следы аудита оповещений – всё это deliverables, удовлетворяющие требованиям статей 11 и 13.

Штрафы не символические. За самые серьёзные нарушения запрещённых практик – до 7% глобального годового оборота или 35 млн евро (что больше). За нарушение high-risk-системы – до 3% или 15 млн евро. Маленький продукт, поставляемый в ЕС без оценки соответствия, оказался в центре внимания так, как ни один продукт в этой нише не был за три года до этого.

GDPR не отменён. Статья 9 по-прежнему относит биометрические данные к специальной категории, требующей чёткого правового основания. Статья 35 продолжает обязывать проводить оценку воздействия на защиту данных при любом значимом внедрении. Руководства по использованию CCTV от Европейского совета по защите данных (EDPB) и Уполномоченного по информации Великобритании (UK ICO) с 2022 года систематически ужесточаются. На практике это означает, что реализация систем обнаружения аномалий на основе распознавания лиц в ЕС крайне затруднена за пределами узкоспециализированных сценариев; методы, основанные на походке, осанке, предметах и поведении, находятся в гораздо более благоприятной правовой среде.

Инженерный паттерн, соответствующий Акту, – тот же, что мы и так рекомендовали по техническим соображениям. Используйте gait и posture face-based, если use case это позволяет. Храните кадры локально, если допустима латентность – edge-обработка даёт значительно меньшую compliance-поверхность по сравнению с облаком. Фиксируйте каждое срабатывание с указанием confidence, ID проверяющего, dispositions и версии модели – именно этот лог и будет служить audit trail, который запросит регулятор. Включите контроль со стороны человека в рабочий процесс ответа; Акт это требует. Размещайте model card и документацию по тренировочным данным в том же репозитории, что и модель; не выносите их в отдельный артефакт.

Регуляторный слой подробно разбираем в уроке 8.5 по EU AI Act и Article 50 engineering. Коротко: к 2026 году соответствие требованиям – это уже не внешнее навязывание, а полноценная фича продукта.

Двенадцать алгоритмов anomaly detection, между которыми вы реально выбираете

Следующая статья серии – 2.16 – Алгоритмы anomaly detection: 12 production-подходов – подробно рассматривает каждый алгоритм. Ниже приведена краткая сводка, достаточная для того, чтобы указать правильное название в RFP, без претензий на глубину, которой пока нет.

One-class SVM – классический базовый метод. Обучается на нормальных кадрах или признаках, порог устанавливается по расстоянию до границы при инференсе. Простой, не требует примеров аномалий, хорошо подходит для задач типа «есть ли движение в обычно пустом пространстве».

Isolation Forest изолирует аномалии с помощью рекурсивного разбиения пространства признаков случайными бинарными деревьями. Аномалии выделяются за меньшее число разбиений, чем нормальные точки. Алгоритм работает быстро, масштабируется линейно и не требует примеров аномалий. Это подходящий инструмент для обнаружения аномалий на уровне сигнала на основе инженерных признаков.

Local Outlier Factor (LOF) выявляет локальные аномалии по плотности – точки, находящиеся в областях с низкой плотностью, окружённые более плотными регионами. Он предпочтительнее Isolation Forest, когда нормальное поведение распределено неравномерно по пространству признаков.

Autoencoder reconstruction обучает encoder-decoder сжимать и восстанавливать нормальные кадры: у аномалий при этом высокая ошибка реконструкции. Это доминирующий безнадзорный подход в обнаружении аномалий в видео в период 2020–2024 годов и остаётся оптимальным выбором, когда метки отсутствуют.

ST-AE и MemAE – это spatial-temporal автоэнкодеры, разработанные специально для работы с видео. MemAE включает memory-модуль, который не позволяет автоэнкодеру чрезмерно хорошо обобщать аномалии; ST-AE добавляет моделирование временных зависимостей. Оба алгоритма работают на edge-устройствах.

Variational Autoencoder (VAE) и GAN-основанные детекторы моделируют распределение нормальных данных и помечают образцы с низким likelihood. Они стабильны в исследованиях, но реже применяются в продакшене из-за нестабильности обучения.

3D-Convolutional Neural Networks (I3D, C3D, SlowFast) – надёжный инструмент для обнаружения аномалий в поведении. После квантования до INT8 модель работает на Jetson Orin Nano Super со скоростью 30 кадров в секунду. Это оптимальный выбор модели второго уровня для внедрения в продукт.

Video transformers (TimeSformer, VideoSwin, VideoMAE, ViViT) – предел точности. Доминируют на небольших бенчмарках (Avenue, ShanghaiTech) и являются оптимальным выбором для повторной оценки на стороне облака. Пока не пригодны для реального времени на устройствах с ограниченными ресурсами в 2026 году.

Weakly-supervised MIL (RTFM, MGFN, AAMIL, Unbiased MIL, MTFL) – академический уровень наилучших результатов на UCF-Crime. Это правильная модель второго уровня, когда есть метки на уровне видео, но отсутствуют метки на уровне кадров.

CLIP-основанные методы (VadCLIP, TPWNG, VadCLIP++, TrCLIP-VAD, WSVAD-CLIP, AVadCLIP) – семейство рескореров третьего уровня. Используйте их при необходимости open-vocabulary детекции или при ограниченном бюджете на разметку.

Мультимодальные LLM (Holmes-VAD, AnomalyRuler, Cerberus) – семейство объяснителей слоя 4. Применяйте, когда тревога должна быть озвучена на естественном языке для человека-ревьюера или регулятора.

LSTM и temporal CNN на инженерных признаках – инструменты обнаружения аномалий сигнала на уровне 5. Применяйте их к метаданным пайплайна, чтобы выявлять сбои, которые пропускают визуальные слои.

Дефолтная архитектура Фора Софт объединяет слои 1, 2, 3, 4 и 5: квантованный 3D-нейросетевой классификатор на edge, MIL-классификатор на его выходе, CLIP-рескорер в облаке, frontier-VLM для интерпретации топ-1% пограничных случаев и Isolation Forest, отслеживающий работу всего пайплайна. Стоимость в указанной полосе, как показано в приведённом примере; высокая точность на всей области применения; аудит-трейл соответствует требованиям AI Act. Другие архитектуры ориентированы на более узкие задачи, тогда как данная – предназначена для общего случая.

Типичная ошибка – воспринимать обнаружение аномалий как задачу распознавания объектов

Самая дорогая архитектурная ошибка в этой нише – когда команда берёт готовый YOLO-пайплайн, уже настроенный на детекцию объектов, и поверх него накладывает правило обнаружения аномалий: «тревога, если человек в зоне X» или «тревога, если счётчик больше N». Кажется, что это дёшево – ведь используется существующий код. Но это не так.

Причина провала в том, что аномалия – это редко «объект в месте», а скорее «объект, который ведёт себя иначе во времени в контексте, не учтённом моделью». Человек, идущий через зону, в 09:00 выглядит нормально, а в 03:00 – аномально; сумка у скамейки нормальна первые две минуты, но становится аномальной после десяти; человек, бегущий по коридору, – нормально, а на платформе – уже нет. Ни одно из этих различий не отражается в выходе YOLO. Чтобы их выявить, нужна либо темпоральная модель (3D-ConvNet, видео-трансформер, LSTM на треках объектов), либо слой правил с учётом расписания и контекста – подход, подходящий для простых случаев, но быстро становящийся неподдерживаемым.

Фикс – начать архитектуру со слоя 2 описанного выше стека (темпоральная модель, обрабатывающая несколько секунд видео) и подключать object-детектор только тогда, когда аномалию нужно локализовать на конкретной сущности для последующего действия. Обратный путь почти всегда приводит к тому, что через год после запуска проекта система оказывается в четырёх типах крайних случаев, с глубокой вложенностью и запутанным набором правил, который никто не может отладить.

Подводный камень обойдён: когда стейкхолдер говорит: «У нас уже есть object detection, давайте просто добавим anomaly detection сверху», правильный ответ – задать четыре ключевых вопроса: «Какой бюджет латентности? Какой класс аномалии? Какая длина темпорального контекста? И какой бюджет разметки?» Эти вопросы возвращают обсуждение на уровень архитектуры (слой 2 стека), а не на уровень бизнес-логики (слой 6 движка правил).

Где Фора Софт вписывается

Мы выпускаем production-видеопродукты уже два десятилетия – surveillance на базе Netcam Studio, conferencing на WebRTC, телемедицина, e-learning, OTT, AR/VR. Слой anomaly detection – направление, в котором мы наиболее активны в 2024–2026 годах, как для новых greenfield-проектов в области видеонаблюдения, так и для retrofit-решений, где существующий видеопродукт получает эту функциональность без нарушения остальной pipeline. Стандартная архитектура – пятислойный стек из этой статьи; стандартная топология – гибридный edge+cloud паттерн; стандартная интеграция – ONVIF Profile M + MQTT + регуляторно-устойчивый аудит-трейл. Мы работали в ритейле, на транспорте, в промышленной безопасности, в здравоохранении и в conferencing – разные классы аномалий, разные требования к задержке, но та же инженерная дисциплина.

Ключевые выводы

  • Обнаружение аномалий в 2026 году – это многоуровневый пайплайн, а не единая модель. Пять уровней; пропуск одного – типичная причина провала.
  • Определите класс аномалии одним предложением до выбора модели. Класс задаёт все последующие решения.
  • Бюджет задержки – первое число, которое вы согласовываете. Задержка ниже 200 мс требует edge-обработки; в облаке нормально выше 500 мс.
  • Методы на основе CLIP и VLM – технологический прорыв 2026 года. Применяйте их при нехватке размеченных данных или необходимости интерпретируемости.
  • EU AI Act – инженерный вызов. Model cards, журналы аудита и контроль человека должны быть частью кодовой базы.
  • Переломный момент между разработкой и покупкой – примерно 18–24 месяца для 100+ камер. SaaS выгоднее до этого срока, custom-решения – после.

Что почитать дальше

Иллюстрации

Статья сопровождается тремя SVG-изображениями, выполненными в цветовой палитре Article Styling Guide.

  • 02_15-obnaruzhenie-anomaliy-v-video-2026-playbook__01-anomaly-taxonomy.svg – пятиколоночная горизонтальная схема, в которой перечислены пять классов аномалий (поведенческая, физическая, плотность, расписание, статистическая) в виде подписанных карточек. На каждой – краткое определение, два примера и рекомендованное семейство моделей.
  • 02_15-obnaruzhenie-anomaliy-v-video-2026-playbook__02-latency-budget-topology.svg – горизонтальная диаграмма с наложенными полосами (stacked band), отображающая пять уровней допустимой задержки (латентности): до 150 мс – транзит, 200–300 мс – периметр, 300–500 мс – ритейл, 500–1000 мс – плотность, минуты – forensic. Под каждый уровень указана единственная жизнеспособная топология.
  • 02_15-obnaruzhenie-anomaliy-v-video-2026-playbook__03-edge-cloud-topology.svg – архитектурная схема гибридной топологии edge + cloud. Слева – камера и вычислительное устройство (Jetson Orin / Hailo-8), реализующие слои 1 и 2, с MQTT-шиной для передачи тревог. Справа – облачный GPU, выполняющий слои 3 и 4, с вызовом моделей Gemini / Claude для обработки топ-1% пограничных случаев. Журнал аудита хранится в S3 с включённым Object Lock.

Все три используют типографическую систему стайл-гайда и заканчиваются футер-строкой Фора Софт · fora-soft.ru 11 px цветом Neutral mid #7A7F87.

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.