YOLO в рабочей системе – v8, v9, v10, v11, v12

Автор: Николай СапуновОбновлено: август 202631 мин чтения
Содержание статьи +

Кратко

Между январём 2023 и февралём 2025 года семейство YOLO – рабочая лошадка детекции объектов, которая в видеопродуктах используется чаще, чем все остальные детекторы вместе взятые, – прошло пять мажорных обновлений: YOLOv8, YOLOv9, YOLOv10, YOLOv11, YOLOv12. Каждая версия вносила конкретные изменения в продуктовое решение: v8 сделала YOLO anchor-free и мультизадачной, v9 добавила градиентный пайплайн, позволивший небольшим моделям не отставать от крупных, v10 устранила постобработку, занимавшую пять миллисекунд задержки, v11 переписала backbone и сократила количество параметров на 22% при росте точности, а v12 впервые внедрила механизм внимания (attention) в детектор реального времени. Правильная версия для вашего продукта почти никогда не является «самой новой» – это та, чья архитектура, лицензия и история развёртывания соответствуют числу камер, требованиям к точности и готовности юриста работать с AGPL-3.0. Статья пройдёт по пяти версиям решение за решением, чтобы вы выбрали оптимальный вариант с первого раза.

Зачем это важно

Если вы готовите запуск детекции объектов в видео-продукте – системе видеонаблюдения, ритейл-аналитике, фитнес-приложении, пайплайне модерации OTT или инструменте сортировки в телемедицине – YOLO почти наверняка станет моделью, которую инженерная команда выберет в первую очередь. Вопрос лишь в том, какую YOLO. Ошибка в выборе может стоить трёх месяцев переобучения, когда выйдет следующая версия; выяснится, что лицензия AGPL-3.0 обязывает вас открыть исходники всего приложения; или окажется, что латентность модели не укладывается в бюджет при вашем количестве камер.

Статья предполагает, что вы уже ознакомились с уроком 2.1 про предобработку для CV-проектов – пайплайн предобработки решает половину точности YOLO в продакшене – и уроком 1.4 про реальную стоимость ИИ в видео-продуктах, ведь стоимость одного инференса YOLO на поток – это то, что превращает фича-решение в юнит-экономику.

К концу статьи вы сможете прочитать релизную заметку YOLO, сопоставить её с пятью версиями ниже и чётко сказать своей инженерной команде, какую модель брать и почему.

Что означает «YOLO» в продакшене в 2026

Аббревиатура «You Only Look Once» – YOLO – с 2016 года в сфере computer vision стала перегруженной, и теперь это слово относится как минимум к трём разным вещам, которые постоянно путают на любом старте проекта. Начнём с разграничения.

Оригинальная YOLO, YOLOv1, – это архитектура 2015–2016 годов, разработанная Джозефом Редмондом, которая впервые предложила предсказывать bounding box’ы и классы объектов для всего изображения за один проход через свёрточную сеть, вместо того чтобы сначала генерировать region proposal, а затем отдельно классифицировать объекты. Именно эта работа стала основой для того, что «YOLO» превратилось в бренд. Редмонд с соавторами разработали YOLOv1, v2 и v3 в период с 2016 по 2018 год, после чего покинули проект.

Второе, что называют YOLO, – линейка версий, вышедших после оригинала: YOLOv4, YOLOv5, YOLOv6, YOLOv7, YOLOv8, YOLOv9, YOLOv10, YOLOv11, YOLOv12 и, с конца 2025 года, YOLO26. Каждую версию разрабатывала своя команда в своей организации, каждая выпускалась под своей лицензией, демонстрировала свою архитектуру и претендует на роль законного наследника оригинала. На самом деле это не одна линейка. Это бренд, расколотый между командами, которые сошлись во мнении, что имя YOLO обладает достаточной инженерной репутацией, чтобы стоить борьбы.

Третье – продуктовая линейка Ultralytics: YOLOv5, YOLOv8, YOLOv11 и YOLO26 разработаны и поддерживаются компанией Ultralytics – британской компанией, основанной Гленном Джокером, автором YOLOv5. Ultralytics выпускает Python-пакет ultralytics, владеет лицензией AGPL-3.0 на open-source-версию и предлагает коммерческую enterprise-лицензию для команд, которым не подходят обязательства AGPL. Когда говорят «мы возьмём YOLO», чаще всего имеют в виду «мы возьмём пакет Ultralytics», потому что именно у него есть документация, облачный сервис обучения, интеграция с Roboflow и SDK для инференса. Версии, упомянутые в статье – v8, v9, v10, v11, v12 – охватывают как релизы от Ultralytics, так и независимые академические версии, которые существуют параллельно с пакетом Ultralytics.

Вывод для продуктового решения очевиден. Выбрать «YOLO» недостаточно – команда должна определиться с конкретной версией, лицензией и целевой платформой развертывания. Ниже перечислены пять версий, из которых продакшен-команда реально выбирает в 2026 году. Более старые версии (v5, v7) всё ещё используются в продакшене, но архитектурных преимуществ, оправдывающих миграцию, у них нет – разве что юридические ограничения вынуждают оставаться на них.

Рисунок 1. Пять версий YOLO, выпущенных с января 2023 по февраль 2025 года. Каждая версия внесла одно конкретное изменение в продуктовое решение; оптимальная версия – та, чьё изменение соответствует узкому месту вашего проекта.

YOLOv8 – Январь 2023 – Без якорей, мультизадачная база

YOLOv8 – версия, которая превратила бренд YOLO из односерийного детектора в универсальную vision-платформу. Ultralytics выпустила её 10 января 2023 года, и за полгода она стала стандартной отправной точкой для почти любого нового проекта в области компьютерного зрения, у которого не было веской причины выбирать что-то иное. Причина не в чистой точности – предыдущие версии YOLO были близки по показателям. Дело в том, что YOLOv8 приняла три ключевых инженерных решения, которые существенно снизили стоимость запуска продукта в области компьютерного зрения.

Первое решение – anchor-free детекционная голова. В предыдущих версиях YOLO использовались «якоря» (anchors) – заранее заданные формы ограничивающих рамок (высокие, широкие, квадратные, маленькие, большие), которые модель подстраивала под реальные объекты. Якоря приходилось настраивать под каждый датасет, поскольку у датасета с кофейными кружками соотношения сторон отличаются от датасета с припаркованными машинами, а ошибка в настройке снижала точность. YOLOv8 отказалась от якорей и стала напрямую предсказывать координаты рамок. Эффект: модель быстрее обучается на пользовательских датасетах, лучше обобщает данные, когда распределение клиентских данных не совпадает с распределением при предобучении, и выдаёт меньше лишних рамок, которые приходится фильтровать на этапе Non-Maximum Suppression (NMS).

Второе решение – модуль C2f (Cross-Stage Partial Bottleneck with two convolutions). C2f заменил более старый модуль C3 в backbone – той части модели, которая преобразует сырые пиксели в полезные признаки. Суть C2f заключалась не в значительном росте точности, а в улучшении прохождения градиентов при обучении, чтобы модель сходилась за меньшее число эпох при той же конечной точности. На практике это означало: кастомно обученная YOLOv8 достигала качества, пригодного для продакшена, за 50 эпох, тогда как YOLOv5 требовала 100, что напрямую давало 50%-ную экономию затрат на облачное обучение в ходе эксперимента.

Третье решение – поддержка мультизадачности из коробки. YOLOv8 поставляется в пяти вариантах модели: детекция, instance segmentation, классификация, pose/keypoints и oriented bounding box – все они используют один и тот же backbone и единый пайплайн обучения. Ритейл-команда, которой сейчас нужна детекция, а через полгода – сегментация, может запустить обе задачи в одном пакете ultralytics, с одним форматом датасета и одним скриптом обучения. Никакая другая модель-детектор в 2023 году не объединяет пять задач так чисто. В проекте видеонаблюдения, где требуется детектировать людей, сегментировать их силуэты для размытия приватных зон и оценивать позу для распознавания падений, сама возможность мультизадачности становится весомым аргументом в пользу выбора YOLOv8.

Бенчмарки COCO для YOLOv8 – стандартный референс точности на тестовом датасете из 80 классов – выглядят так: 37,3% mAP для YOLOv8n (nano-версия, 3,2 млн параметров), 44,9% для YOLOv8s (11,2 млн параметров), 50,2% для YOLOv8m (25,9 млн параметров), 52,9% для YOLOv8l (43,7 млн параметров), 53,9% для YOLOv8x (68,2 млн параметров). Данные взяты с официальной карточки модели Ultralytics. «mAP» – mean Average Precision, усреднённая по порогам детекции – это основная метрика точности детектора; модель с 50,2% mAP корректно обнаруживает и классифицирует примерно половину объектов в датасете в строгом диапазоне IoU 0,50–0,95.

Главная слабость YOLOv8 в 2026 году – в том, что его архитектура «C2f + anchor-free» уступает по всем параметрам любой последующей версии. Для нового проекта начинать с v8 нет веских причин – разве что YOLOv8 уже используется в продакшене, и стоимость миграции превышает возможности команды на ближайший квартал.

YOLOv9 – Февраль 2024 – Градиентный пайплайн, который спас маленькие модели

YOLOv9 была выпущена 21 февраля 2024 года. Её авторами стали академическая группа под руководством Chien-Yao Wang (ранее создавшего YOLOv4 и YOLOv7). Это не релиз от Ultralytics, однако команда быстро добавила поддержку YOLOv9 в свой пакет ultralytics. Модель была представлена в статье «YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information», которая позже была принята на ECCV 2024.

YOLOv9 внесла одно архитектурное изменение, оказавшееся важнее всех остальных: она закрыла разрыв в точности между малыми моделями. В любой версии YOLO до v9 самые маленькие варианты («n» и «s», подходящие для edge-устройств) теряли заметную долю точности, в то время как более крупные («m», «l», «x») этого не делали. Причина заключалась в динамике обучения: с увеличением глубины сети полезный градиентный сигнал затухал в слоях, и маленькая модель – у которой и так меньше слоёв – в первую очередь страдала от нехватки градиента. Решение в v9 – двухкомпонентное.

Первая часть – Programmable Gradient Information (PGI). Обучающий пайплайн включает параллельную вспомогательную сеть, которая обеспечивает основную сеть надёжным градиентным сигналом для каждого слоя и удаляется на этапе инференса. Вспомогательная сеть не увеличивает нагрузку при развертывании, поскольку удаляется перед экспортом. На этапе обучения она предотвращает недостаток градиентов у небольших вариантов модели.

Вторая часть – новая архитектура GELAN (Generalized Efficient Layer Aggregation Network). GELAN построен вокруг концепции, которую авторы назвали «gradient path planning» – структурного подхода, явно определяющего маршруты, по которым градиенты возвращаются через сеть, чтобы правильный сигнал доходил до нужного слоя. Архитектурные детали менее важны, чем практический результат: YOLOv9-tiny достигла 38,3% mAP на COCO, обогнав YOLOv8n с 37,3% при на 21% меньшем количестве параметров и на 24% меньших FLOPs. По всей линейке YOLOv9 обеспечивает на 49% меньше параметров и на 43% меньше вычислений по сравнению с YOLOv8 при той же точности. Для развёртывания на edge-устройствах, где модель должна работать на Raspberry Pi или Jetson Orin Nano, это разница между «запустить» и «не запустить».

Главная слабость YOLOv9 – её выход пришёлся на насыщенный период: всего через три месяца Ultralytics представила YOLOv10 (тоже через статью, а не через пакет ultralytics, но с интеграцией Ultralytics), и внимание к развертыванию переключилось с градиентной архитектуры v9 на NMS-free подход v10. В 2026 году v9 остаётся правильным выбором для одного конкретного сценария: edge-проекта, которому нужна максимально компактная модель с приемлемой точностью и который может обойтись стандартным NMS-постобработкой.

YOLOv10 – Май 2024 – Архитектура без NMS

YOLOv10 была представлена в мае 2024 года академической группой из Tsinghua University под руководством Ao Wang, Hui Chen и Lihao Liu. Работа опубликована как статья «YOLOv10: Real-Time End-to-End Object Detection» (arXiv 2405.14458) и принята к публикации на NeurIPS 2024. Поддержка YOLOv10 была быстро добавлена в пакет Ultralytics.

YOLOv10 внесла одно важное изменение для продакшена, которое оказалось значительнее любого прироста точности на странице: она убрала этап Non-Maximum Suppression из пайплайна инференса. Чтобы понять, почему это важно, нужно разобраться, что делает NMS и зачем он был нужен во всех предыдущих версиях YOLO.

Любая предыдущая версия YOLO выдавала несколько перекрывающихся боксов для одного объекта при инференсе. «Человек» на кадре обычно порождал три, пять или даже двенадцать кандидатных боксов с разной степенью уверенности, и шаг NMS последовательно обходил их: выбирал самый уверенный, отбрасывал перекрывающиеся и повторял процесс, пока не оставался один бокс на объект. NMS корректен, но вычислительно дорог. На YOLOv8s, запущенной на NVIDIA T4, NMS добавлял примерно 4–6 миллисекунд задержки к каждому инференсу – около четверти общего времени выполнения. Кроме того, NMS плохо интегрировался в встраиваемые рантаймы для инференса: команды, работающие с CoreML, TFLite и OpenVINO, часто вынуждены были вручную переписывать NMS в deployment-рантайме, что приводило к категории багов, «съедавших» недели инженерного времени на проект.

YOLOv10 решила проблему NMS с помощью consistent dual label assignments. Во время обучения модель использовала две параллельные головы для назначения меток: one-to-many (которая порождала поведение «много перекрывающихся боксов», которое затем удалял NMS) и one-to-one (которая выдавала ровно один бокс на объект). На этапе инференса модель отбрасывала голову one-to-many и использовала только one-to-one, которая выдавала чистые предсказания без постобработки NMS. Обе головы обучались согласовываться, и при этом точность не снижалась.

Бенчмарки для YOLOv10-S: 46,7% mAP при ~2,49 мс инференса на T4 – на 2,0 mAP выше, чем у YOLOv8-S, при на 19% меньшей латентности, и на 0,7 mAP выше, чем у YOLOv9-S, при на 30% меньшей латентности. NMS-обучение без использования NMS сократило end-to-end латентность YOLOv10-S на 4,63 мс по сравнению с базовой версией v8 – ровно столько времени нужно вернуть на кадр, если вы обрабатываете 200-камерную систему видеонаблюдения на одном GPU.

Главная слабость YOLOv10 – лицензионная: академический релиз распространяется под AGPL-3.0 (наследуется через интеграцию с Ultralytics), а репозиторий THU-MIG на GitHub также использует AGPL-3.0. Та же юридическая логика, что ограничивает применение YOLOv8 в продакшене, действует и в отношении YOLOv10. В 2026 году v10 станет правильным выбором для любой команды, которой нужна минимальная задержка на кадр в реальном времени (например, live-алертинг в системах видеонаблюдения, видеоэффекты в звонках, трекинг позы в WebRTC), при условии, что команда либо может приобрести enterprise-лицензию Ultralytics, либо готова опубликовать исходный код своего приложения.

YOLOv11 – Сентябрь 2024 – Редизайн Backbone под Edge

YOLOv11 выпущена компанией Ultralytics 10 сентября 2024 года. Это продуктовый релиз от Ultralytics (подобно v5 и v8), распространяется через тот же Python-пакет ultralytics и под той же двухуровневой лицензией AGPL-3.0 / enterprise. В отличие от предыдущих версий, в YOLOv11 не появилось одной революционной идеи вроде PGI в v9 или NMS-free в v10 – вместо этого она консолидировала линейку YOLO в более чистую архитектуру, превосходящую v8 по всем метрикам и демонстрирующую более высокую производительность на edge-устройствах.

Значительное архитектурное изменение – блок C3k2, заменивший C2f в backbone. C3k2 представляет собой вариант паттерна Cross-Stage Partial с различными размерами ядер (смесь свёрток 3×3 и 5×5) и стратегией разделения каналов, что позволило сократить избыточное извлечение признаков. Практический результат: YOLO11m показала прирост mAP примерно на 1,3% по сравнению с YOLOv8m на COCO, при этом количество параметров сократилось на 22%, что привело к уменьшению размера ONNX-экспорта примерно на 22% и измеримому ускорению инференса на CPU.

YOLOv11 также добавила два модуля, похожих на attention: SPPF (Spatial Pyramid Pooling, Fast), унаследованный от v8, и новый C2PSA (Cross-Stage Partial Spatial Attention) – блок пространственного внимания в части neck. C2PSA – это более лёгкая версия полного self-attention: он не требует квадратичных вычислительных затрат, как у трансформеров, но позволяет модели фокусироваться на важных участках изображения, что повысило точность распознавания маленьких и частично закрытых объектов. Типичный пример – камера в ритейле, где нужно обнаружить человека, наполовину скрытого в глубине прохода.

Главные показатели COCO для YOLOv11: 39,5% mAP для YOLOv11n (2,6 млн параметров), 47,0% для YOLOv11s, 51,5% для YOLOv11m, 53,4% для YOLOv11l и 54,7% для YOLOv11x. Отношение mAP к числу параметров – лучшее в линейке на данный момент. На GPU T4 с использованием TensorRT модель YOLOv11n обеспечивает задержку около 1,5 мс; на NVIDIA Jetson Orin Nano та же модель работает с задержкой 8–10 мс, что достаточно для обработки в реальном времени со скоростью 30 кадров в секунду на нескольких потоках камер.

YOLOv11 сохраняет полный мультизадачный набор – детекция, instance segmentation, классификация, pose, oriented bounding box – впервые представленный в v8. Для большинства продуктовых команд в 2026 году, разрабатывающих новую визуальную фичу на CPU или умеренном GPU, YOLOv11 становится выбором по умолчанию. Это версия с самой чёткой документацией, самым обширным каталогом open-source чекпойнтов и самым зрелым пайплайном экспорта для целевых рантаймов (ONNX, TensorRT, OpenVINO, CoreML, TFLite), на которые команда обычно ориентируется.

Главная слабость YOLOv11 та же, что и у YOLOv8: лицензия AGPL-3.0 затрудняет коммерческое использование, если команда не приобретёт enterprise-лицензию от Ultralytics. И этот вопрос юрист обсудит с инженерным отделом ещё до того, как будет экспортирована первая модель.

YOLOv12 – Февраль 2025 – Attention-центричный детектор

YOLOv12 выпущена 18 февраля 2025 года. Авторы – академическая группа под руководством Yunjie Tian, Qixiang Ye и David Doermann. Статья «YOLOv12: Attention-Centric Real-Time Object Detectors» (arXiv 2502.12524) была принята в виде постерного доклада на NeurIPS 2025. Релиз содержит архитектурное изменение, которого любой следящий за развитием YOLO ожидал с 2020 года: real-time детектор, построенный на основе attention вместо свёрток, с показателями скорости, подтверждающими это.

Для нетехнического читателя: «attention» (внимание) – это механизм, лежащий в основе любой современной большой языковой модели – GPT-5, Claude Opus 4, Gemini 2.5 – а также современных vision-трансформеров (ViT, SAM 2, CLIP). Attention работает так: каждая часть входных данных анализирует все остальные части и учится определять, какие из них важны для текущего предсказания. Историческая дилемма заключается в следующем: наивный attention масштабируется квадратично относительно размера входа, поэтому в течение целого десятилетия свёрточные сети (где каждый фильтр обрабатывает лишь небольшой локальный фрагмент) доминировали в задачах реального времени, таких как детекция объектов. Любая предыдущая попытка применить attention в детекторах реального времени – DETR, RT-DETR, Deformable DETR – платила за повышение точности увеличением задержек.

YOLOv12 сделала механизм внимания достаточно эффективным для использования в продакшене благодаря сочетанию трёх идей. Первая – Area Attention (A2), которая делит карту признаков на пространственные сегменты и вычисляет внимание только внутри каждого из них. Поле восприимчивости – часть входных данных, которую модель обрабатывает за один раз – остаётся большим, поскольку сегменты перекрываются, но квадратичная сложность исчезает, так как внимание становится локальным. Вторая – R-ELAN (Residual Efficient Layer Aggregation Network), переработанный блок агрегации признаков с остаточными связями и механизмом масштабирования. R-ELAN устранил оптимизационные проблемы, с которыми сталкивались более ранние детекторы с вниманием: у них головы внимания расходились на ранних этапах обучения, и модель не могла стабилизироваться. Третья – FlashAttention на этапе инференса. FlashAttention – это численно эквивалентная реализация механизма внимания, которая переупорядочивает обращения к памяти под быструю on-chip SRAM на GPU, обеспечивая ускорение в 2–4 раза без изменения выходных данных.

Бенчмарки YOLOv12: 40,6% mAP для YOLOv12-N при 1,64 мс на T4, 48,0% для YOLOv12-S при 2,61 мс и до 55,2% для YOLOv12-X. YOLOv12-N опережает YOLOv10-N на 2,1 mAP и YOLOv11-N на 1,2 mAP при сопоставимой скорости. Для нетехнического читателя: ранее детекция с использованием attention отставала на 5–15 мс от свёрточной при той же точности; YOLOv12 ликвидировала этот разрыв.

Оговорки по поводу деплоя важны. FlashAttention требует NVIDIA GPU с определённой архитектурной поддержкой – Turing (T4, Quadro RTX), Ampere (A30, A40, A100, RTX 30-серия), Ada Lovelace (RTX 40-серия), Hopper (H100, H200). На более старых GPU, на Apple Silicon, на AMD GPU и на большинстве edge-устройств (Jetson Nano, Raspberry Pi, Intel CPU) FlashAttention либо не запускается вообще, либо работает медленнее стандартной реализации attention. Обёртка Ultralytics YOLOv12 не требует FlashAttention – она автоматически переходит на нативный PyTorch, – но при этом теряется преимущество в скорости, ради которого имеет смысл выбирать YOLOv12 вместо YOLOv11. Лицензия тоже важна: при интеграции через ultralytics академический релиз наследует двухуровневую лицензию AGPL-3.0 / enterprise.

В 2026 году YOLOv12 – правильный выбор для проектов, где в качестве цели развертывания используются GPU NVIDIA: облачные серверы, современные рабочие станции, NVIDIA Jetson AGX Orin – и требуется максимальная точность реального времени. Для edge-устройств без поддержки FlashAttention оптимальным решением остаётся YOLOv11. А для чисто CPU-ориентированных развертываний YOLO26 (выпущена в сентябре 2025 года) уже превзошла обе модели: она работает на 43% быстрее при инференсе на CPU по сравнению с YOLO11-N при сопоставимой точности.

Сравнение пяти версий в продакшене

Таблица ниже объединяет пять версий в одну decision-вьюшку. Читайте по строкам: строка, соответствующая узкому месту вашего проекта, указывает, какую версию использовать.

Ось решенияYOLOv8YOLOv9YOLOv10YOLOv11YOLOv12
Дата релизаЯнв 2023Фев 2024Май 2024Сен 2024Фев 2025
АвторUltralyticsWang и соавт. (акад.)THU (акад.)UltralyticsTian и соавт. (акад.)
Лицензия (open)AGPL-3.0GPL-3.0 / AGPL через UltralyticsAGPL-3.0AGPL-3.0AGPL-3.0 через Ultralytics
Коммерческий путьUltralytics ent.Акад. / Ultralytics ent.Акад. / Ultralytics ent.Ultralytics ent.Ultralytics ent.
Ключевое архитектурное изменениеAnchor-free + C2fPGI + GELANNMS-free dual labelC3k2 + C2PSAArea Attention + R-ELAN
Nano mAP (COCO)37.3%38.3%38.5%39.5%40.6%
Nano латентность T4 (мс)~1.8~2.0~1.9~1.5~1.64
Поддержка мульти-задач5 задачТолько детекцияТолько детекция5 задачДетекция (остальные позже)
NMS на инференсеДаДаНетДаДа
Зависимость от FlashAttentionНетНетНетНетОпционально (для скорости)
Дефолт 2026 дляМиграция legacyEdge с самой мелкой модельюСамая низкая латентностьДефолт нового проектаМакс. точность на NVIDIA GPU

Рисунок 2. Сравнение пяти версий моделей для продакшена. Числа взяты из официальных карточек моделей Ultralytics и соответствующих научных статей; латентность зависит от размера батча, разрешения и версии TensorRT, поэтому важнее относительный порядок, чем абсолютные значения.

Рабочий пример стоимости – 200 камер, три версии

Сделаем сравнение конкретным. Представьте ритейл-проект по борьбе с кражами: 200 камер в 10 магазинах, разрешение 1080p, кодек H.264, частота кадров 30 fps. Обнаружение человека и сумки – 6 fps на камеру (самая медленная частота, при которой система успевает зафиксировать 4-секундное событие кражи, согласно уроку 2.1). Нагрузка: 200 × 6 = 1 200 инференсов в секунду по всей сети.

На NVIDIA L4 ($1,10/час на AWS в 2026) YOLOv8s с квантизацией TensorRT INT8 обрабатывает около 350 инференсов в секунду на GPU при разрешении 1080p. Для обработки 1200 запросов в секунду потребуется ⌈1200 / 350⌉ = 4 GPU, что обойдётся в 4 × $1,10 × 24 × 30 = $3168 в месяц. При использовании тарифов Reserved стоимость снижается до примерно $2000 в месяц.

Тот же парк на YOLOv11s – тот же воркфлоу, тот же TensorRT INT8 – обрабатывает около 480 инференсов в секунду на GPU благодаря C3k2-бэкбону с меньшим количеством FLOPs при большей точности. Парку нужно ⌈1 200 / 480⌉ = 3 GPU, стоимость 3 × $1.10 × 24 × 30 = $2 376 в месяц. Reserved: ~$1 500.

Тот же парк на YOLOv12s с включённым FlashAttention на L4 – около 530 инференсов в секунду на GPU; для обработки парка потребуется ⌈1 200 / 530⌉ = 3 GPU при той же месячной стоимости. Что касается точности: YOLOv12s показывает 48,0% mAP против 47,0% у YOLOv11s и 44,9% у YOLOv8s, что снижает количество ложноотрицательных результатов (пропущенных воров) примерно на 3 п.п. при неизменной частоте ложноположительных срабатываний.

Вывод для продуктового решения очевиден. Ритейл с 200 камерами экономит около 800 долларов в месяц при переходе с v8 на v11 и не несёт расходов при обновлении с v11 на v12 – при этом получая реальный прирост точности, который напрямую влияет на KPI по предотвращению потерь и является тем, за что клиент платит. Оптимальный выбор – YOLOv12s; для более компактного развертывания без L4 (и, соответственно, без FlashAttention) – YOLOv11s.

Типичные ошибки

Прогресс пяти версий скрывает четыре типичных ошибки, на которые регулярно натыкаются продуктовые команды каждый квартал, а стоимость их устранения измеряется неделями инженерной переработки.

Первый промах – брать самую новую версию по умолчанию. YOLOv12 – самый свежий детектор в линейке v8–v12, а YOLO26 – самый свежий вообще, но ни одна из них автоматически не является правильным выбором. YOLOv12 требует GPU NVIDIA, совместимых с FlashAttention, чтобы демонстрировать высокую скорость; на целевых платформах без такой поддержки – Apple Silicon, AMD GPU, Intel CPU, старые Jetson – YOLOv11 работает быстрее. Преимущество YOLO26 на CPU действительно есть, но продукт ещё не до конца созрел (выпущен в сентябре 2025 года), поэтому команды, которым важны наибольший каталог чекпойнтов и наиболее отлаженный пайплайн экспорта, всё равно выбирают YOLOv11. «Самая новая – значит, лучшая» – самая распространённая и единственная ошибка.

Второй промах – игнорировать AGPL-3.0 до момента экспорта. Любой релиз YOLO от Ultralytics (v5, v8, v11, v12 через ultralytics, YOLO26) распространяется по двойной лицензии: AGPL-3.0 / enterprise. AGPL-3.0 – это лицензия с копилефт-ограничениями, и по трактовке Ultralytics она обязывает любую организацию, использующую YOLO в сетевом сервисе, опубликовать исходный код этого сервиса под той же лицензией. Для закрытого коммерческого продукта это неприемлемо. Решение – приобрести enterprise-лицензию от Ultralytics, стоимость которой начинается с нижнего пятизначного диапазона долларов в год для стартапов и растёт с масштабом. Обсудите это с юристом в первую неделю проекта, а не на двенадцатой.

Третий промах – путать «мы используем YOLO» и «мы используем COCO-классы». Претренированные чекпойнты Ultralytics – yolov8n.pt, yolo11s.pt, yolov12m.pt – обучены на датасете COCO, в котором 80 классов объектов (person, car, bottle, dog, traffic-light и т. д.). В задачах ритейла, видеонаблюдения или фитнеса почти ни один из этих классов не соответствует реальным объектам клиента. Претренированная модель – это лишь отправная точка, а не готовый продукт. Команде придётся разметить собственный датасет (обычно 500–5000 изображений на класс), дообучить модель в течение 50–250 эпох, провести валидацию на отложенной выборке и переэкспортировать её. Пропуск этапа дообучения – вторая по частоте причина, по которой «в демо работает, а в продакшене – нет».

Четвёртый промах – поставлять модели в FP32 в продакшен-рантайм. Пакет Ultralytics экспортирует модели в FP32 по умолчанию – это нормально для оценки, но неоптимально для развертывания. Квантизация в INT8 с помощью TensorRT (NVIDIA), OpenVINO (Intel) или CoreML (Apple) обычно даёт ускорение инференса в 2–4 раза при потере точности mAP менее 1% – именно такая разница между использованием двух и четырёх GPU в приведённом выше примере стоимости. Проводите квантизацию на валидационном наборе, измеряйте падение mAP и используйте квантованную модель, если потеря точности допустима. Экспорт-пайплайн Ultralytics поддерживает INT8 для каждого основного таргета.

История Деплоя – Цели экспорта в 2026

Репутация YOLO в продакшене зависит не меньше от export-пайплайна, чем от самой модели. Пакет Ultralytics поддерживает широкий спектр export-таргетов, каждый из которых подходит под свой сценарий использования, а матрица решений – неотъемлемая часть любого проекта.

Таргет-рантаймЖелезоТипичное ускорение vs PyTorchUse case
ONNX (CPU)Любой CPU1.5–3×Кросс-платформенный фолбэк, лёгкий серверный инференс
TensorRTNVIDIA GPU3–5×Облачный GPU, Jetson edge, DeepStream-пайплайны
OpenVINOIntel CPU / iGPU2–4× на CPUIntel-edge, заводские камеры, on-prem серверы
CoreMLApple Silicon (M, A)2–4×iOS-приложения, macOS, Vision Pro
TFLite (INT8)Android, edge-SoC2–5×Мобайл, IoT, микроконтроллеры
TensorFlow.jsБраузер (WebGL / WebGPU)1–2×Client-side инференс в веб-приложениях

Рисунок 3. Матрица export-таргетов для Ultralytics YOLO. Пакет Ultralytics упаковывает каждый таргет в один вызов model.export(), но тонкая настройка под таргет (калибровочный сет для INT8, размер батча, точность) – это инженерная работа, определяющая, попадёт ли деплой в бюджет.

Дефолт 2026 для облачного GPU-деплоя – TensorRT с INT8; для iOS – CoreML с FP16; для Android – TFLite с INT8; для Intel-edge – OpenVINO с INT8; для фолбэка – ONNX на хост-ЦП. Для кросс-платформенного продукта, поставляемого во все пять рантаймов – типично для B2B vision-решений – пакет Ultralytics автоматизирует большую часть тюнинга, но шаг валидации (замер точности по каждому рантайму на отложенной выборке) остаётся обязательным. Рантайм, который «выглядит корректно в CI», всё ещё может привести к модели, теряющей 3–5 mAP относительно базовой версии на PyTorch из-за ошибки калибровки при квантизации или несоответствия формата пикселей.

Где Здесь Фора Софт

Мы поставляем YOLO-пайплайны для детекции в видеонаблюдении, OTT-модерации, телемедицине и фитнес-продуктах на базе YOLOv4 и провели миграции клиентских кодбаз через каждую версию из статьи. Паттерн, повторяющийся в проектах: выбор версии – редко становится узким местом. Пайплайн предобработки (урок 2.1), дисциплина разметки датасета (редкость в CV-курсах, но решающая в продакшене), калибровка квантизации под конкретный runtime и обсуждение лицензии AGPL-3.0 занимают девять из десяти инженерных часов, затрачиваемых на внедрение YOLO. Если ваша команда выбирает между v11 и v12 уже на первой неделе, а первые 500 изображений ещё не размечены, мы вежливо порекомендуем пересмотреть план работ.

Главное

  • YOLOv8 стала anchor-free и мультизадачной; v9 сократила разрыв в точности на малых моделях; v10 убрала NMS; v11 переписала backbone под edge-устройства; v12 добавила attention в real-time детектор.
  • По умолчанию в 2026 году для нового проекта – YOLOv11: лучшая документация, широкая поддержка железа, зрелый пайплайн экспорта.
  • YOLOv12 – оптимальный выбор для NVIDIA GPU с поддержкой FlashAttention (T4, A100, L4, Jetson AGX Orin); на другом оборудовании преимущество по скорости теряется.
  • YOLOv10 остаётся лучшим решением для low-latency real-time деплоев, где отсутствие NMS экономит 4–6 мс на кадр.
  • Любой релиз YOLO от Ultralytics распространяется по двойной лицензии AGPL-3.0 / enterprise – обсудите с юристом в первую неделю.
  • INT8-квантизация через рантайм (TensorRT, OpenVINO, CoreML, TFLite) неприемлема для продакшена; разница в стоимости – реальная.

Что читать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.