Содержание статьи +
- TL;DR
- Зачем это нужно
- Две половины on-device зрения
- Depth Anything V2 – Что Это И Как Работает
- SmolVLM2 – что это и как работает
- Где какая модель уместна – Decision Frame
- Конкретный стек: Depth + SmolVLM вместе
- Режимы отказа в production и инженерные исправления
- Реальность железа и развёртывания
- Где Тут Фора Софт
- Ключевые выводы
- Что читать дальше
TL;DR
Depth Anything V2 и SmolVLM2 – две open-source-модели, благодаря которым в 2026 году малые модели компьютерного зрения на устройстве стали полноценным инженерным решением, а не просто демонстрацией в исследовательских целях. Самая маленькая версия Depth Anything V2 (24,8 миллиона параметров, лицензия Apache 2.0) генерирует пиксельную карту глубины по одному RGB-кадру со скоростью более 50 кадров в секунду на потребительском GPU и работает в реальном времени на смартфоне после экспорта в ONNX или Core ML. SmolVLM2 доступна в трёх размерах – 256M, 500M и 2,2B параметров, – а версия 500M лежит в основе демо-приложения Hugging Face для iPhone, которое анализирует видео локально и не отправляет ни одного кадра в облако. В статье объясняется, как устроены обе модели, где проходит граница между специализированным примитивом вроде Depth Anything и универсальной мультимодальной моделью вроде SmolVLM, а также как объединить их в единый конвейер с низкой задержкой, способный работать на смартфоне, Jetson или прямо во вкладке браузера.
Зачем это нужно
Главное про 2026 год – не в том, что ИИ стал больше. Главное – что маленькие модели стали полезными. Два года назад построение карты глубины по одному кадру было задачей для исследований; сегодня модель с 25 миллионами параметров, обученная на синтетических данных, выдаёт карты глубины, которые для большинства задач в продуктах неотличимы от результатов стереокамеры. Два года назад визуальная языковая модель (VLM), способная описать видеоклип, требовала серверов с несколькими GPU; сегодня модель с 500 миллионами параметров, работающая внутри приложения на iPhone, делает то же самое. Если вы разрабатываете продукт с видео – будь то видеонаблюдение, телемедицина, e-learning, OTT-платформы или видеоконференции, AR – вопрос больше не в том, возможно ли выполнять компьютерное зрение на устройстве. Вопрос в том, какие два-три таких примитивных компонента собрать в стек, чтобы решить продуктовую задачу. Эта статья – для продакт-менеджера, основателя или video-инженера, которому нужно оценить фичу, понимая, что происходит внутри кадра: его геометрия, содержание, отношения между объектами – без оплаты за API-вызовы и без отправки каждого кадра с телефона пользователя на сервер.
Две половины on-device зрения
Удобный способ думать о computer vision на маленьких моделях в 2026 году – представить, что задача делится на две взаимодополняющие части. Первая – измерение: преобразование пикселей в числовые характеристики физической сцены (где находятся поверхности, насколько они удалены, как движутся). Вторая – понимание: перевод тех же пикселей в естественный язык, описывающий содержание и смысл сцены. Depth Anything и SmolVLM охватывают по одной половине этого разделения.
Depth Anything – это измерительный примитив. На вход подаётся один RGB-кадр, на выходе – значение глубины для каждого пикселя: число с плавающей точкой, показывающее, насколько далеко та или иная точка сцены находится от камеры. Выходной результат плотный (по одному числу на пиксель, а не на обнаруженный объект) и геометрически корректный (числа соответствуют реальной геометрии сцены, а не только относительному порядку). Эти данные напрямую используются в downstream-задачах: планировщик применяет глубину для обхода препятствий, AR-приложение – для наложения виртуальных объектов на реальные, а система видеонаблюдения – для преобразования 2D-рамок в 3D-позиции.
SmolVLM – это понимающий примитив. На вход подаётся один или несколько кадров и текстовый запрос на естественном языке, на выходе – текст. Он может быть описанием содержимого кадра, ответом на вопрос о кадре, структурированным извлечением фактов или классификацией. Модель достаточно компактна, чтобы работать локально, но использует тот же интерфейс, что и GPT-4o: вы передаёте пиксели и текстовый запрос – получаете текстовый ответ.
Почти никогда не выбирают одно и игнорируют другое. Интересные продукты на устройстве в 2026 году используют оба подхода: глубину для геометрии, небольшой VLM для семантики и тонкий слой оркестрации сверху, превращающий объединённый сигнал в поведение продукта. Остальная часть статьи подробно разбирает обе модели и показывает, как их комбинировать.
Depth Anything V2 – Что Это И Как Работает
Depth Anything V2 был выпущен оригинальной командой Depth Anything в 2024 году и принят на NeurIPS 2024. Это фундаментальная модель для монокулярной оценки глубины – одна нейросеть, которая по любому RGB-изображению с любой камеры в любой сцене выдаёт плотную карту глубины. «Anything» в названии – отсылка к широте входных данных: помещения, улица, дневной свет, low light, реальные фото, картины, сгенерированные изображения. Методология обучения – то, что делает эту заявку обоснованной.
Архитектура – Vision Transformer-энкодер и Dense Prediction Transformer-декодер. Энкодер использует DINOv2 – self-supervised foundation-модель от Meta, которая извлекает универсальные признаки изображения. Декодер DPT объединяет признаки из нескольких трансформерных слоёв и апсэмплит их до полноразмерной карты глубины. Входные изображения масштабируются до 384 пикселей по короткой стороне и центрально обрезаются до размера 384×384 перед подачей в модель.
Команда выпустила четыре размера: ViT-Small (24,8 миллиона параметров), ViT-Base (97,5 миллиона), ViT-Large (335,3 миллиона) и ViT-Giant (1,3 миллиарда). На потребительских GPU модели ViT-Small и ViT-Base работают со скоростью более 50 кадров в секунду; ViT-Large – оптимальный баланс точности и эффективности для оффлайн-применений; ViT-Giant – наиболее точная teacher-модель, на основе которой обучаются младшие student-модели. Inference примерно в десять раз быстрее предыдущей diffusion-основанной модели для оценки глубины (Marigold) при сопоставимой точности.
Тренировочный трюк, который V2 добавил к V1, – трёхступенчатый конвейер «учитель – ученик» (teacher-student). На первом этапе обучается самая большая модель (ViT-Гигант) исключительно на синтетических изображениях с идеальной глубиной (ground-truth depth), поскольку реальные датчики глубины дают зашумлённые метки, а синтетика – нет. На втором этапе модель ViT-Гигант в роли учителя генерирует псевдометки для 62 миллионов неразмеченных реальных изображений. На третьем этапе младшие модели-студенты обучаются на этих псевдометках. Результат: V2 обеспечивает значительно более точную и устойчивую оценку глубины по сравнению с V1, особенно на прозрачных и зеркальных поверхностях, где старые сенсорные метки были систематически ошибочными.
Есть важная деталь с лицензированием. Чекпоинт ViT-Small выпущен под Apache 2.0 – это разрешает коммерческое использование. Чекпоинты Base, Large и Giant – под CC-BY-NC-4.0, что запрещает коммерческое применение. Если вы разрабатываете коммерческий продукт, в готовом решении можно использовать только версию Small. Чекпоинты Base, Large и Giant подходят для исследований, оценки и дообучения собственной модели на коммерчески лицензированных данных, но встроить их в платный продукт нельзя. Это самая частая compliance-ловушка: команда прототипирует на Large (из-за его большей точности), показывает демо стейкхолдерам, а перед релизом выясняет, что всё придётся переписывать под Small.
Depth Anything V2 по умолчанию выдаёт относительную глубину – значения, сохраняющие порядок и относительный масштаб, но не выраженные в метрических единицах. Для задач, где требуются реальные расстояния в метрах (например, дрон должен определить, находится ли препятствие на расстоянии двух или двадцати метров), команда предлагает метрические версии модели, дообученные на двух датасетах: Hypersim – для помещений (максимальная глубина 20 метров) и Virtual KITTI 2 – для уличных сцен (максимальная глубина 80 метров). Выбирайте ту версию, которая соответствует условиям эксплуатации: использование outdoor-модели в помещении приведёт к значениям, выходящим за разумные пределы.
Для видео у ванильной версии Depth Anything V2 есть известное ограничение: при обработке кадр за кадром возникает временное мерцание – соседние кадры получают значения глубины, которые «дрожат» даже на статичной сцене. Две модели, выпущенные в 2025 году, решают эту проблему. Video Depth Anything (CVPR 2025 Highlight) заменяет пер-кадровый DPT-головной блок на spatial-temporal-головной блок, который ограничивает изменения градиента глубины между кадрами и обеспечивает согласованную обработку видео произвольной длины. FlashDepth (2025) сохраняет пер-кадровый backbone, но добавляет рекуррентную нейросеть, выравнивающую depth-особенности между кадрами, что позволяет использовать модель для реального времени при стриминге в разрешении 2K. Обе модели являются расширениями V2; выбирайте Video Depth Anything, если нужно обработать сохранённый клип с стабильной глубиной, и FlashDepth – если требуется стриминг в реальном времени с минимальной задержкой.
SmolVLM2 – что это и как работает
SmolVLM – семейство малых open-source мультимодальных моделей от Hugging Face, vision-language-моделей, достаточно маленьких, чтобы реально работать на устройстве, которое пользователь держит в руке. Семейство стартовало в конце 2024 года с оригинального SmolVLM (2,2B параметров); в начале 2025 года команда выпустила меньшие варианты 256M и 500M под брендом SmolVLM; позже в 2025 году вышел SmolVLM2, расширивший все три размера для работы с видео, а не только статичными изображениями. Модель 2,2B – самая сильная; 500M – sweet spot для on-device; 256M – для браузера и сильно ограниченного edge.
Архитектура состоит из трёх частей: SigLIP vision-энкодер, шаг сжатия pixel-shuffle и Llama-3 language-декодер.
Vision-энкодер – SigLIP-B/16 (93 миллиона параметров, патчи 16×16) для моделей 256M и 500M и SigLIP-SO400M (428 миллионов параметров, патчи 14×14) для модели 2,2B. Энкодер преобразует каждое изображение в сетку визуальных feature-векторов – это небольшие плитки, каждая из которых суммирует определённый регион изображения. Заметное архитектурное решение: vision-башня значительно меньше по сравнению с language-башней. Большие vision-энкодеры быстро перестают повышать точность, если language-модель остаётся небольшой.
Шаг pixel-shuffle – ключевой трюк, делающий всю систему эффективной. Наивный подход подаёт каждый визуальный feature-вектор в языковую модель как отдельный токен, что приводит к взрыву числа токенов и, соответственно, к росту стоимости вычисления attention: изображение из 256 плиток превращается в 256 токенов плюс токены промпта и ответа. SmolVLM применяет 2 на 2 pixel-shuffle, который переупорядочивает каждый блок из 2×2 feature-векторов в один вектор с вчетверо большим числом каналов. Количество токенов уменьшается в четыре раза, а стоимость attention – в шестнадцать, поскольку она растёт квадратично с числом токенов. Именно это позволяет запустить 500M-модель с визуальным входом на смартфоне.
Language-декодер – семейство малых языковых моделей SmolLM-2 на архитектуре Llama-3. Это та же архитектура, что и у любой небольшой открытой языковой модели: трансформер, RMSNorm, SwiGLU, ротарные позиционные эмбеддинги – просто с небольшим числом параметров (135 млн для SmolVLM2-256M, 360 млн для 500M, 1,7 млрд для 2,2B). Визуальные и текстовые токены подаются перемешанными; модель генерирует текст авторегрессивно.
Для видео SmolVLM2 сэмплит пятьдесят кадров на клип (настраиваемо) и обрабатывает их как упорядоченную последовательность изображений, добавляя текстовый маркер вида «Here are 50 frames sampled from a video», чтобы модель могла различать «один и тот же объект в разных кадрах» и «разные объекты». Бюджет в 50 кадров позволяет сохранить количество токенов в разумных пределах даже после pixel-shuffle, а бенчмарки на Video-MME (стандартный бенчмарк понимания видео в 2026 году) показывают, что модель 2,2B по производительности сопоставима с гораздо более крупными открытыми моделями, тогда как версии 500M и 256M с большим отрывом опережают все ранее выпущенные video-capable VLM по компактности.
Числа по ресурсам – потому что они определяют, какое железо нужно:
- SmolVLM2-256M помещается в менее чем 1 ГБ видеопамяти GPU. На 14-дюймовом MacBook Pro с чипом M4 Max он работает в браузере через WebGPU и генерирует около 80 decode-токенов в секунду. Это вариант «работает во вкладке браузера».
- SmolVLM2-500M – оптимальный выбор для iPhone. Демо-приложение Hugging Face использует 500M для анализа видеоклипов целиком на устройстве, без подключения к сети.
- SmolVLM2-2.2B требует около 5,2 ГБ видеопамяти GPU для video-inference. Это самый мощный вариант: используйте его на ноутбуке или Jetson Orin, но не на телефоне.
Все чекпоинты SmolVLM2, датасеты и рецепты обучения выпущены под Apache 2.0. Никаких carve-out, никаких ограничений NC. Их можно использовать в коммерческих продуктах без выплат.
Где какая модель уместна – Decision Frame
Две модели решают разные задачи, и самая частая инженерная ошибка – выбрать не ту. Полезное правило выбора:
Берите Depth Anything, когда нужна глубина на пиксель. Примеры: AR-приложение решает, рисовать ли виртуальный объект перед реальным или за ним; конвейер видеонаблюдения переводит 2D-детекцию в 3D-позицию; робот определяет, стоит ли двигаться; видеоконференц-приложение создаёт размытие фона, учитывающее реальную физическую глубину сцены; видеоредактор извлекает передний план для композитинга. Во всех этих случаях требуется плотная геометрическая информация, которую VLM выдать не может – он оперирует текстом, а не картой глубины.
Берите SmolVLM, когда нужна фраза про кадр. Примеры: модерационный конвейер спрашивает: «Есть ли в этом клипе человек с оружием?»; e-learn-аналитика – «Что студент пишет на доске прямо сейчас?»; surveillance-дашборд – «Опиши, что произошло в этом пятисекундном клипе»; OTT-поиск – «Какой это тип сцены – спорт, драма, новости?». Во всех этих случаях ответ – текст, вопрос зависит от продукта, и не хочется обучать отдельный классификатор под каждый запрос.
Берите оба, когда продуктовый вопрос – «что это и где это в сцене?» Запустите depth-модель и VLM параллельно на одном кадре; объедините их выходы в orchestration-слое. VLM определяет, что интересно; depth-модель – насколько далеко и какого размера объект.
Частая ловушка: команды задают VLM геометрический вопрос – «насколько далеко человек в этом кадре?» – и удивляются, когда ответ оказывается неверным. SmolVLM, как и любой малый VLM, ненадёжен для абсолютных геометрических вопросов. Он может случайно оказаться прав в одном кадре и ошибиться на порядок в следующем. Модель не обучалась на метрических depth-метках – она обучалась на подписях и диалогах. Нужны числа – берите модель, выдающую числа. Нужны слова – берите модель, выдающую слова.
| Тип вопроса | Правильный примитив | Выход | Почему |
|---|---|---|---|
| Как далеко каждый пиксель от камеры? | Depth Anything V2 (metric-вариант) | Плотная пер-пиксельная карта глубины в метрах | Геометрическая задача; специализированная модель |
| Есть ли в кадре человек? | Малый детектор (YOLO-N) или SmolVLM | Bounding box или текст | Детектор быстрее; VLM гибче |
| Что делает человек? | SmolVLM | Естественно-языковое описание | Открытый вопрос; нельзя заранее задать список классов |
| Движется ли камера? | Optical flow (RAFT, Lucas-Kanade) | Пер-пиксельное motion field | Геометрическая задача |
| Нужно ли алертить оператора? | SmolVLM с structured-output-prompt | "alert: true/false, reason: ..." | Композирует другие сигналы в решение |
| Где именно движущийся объект в 3D? | Depth + детектор + простая геометрия | (x, y, z) на объект | Комбинация геометрии и идентичности |
Последняя строка – канонический on-device-конвейер компьютерного зрения. Детектор находит объекты, оценка глубины определяет их 3D-позицию, а VLM (по желанию) добавляет семантический контекст. Каждый компонент выполняет задачу, в которой он наиболее эффективен.
Конкретный стек: Depth + SmolVLM вместе
Вот рабочий пример конвейера, способного производить реальный продукт. Представьте домашнюю security-камеру. Продуктовый вопрос: «предупреди меня, когда кто-то заходит ночью на кухню с чем-то похожим на инструмент». Наивный подход – отправлять каждый кадр в GPT-4o через один большой API-вызов и платить за каждый вызов. Альтернатива – on-device-решение, использующее три примитива последовательно, каждый из которых настроен под свою задачу.
Стадия один – motion gate. Дешёвый классический детектор (background subtraction или крошечный YOLO-N) работает на 30 FPS и определяет, изменился ли хоть один пиксель настолько, чтобы оправдать запуск тяжёлых моделей. Затраты: несколько миллисекунд на кадр на NPU камеры. Результат: 99% входных кадров отфильтровываются ещё до запуска любой нейросети.
Стадия два – depth + detection на оставшихся кадрах. На каждом сохранённом кадре параллельно запускаются малый person detector и Depth Anything V2 Small. Детектор выдаёт bounding box, а depth-модель – карту глубины. Объединяя результаты, читаем значение глубины в центре bounding box – это даёт расстояние до человека. Если это расстояние помещает человека в геометрический объём, заранее размеченный как «кухня», переходим к стадии три. Иначе – дроп. Стоимость на Jetson Orin Nano: около 50 мс на кадр суммарно.
Стадия три – семантическая проверка SmolVLM2. На редких кадрах, прошедших вторую стадию (на кухне действительно кто-то присутствует), сэмплируем пятикадровый клип и передаём его модели SmolVLM2-500M с промптом: «Похоже ли, что человек в этом видеоклипе держит какой-либо инструмент или приспособление? Ответь "yes" или "no" с одним предложением обоснования». Модель работает локально на том же Jetson и возвращает структурированный ответ менее чем за секунду. Если ответ – «yes», срабатывает алерт.
Весь конвейер работает на 30 FPS на edge-устройстве стоимостью менее 500 долларов, не требует затрат на инференс, поскольку не использует сетевые вызовы, и уважает приватность домохозяйства – видео ни разу не попадает на облачный сервер. Тот же подход применим в телемедицине («пациент всё ещё в кадре и в сознании?»), в e-learning («студент смотрит на экран?») и в OTT-модерации («безопасно ли воспроизводить этот клип ребёнку?»). Архитектура остаётся неизменной; меняются лишь промпты и геометрические пороги.
Режимы отказа в production и инженерные исправления
Три режима отказа регулярно возникают в реальных деплоях. Учитывайте их при планировании с самого начала.
Отказ 1 – мерцание в depth-треке. Запуск Depth Anything V2 кадр-за-кадром на видео даёт depth-значения, дрожащие даже на статичной сцене. Для продуктов, где downstream-потребитель просто смотрит на одно число на кадр (одна проверка дистанции, грубый occlusion-тест), дрожь терпимая. Для продуктов, рисующих depth-карту прямо пользователю (любое AR-приложение; любая визуализация), дрожь выглядит ужасно. Фикс: переключиться на Video Depth Anything (CVPR 2025) для сохранённого видео или FlashDepth (2025) для live-стрима. Обе – расширения V2 с модулем temporal consistency. Ожидайте примерно в два-три раза более высокую пер-кадровую compute-стоимость по сравнению с ванильным V2; взамен – стабильный выход.
Отказ 2 – неверный metric-вариант. Метрические depth-варианты дообучены либо на Hypersim (внутри помещений, 20 м), либо на VKITTI (на улице, 80 м). Использование outdoor-варианта на indoor-съёмке приводит к depth-значениям, выходящим за разумные пределы; применение indoor-варианта на outdoor-съёмке «зажимает» всё, что дальше 20 м, в одно и то же значение. Фикс: выбирайте вариант, соответствующий сцене, на этапе конфигурации, а не обучения. Surveillance-камера, которая иногда смотрит внутрь, а иногда наружу, должна поддерживать оба варианта и выбирать между ними во время выполнения на основе однократной классификации при настройке.
Отказ 3 – галлюцинации SmolVLM на out-of-distribution-входах. SmolVLM2 обучен на большом объёме данных, но его версии 500M и 256M всё ещё остаются относительно небольшими моделями. Когда им задают вопросы о контенте, которого они не видели во время обучения, ответы могут быть уверенно ошибочными. Фикс: ограничьте вывод с помощью structured-промпта и guard-проверки. Задавайте вопросы с ответом «да/нет», а не открытые. Каждый вызов SmolVLM сопровождайте вторым проходом – задавайте тот же вопрос на другом случайно выбранном кадре и действуйте только при совпадении ответов. Для высоконагруженных решений направляйте «выжившие» случаи в более крупную модель на сервере – локальная VLM на устройстве служит дешёвым фильтром, а не окончательным арбитром.
Реальность железа и развёртывания
Где какая модель реально работает в production? Краткий справочник.
| Железо | Depth Anything V2 Small | SmolVLM2-256M | SmolVLM2-500M | SmolVLM2-2.2B |
|---|---|---|---|---|
| Современный телефон (iPhone 15 Pro / Pixel 9) | 30+ FPS через Core ML или NNAPI | Да, демо есть | Да, официальный HF-demo | Маржинально – возможно, но греется |
| Браузер через WebGPU | 10–15 FPS на MacBook | 80 decode-токенов/с на M4 Max | Да, медленно | Нет |
| Jetson Orin Nano | 50+ FPS через TensorRT | Да, комфортно | Да, комфортно | Да |
| Jetson Orin AGX | 100+ FPS через TensorRT | Тривиально | Тривиально | Да, с запасом по бюджету |
| Consumer GPU (RTX 4070) | 100+ FPS | Тривиально | Тривиально | Тривиально |
Паттерн конвертации хорошо отработан: сначала экспортируете чекпоинт PyTorch в ONNX, а затем конвертируете его в TensorRT на NVIDIA, Core ML на Apple или NNAPI / Qualcomm AI Hub на Android. Квантизация в FP16 или INT8 позволяет сократить объём памяти вдвое–вчетверо и примерно удвоить пропускную способность на совместимом железе. Что касается Depth Anything V2: версия Small экспортируется в ONNX без проблем; для больших вариантов потребуются несколько operator-обходных решений при экспорте, однако в сообществе уже есть рабочие скрипты.
Практическое правило 2026 года для выбора compute: устройство тянет конвейер, если может держать самый большой weight-файл, который вам нужен, в RAM в формате FP16 и при этом оставлять память под ОС, video buffer и другие приложения. Для Depth Anything V2 Small это около 50 МБ весов; для SmolVLM2-500M – около 1 ГБ; практический минимум для комбинированного использования – устройство с 4 ГБ ОЗУ и аппаратным ускорителем ИИ. Всё, начиная с iPhone 13 и среднего Android современных поколений, проходит по этому порогу.
Где Тут Фора Софт
Мы поставляем on-device CV в системах видеонаблюдения, e-learning, телемедицины, OTT-платформах и конференц-решениях с тех пор, как появился оригинальный MobileNet. Переход на Depth Anything и малые VLM изменил, какие задачи можно реализовать в рамках тех или иных бюджетов. Три паттерна, которые мы применяли в клиентских проектах 2026 года: – depth-aware размытие и замена фона, учитывающие реальную геометрию сцены, а не плоскую 2D-сегментацию, которую до сих пор используют устаревшие видеоконференц-приложения; – on-device редактура с учётом приватности в записях e-learning, где малая VLM помечает кадры с лицами студентов или рукописным контентом, а обработка происходит локально, до попадания данных в нашу инфраструктуру; – edge-конвейеры видеонаблюдения для розницы и промышленных объектов, где камера выполняет основную обработку, а в облако передаются только алерты.
Если вы планируете реализовать фичу на основе одного из этих паттернов, ответ на вопрос «сделать или купить» в 2026 году, как правило, – «сделать, потому что open-примитивов теперь достаточно».
Ключевые выводы
- Depth Anything V2 Small (24,8M параметров, Apache 2.0) – единственный вариант с коммерческой лицензией; Base/Large/Giant доступны только для некоммерческого использования.
- Чтобы получить стабильную глубину на видео, используйте Video Depth Anything (оффлайн) или FlashDepth (в реальном времени), а не стандартный V2 по кадрам.
- SmolVLM2 – Apache 2.0 на всех размерах (256M, 500M, 2.2B); pixel-shuffle – техника, позволяющая запускать модель 500M даже на телефоне.
- Depth Anything предназначена для измерения (числовые значения на пиксель), SmolVLM – для интерпретации (текст); никогда не запрашивайте у VLM абсолютную геометрию.
- Производственный конвейер на устройстве использует дешёвые модели для фильтрации дорогих: сначала анализ движения, затем глубина и детекция, и только потом VLM – только на тех кадрах, где это действительно нужно.
- Выбирайте метрическую версию (Hypersim для помещений, VKITTI для улицы) в зависимости от среды развёртывания, а не по результатам бенчмарков точности.
Что читать дальше
- Оптические примитивы – RAFT против Lucas-Канаде – это другой геометрический примитив, который работает в связке с глубиной.
- Решение "просто используй VLM" – когда frontier-мультимодальная модель заменяет кастомную компьютерную визуализацию – речь о замене небольшой VLM на frontier-модель.
- Vision Transformer – основы для инженеров video-ИИ – архитектура энкодера, используемая в обеих моделях.
Поговорить с video-инженером · Посмотреть кейсы · Скачать чеклист on-device CV