Fine-tuning видео-VLM на домене – видеонаблюдение, телемедицина, e-learning

Автор: Николай СапуновОбновлено: август 202627 мин чтения
Содержание статьи +

Кратко

Fine-тюнинг (дообучение) – это когда вы берёте уже выбранную открытую vision-language-модель и продолжаете её обучение на собственном размеченном видео, чтобы она заговорила на языке вашего домена: словарём оператора видеонаблюдения, форматом документов клиники, критериями оценки в вашем курсе. Полностью модель почти никогда не переобучают: метод под названием LoRA замораживает оригинал и обучает крошечную надстройку – это снижает требования к памяти GPU с сотен гигабайт до единиц и укладывается в часы, а не в недели. Сложное здесь не сам процесс обучения, а сбор нескольких сотен или тысяч правильных примеров, выделение части из них для проверки, действительно ли модель стала лучше, и проверка, что она не разучилась делать всё остальное. Этот урок показывает владельцу продукта, когда дообучение оправдано, когда дешевле обойтись промптом или поиском, и сколько работа реально стоит в видеонаблюдении, телемедицине и e-learning.

Почему это важно

Вы прочитали урок про открытый фронтир и выбрали открытую модель – Qwen3-VL, InternVL или Pixtral – чтобы запустить её на своём железе. На обычных видео она работает. Но стоит направить её на ваши записи – и она спотыкается: не понимает, что «проход за чужой спиной» – это два человека через одну дверь по одному пропуску, пишет заметки о консультации не в той форме, что требуется в вашей клинике, не различает завершённое лабораторное задание от брошенного. Fine-tuning – это инструмент, который помогает закрыть этот разрыв, и это самый недопонятый этап в разработке видео-ИИ: половина команд использует его там, где хватило бы хорошего промпта, а другая половина избегает его там, где только он и мог бы помочь. Урок написан для продакт-менеджера, основателя или операционного руководителя, которому нужно решить, стоит ли финансировать проект дообучения, и понимать компромиссы достаточно глубоко, чтобы аргументированно оспорить как излишне рьяного, так и излишне осторожного инженера. Предполагается, что вы уже читали урок про открытый фронтир; если слова «веса», «открытая модель» и «GPU» вам незнакомы – сначала ознакомьтесь с ним.

Что такое fine-tuning на самом деле

Начнём со слова – это точная метафора. Радиоприёмник уже собран и в основном работает; настройка – небольшая финальная подкрутка, чтобы чётко ловить одну станцию. Дообучение модели – то же самое: модель уже умеет видеть и писать – это знание пришло из первоначального обучения на миллиардах изображений и слов, – а вы делаете маленькую финальную подкрутку, чтобы она поймала именно ваш домен.

Механическое дообучение – это продолжение обучения модели, но уже на гораздо меньшем, тщательно отобранном наборе примеров, похожих на ту задачу, которая вам действительно нужна. Скачанная модель – это огромная таблица чисел, называемых весами, в которой закодировано всё, чему она научилась. Обучение сдвигает эти числа; дообучение – лишь немного, в сторону ваших примеров. Покажите ей тысячу клипов видеонаблюдения, каждый в паре с тем самым текстом тревоги, которого ждут ваши операторы, – и она постепенно перейдёт от обобщённых описаний к вашим конкретным тревогам.

Вот различие, на котором спотыкаются все. Fine-tuning меняет поведение, словарь и формат вывода модели – как она отвечает. Это плохой способ научить модель новым фактам, которые часто меняются, например, сегодняшнему графику дежурств или политике этой недели. Для таких фактов нужен другой инструмент – поиск (его разбирают в уроке про video RAG), и эту границу мы проводим чётко. Версия в одном предложении: дообучайте, чтобы изменить, как модель говорит; используйте поиск, чтобы изменить, что она знает.

Рисунок 1. Fine-тюнинг – это небольшая финальная подстройка уже работающей модели. Вы не создаёте модель с нуля – вы адаптируете готовую под свой предметный домен.

Решение, которое идёт первым – промпт, поиск или дообучение

Прежде чем потратить хоть копейку на дообучение, нужно исключить два более дешёвых инструмента – они решают большинство задач, а fine-tuning – лишь часть. Дисциплина, которая экономит командам больше всего денег, – пробовать их по порядку: сначала промпт, затем поиск, и только когда оба не справились – браться за дообучение.

Первый инструмент – инженерия промптов: достаточно чётко сформулировать инструкции и привести пару примеров прямо в запросе, без дополнительного обучения. Если модель даёт правильный ответ, когда вы ясно описали задачу и добавили три хороших примера – дело сделано. Это бесплатно, занимает полдня и стоит попробовать в первую очередь. Многие задачи, которые изначально казались требующими дообучения, исчезают, как только кто-то составляет грамотный промпт.

Второй инструмент – retrieval-augmented generation, или RAG: вы храните поисковое хранилище своих документов или прошлых записей, и при поступлении вопроса извлекаете релевантные фрагменты, передавая их модели вместе с самим вопросом. RAG – правильный выбор, когда проблема связана с отсутствующим знанием, которое постоянно меняется: кто из сотрудников сегодня на смене, как выглядит текущая политика эскалации, что произошло на записи прошлого вторника. Поисковое хранилище можно обновить за секунды – достаточно добавить новый документ; переобучить дообученную модель без полного переобучения невозможно. Именно поэтому актуальные факты лучше хранить в RAG, а не полагаться на дообучение.

К fine-tuning вы прибегаете только тогда, когда разрыв – это поведение, которое промпт не исправляет: модели нужен специализированный словарь, которому её не учили, устойчивый формат вывода, который невозможно обеспечить никакими инструкциями, визуальное суждение, принятое в вашем домене и не покрытое общим обучением, либо вы вызываете её так часто, что встроить поведение оказывается дешевле, чем каждый раз отправлять длинный промпт. На практике сильнейшие системы используют все три подхода – дообученную модель, которая следует хорошему промпту и подтягивает актуальные факты из поиска, – и отраслевое сравнение 2026 года показало, что комбинация поиска с дообучением повысила точность более чем на одиннадцать процентных пунктов по сравнению с использованием каждого метода в отдельности.

Рисунок 2. Сначала пробуйте дешёвые инструменты. Fine-tuning – правильный выбор для поведения и формата, а не для фактов, и редко бывает тем, с чего стоит начинать.

Как обучение происходит на самом деле – Full, LoRA и QLoRA

Когда вы решаете дообучать модель, есть три способа это сделать, и выбор в основном зависит от того, сколько памяти GPU вы готовы использовать. Понимание различий позволяет возразить, если инженер называет цифру, которая кажется завышенной.

Первый способ – полное дообучение (full fine-tuning): при нём происходит подстройка каждого из миллиардов параметров модели. Такой подход даёт ей максимальную свободу для изменений, но обходится очень дорого – требуется столько видеопамяти, чтобы вместить саму модель и несколько её рабочих копий во время обучения. У этого метода есть и опасный побочный эффект, о котором мы поговорим ниже: поскольку вы меняете всё, модель может утратить общие навыки.

Второй способ – и тот, что к 2026 году использует почти каждая команда, – LoRA, сокращение от Low-Rank Adaptation. Вместо изменения параметров модели LoRA «замораживает» их все и добавляет рядом небольшой набор новых обучаемых чисел – как тонкую прозрачную плёнку поверх готовой карты. Обучение затрагивает только эту плёнку; сама карта остаётся нетронутой. Эффект колоссальный: авторы LoRA сообщили, что метод сокращает количество обучаемых параметров в десятки тысяч раз и уменьшает требуемую память GPU примерно втрое по сравнению с полным дообучением – при сопоставимом качестве. А поскольку оригинальная модель остаётся замороженной, LoRA и забывает куда меньше.

Третий способ – QLoRA, квантованная LoRA. Она работает так же, как LoRA, но перед обучением сжимает замороженную оригинальную модель до более компактного и менее точного представления – этот процесс называется квантованием. Благодаря этому модель занимает меньше памяти во время обучения. В результате получается самый экономичный вариант: исследователи, предложившие QLoRA, показали, что с его помощью можно дообучить модель на 65 миллиардов параметров на одной потребительской видеокарте – той, что есть у серьёзного энтузиаста, – тогда как без этого потребовался бы целый сервер. Платой за это становится небольшая потеря качества из-за сжатия, которая обычно настолько мала, что ею можно пренебречь.

Разница в объёме памяти не абстрактна – приведём конкретные цифры. Согласно опубликованной таблице требований к «железу» из LLaMA-Factory, популярного открытого набора инструментов для дообучения, для модели с 7 миллиардами параметров:

Полное дообучение (16-бит) : около 120 ГБ памяти GPU
Полное дообучение (8-бит)  : около  60 ГБ
LoRA (16-бит)              : около  16 ГБ
QLoRA (4-бит)              : около   6 ГБ

Прочтите эти четыре числа – и вся экономика становится ясной. Полное дообучение видеомодели среднего размера требует около 120 гигабайт – больше, чем объём самого крупного одиночного GPU, доступного в аренду, так что понадобится несколько чипов. LoRA уменьшает ту же модель примерно до 16 гигабайт – этого вполне хватает для одного массового GPU в дата-центре. QLoRA сжимает её до примерно 6 гигабайт – это помещается даже на топовую видеокарту уровня ноутбука. Это разница между проектом на мульти-GPU-сервере и работой за вечер на одной машине – и именно поэтому фраза «нам нужно дообучение» перестала быть пугающей примерно с 2024 года.

МетодЧто обучаетПамять GPU (модель 7B)Риск забыванияБерите, когда…
Полное дообучениеКаждый вес модели~120 ГБ (16-бит)ВысокийДанных много, а домен очень далёк от общего видео
LoRAМалую обучаемую надстройку; оригинал заморожен~16 ГБНизкийПо умолчанию почти для любого доменного видеопроекта
QLoRALoRA поверх сжатой модели~6 ГБНизкийЖелеза в обрез или модель большая, а GPU один

Цифры памяти – оценки из таблицы железа LLaMA-Factory для модели на 7 миллиардов параметров; они масштабируются примерно пропорционально размеру модели. Рассматривайте их как ориентир, а не точный расчёт – ваш batch size, длина видео и длина последовательности могут их изменить.

Одна оговорка, которая касается именно видеокоманд: при дообучении vision-language-модели иногда хочется подстроить не только текстовую часть, но и ту, что обрабатывает изображения. Несколько инструментов предупреждают: самое сильное сжатие (4 бита) нельзя использовать, если обучается именно «изображательная» часть – придётся выбрать менее агрессивную настройку, а она требует больше памяти. Мелкий технический нюанс, но именно он может превратить оценку в 6 ГБ в реальную потребность в 16 ГБ. Поэтому стоит уточнить у инженера, какие именно части модели будут обучаться.

Часть, которую никто не закладывает в бюджет – сбор датасета

Вот правда, которую скрывают туториалы: обучение – лёгкая, быстрая и дешёвая часть. Настоящие затраты – на данные. Датасет для дообучения на видео – это набор примеров, каждый из которых состоит из фрагмента записи и желаемого результата: правильной тревоги, правильной заметки, правильной метки. Модель учится на примерах, поэтому каждый пример должен быть точным – она добросовестно выучит и ваши ошибки.

Сколько нужно примеров? Меньше, чем боятся. Чтобы обучить устойчивому формату вывода или ограниченному словарю, часто достаточно нескольких сотен тщательно отобранных примеров; для по-настоящему нового визуального суждения обычно требуется несколько тысяч. Больше – не всегда лучше: тысяча чистых, разнообразных и правильно размеченных примеров всегда превосходит десять тысяч небрежно подготовленных. Главное – качество: клипы, охватывающие реальный диапазон ситуаций, метки, согласованные минимум тремя разными людьми, и отсутствие случайных «лазеек», на которых модель может сжульничать (например, если каждый клип с «нарушителем» снят ночью, модель выучит признак «ночь», а не «нарушитель»).

Главное – заранее разделить примеры на две группы. Большая часть, обучающая выборка (training set), – это данные, на которых модель учится. Меньшая, отложенная тестовая выборка (held-out test set) – обычно десять-двадцать процентов, которые ни разу не показываются во время обучения, – служит для проверки: действительно ли дообучение принесло пользу. Без такой выборки вы действуете вслепую: модель может отлично работать на тех примерах, которые запомнила, но проваливаться на новых, а вы об этом даже не узнаете. Именно эта дисциплина – отложить данные и оценивать на них – и отличает команды, выпускающие работающие дообученные модели, от тех, кто выпускает уверенно звучащие, но сломанные.

Пример бюджета на словах ставит точку. Допустим, вы хотите, чтобы система видеонаблюдения генерировала тревоги в нужном вам формате, и решили, что цель – тысяча размеченных клипов.

1 000 клипов на разметку
÷ 20 клипов в час у обученного аннотатора
= 50 часов работы по разметке

Плюс отложенная тестовая выборка: ещё 200 клипов = 10 часов
Плюс один проход ревью на согласованность меток = ~15 часов
≈ 75 человеко-часов до единственного прогона обучения

Сам процесс обучения на одном GPU с LoRA может занять от трёх до шести часов и обойтись в десять–тридцать долларов на вычисления. Семьдесят пять часов ручной разметки – вот что составляет настоящий объём работы. Любой план, в котором данные рассматриваются как сноска, а GPU – как главное событие, переворачивает бюджет с ног на голову.

Катастрофическое забывание – режим отказа, который отслеживают

Есть один режим отказа, специфичный для дообучения, и его стоит уметь назвать – он одновременно частый и незаметный, если не тестировать. У него драматичное имя: катастрофическое забывание (catastrophic forgetting). Это происходит, когда, обучаясь вашему домену, модель незаметно теряет часть общей способности: теперь она пишет идеальные описания тревог видеонаблюдения, но больше не может ответить на простой вопрос о повседневной сцене, потому что обучение так сильно сместило её параметры в сторону ваших примеров, что старые навыки оказались вытеснены.

Причина – слишком агрессивное обучение: слишком много проходов по одному и тому же маленькому датасету (каждый полный проход называют эпохой) или полное дообучение, при котором меняются все параметры сразу. Исследователи показали, что вред может проявиться уже после одной эпохи на маленьком датасете, если обучать слишком большую часть модели. Отчасти именно поэтому LoRA стала выбором по умолчанию: раз она замораживает оригинальную модель и обучает лишь небольшую надстройку, общие навыки остаются нетронутыми, а забывание происходит гораздо мягче.

Защита – снова отложенная тестовая выборка, используемая вторым способом. До дообучения запустите оригинальную модель на наборе общих задач и зафиксируйте оценки. После дообучения пройдитесь по тем же общим задачам снова. Если общие метрики упали, а доменные выросли – вы переобучили модель: уменьшите количество эпох, используйте LoRA вместо полного дообучения или добавьте немного общих примеров обратно в обучающие данные. Ошибка – не заметить это, выпустить модель, которая блестяще работает на демо, но разочаровывает на длинном хвосте реальных входов.

Три домена, три разные задачи

Та же машина выполняет совершенно разные задачи в зависимости от отрасли, и эти различия поучительны, потому что они меняют само определение «хорошего датасета».

В видеонаблюдении дообучение помогает модели освоить ваш словарь объектов и формат оповещений. Общая модель скажет: «два человека проходят через дверь»; дообученная – «ПРОХОД ЗА ЧУЖОЙ СПИНОЙ – два человека, событие одного пропуска, Дверь 14, 02:14», потому что вы показали ей несколько сотен клипов, размеченных именно так. Основная сложность при работе с датасетом – редкость событий: интересные кадры (настоящее проникновение) составляют крошечную долю от всех записей, поэтому их долю намеренно увеличивают, а не подают модели реалистичный поток, на 99,9% состоящий из пустых коридоров. Вторая причина дообучения в сфере наблюдения – резидентность: такие данные, как правило, не могут покидать серверы заказчика, поэтому аренда закрытого API становится невозможной, а дообученная на месте открытая модель – единственный вариант, соответствующий требованиям. Это напрямую связано с дилеммой «строить или покупать», описанной в уроке про открытый фронтир.

В телемедицине цель – не новое видение, а формат и терминология. Клиницисту важно, чтобы вывод модели после консультации автоматически соответствовал нужной структуре записей: жалоба, анамнез, осмотр, план – и был оформлен правильными клиническими терминами, без необходимости каждый раз добавлять инструкции в промпт. Дообучение на нескольких сотнях пар «консультация – заметка» позволяет «вшить» эту структуру в модель.

Работа с датасетом требует соблюдения приватности и точности: каждый обучающий пример – это чувствительные данные пациента, с которыми нужно обращаться в соответствии с правилами охраны медицинской тайны, при необходимости обезличивать и обязательно проверять у клинициста. Ведь уверенно неверная медицинская заметка хуже, чем её полное отсутствие.

Здесь действует та же логика резидентности, что и при наблюдении, – поэтому используется self-hosted открытые модели.

В e-learning дообучение помогает модели развивать визуальное суждение, которого нет у общей модели: действительно ли студент завершил лабораторную работу, показанную на записи экрана, и где он застрял? Общая модель описывает экран; дообученная применяет ваши критерии. Главная сложность с датасетом – субъективность: два проверяющих могут по-разному трактовать, что считать «застрял» – поэтому этап согласования меток особенно важен, а чёткие критерии, сформулированные до начала разметки, – это уже половина успеха.

Инструменты, которые вы услышите в названиях

Вам не нужно ими управлять, но вы услышите их на планёрках, и умение распознать – что перед вами обоснованный план, а что просто размахивание руками – и отличает компетентность. Доминирующие открытые инструменты в 2026 году – LLaMA-Factory (широкий, дружелюбный к новичкам фреймворк с no-code веб-интерфейсом, под лицензией Apache 2.0, «из коробки» поддерживает Qwen3-VL, Qwen2.5-VL, InternVL и LLaVA), ms-swift от сообщества ModelScope (поддерживает более трёхсот мультимодальных моделей, включая дообучение на видео) и Unsloth (специализируется на минимизации потребления памяти и времени обучения). Командам, уже работающим в экосистеме Hugging Face, естественный выбор – её библиотека TRL. Все они поддерживают LoRA, QLoRA и полное дообучение; выбор между ними зависит от предпочтений команды и привычного интерфейса, а не от функциональных возможностей. Если инженер не может чётко сказать, какой из них он выберет и почему, план ещё не готов.

Где здесь Фора Софт

Мы проводим доменное дообучение внутри видеопродуктов, которые разрабатываем, и используем именно ту схему, что описана в этой статье. В системах видеонаблюдения и телемедицины, где записи юридически не могут покидать серверы заказчика, мы дообучаем открытую модель on-premises, чтобы данные ни в коем случае не покидали локальную инфраструктуру. При этом основную часть проекта мы тратим на датасет – разметку, проверку согласованности и формирование отложенной тестовой выборки, – а не на сам процесс обучения. В e-learning и OTT, где функции работают с большим объёмом запросов, мы дообучаем модели, чтобы встроить нужное поведение, а не отправлять длинный промпт при каждом вызове – в масштабах это и быстрее, и дешевле. Главный вывод, который мы делаем, – и он как раз из этого урока: сначала исключать промпты и поиск, по умолчанию использовать LoRA, честно закладывать время на ручную разметку и всегда оценивать модель на данных, которых она не видела, – включая проверку, что она не утратила базовые, общие навыки.

Ключевые выводы

  • Fine-tuning меняет стиль ответов модели – лексику, формат, тон, – но не затрагивает факты, которые она знает.
  • Сначала пробуйте промпт, потом – поиск; дообучайте только тогда, когда поведение невозможно исправить с помощью промпта.
  • LoRA – стандартный выбор: он замораживает исходную модель и обучает небольшую надстройку, экономя память и снижая риск забывания.
  • Настоящая стоимость – в датасете, а не в самом процессе обучения; обязательно закладывайте время на ручную разметку.
  • Тестовую выборку всегда оставляйте в стороне; оценивайте прирост в целевом домене и проверяйте, что общие способности модели не пострадали.
  • Видеонаблюдение, телемедицина и e-learning дообучают модели под разные задачи – и «хорошие данные» в каждом случае свои.

Что читать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.