Содержание статьи +
- Кратко
- Почему это важно
- Что на самом деле значит «открытый фронтир»
- Общий рецепт – почему все эти модели похожи внутри
- Четыре семейства
- Семейства с одного взгляда
- Лицензия – это реальное решение, а не бенчмарк
- Сколько на самом деле стоит запустить её самому
- Частая ошибка – выбор только одного лидерборда
- Где здесь Фора Софт
- Ключевые выводы
- Что читать дальше
Кратко
«Открытый фронтир» – это набор vision- и language-моделей, которые можно бесплатно скачать, запустить на своём оборудовании и адаптировать под свои нужды. Это открытый ответ на закрытые API от Google, OpenAI и Anthropic. Его определяют четыре линейки: LLaVA – академический проект, доказавший, что простая «перемычка» между готовым «читателем изображений» и готовым чат-ботом способна видеть и рассуждать; и три производственные семейства, которые её превзошли – Qwen-VL от Alibaba (теперь Qwen3-VL, сильнейшие открытые веса 2026 года в среднем по всем задачам), InternVL от OpenGVLab (сильнейшая по-настоящему свободно лицензированная альтернатива) и Pixtral от Mistral (сильнейшая маленькая модель). Они различаются по качеству, по тому, насколько хорошо работают именно с видео, и – что для бизнеса важнее всего – по лицензии на программное обеспечение, которая определяет, можно ли законно встроить модель в продукт, который вы продаёте. Эта статья объясняет – для читателя без подготовки в машинном обучении – что собой представляет каждое семейство, как читать таблицы бенчмарков и не поддаться обману, и когда запуск открытой модели у себя выгоднее, чем аренда закрытой.
Почему это важно
Если вашему продукту нужно понимать видео – прочитать этикетку в потоке со склада, сделать конспект телемедицинского приёма, модерировать пользовательские загрузки, отметить событие в потоке с камеры – у вас два пути: арендовать закрытую модель через API или запустить открытую модель на своих машинах. Урок о закрытом фронтире разобрал первый путь. Этот урок разбирает второй и существует потому, что открытый путь побеждает начисто в трёх ситуациях, которые встречаются постоянно: когда данные легально не могут покинуть ваши серверы, когда объёмную функцию дешевле хостить, чем арендовать, и когда нужно дообучить модель на своём домене. Читатель, для которого это написано, – продакт-менеджер, основатель или операционный руководитель, которому предстоит сидеть на встрече «строить или покупать» и понимать, почему инженеры твердят «Qwen3-VL для общих задач, InternVL если нервничают юристы, Pixtral когда должно влезть на одну видеокарту». Урок предполагает, что вы прочитали введение в видео-VLM; если слова «токен», «сэмплирование кадров» и «контекстное окно» вам новы, начните с него.
Что на самом деле значит «открытый фронтир»
Начнём с двух слов – каждое несёт вес. Открытый здесь – сокращение от open-weights: обученная модель (огромная таблица чисел, называемых весами, в которой хранится всё, чему модель научилась) опубликована как файл, который можно скачать, запустить на своём компьютере, изучить и изменить. Противоположность – закрытая модель, чьи веса доступны только на серверах разработчика, а вы пользуетесь ею через интернет. Фронтир – это самые передовые модели своего класса, с которыми сравнивают все остальные. Значит, открытый фронтир – это самые мощные модели, которые можно легально скачать и использовать.
Вот аналогия, которую стоит держать в голове. Закрытая модель – это как нанять блестящего аналитика через агентство: вы отправляете материал наружу, получаете ответ, платите за страницу и никогда не видите его рабочего стола. Открытая модель – это нанять аналитика в штат: вы платите один раз, он работает целиком внутри вашего здания, ваш материал нигде не покидает компанию, и его можно обучить по вашему регламенту – но при этом вы обязаны обеспечить ему стол, компьютер и зарплату, независимо от того, занят он или простаивает. Этот «стол и зарплата» – и есть подвох открытых моделей: веса бесплатны, а железо, чтобы их запускать, – нет, и кто-то в вашей команде должен поддерживать всё в рабочем состоянии. Остальная статья – о том, когда нанять в штат оправдано и какого кандидата выбрать.
Общий рецепт – почему все эти модели похожи внутри
Прежде чем разбирать четыре семейства, освойте общую для них архитектуру: как только вы её поймёте, поле перестаёт быть стеной из названий. Каждая модель состоит из трёх частей, соединённых воедино, – и именно такой подход впервые продемонстрировала модель LLaVA в 2023 году.
Первая часть – читатель изображений (технически визуальный энкодер) – это компонент, уже обученный превращать картинку в список чисел, описывающих, что на ней изображено. Большинство таких моделей используют читатель из системы под названием CLIP, которая уже научилась сопоставлять изображения их текстовым описаниям. Вторая часть – языковая модель, такой же тип системы, что и в текстовом чат-боте, уже обученный читать и писать гладкую прозу. А третья часть, находящаяся между ними, – вот где и заключается хитрость: небольшая перемычка (инженеры называют её проектор или адаптер), которая переводит числа от читателя изображений в формат, понятный языковой модели, чтобы чат-бот мог «прочитать» картинку как текст.
Аналогия: читатель изображений – глаз, языковая модель – красноречивый собеседник, который никогда не видел, а перемычка – зрительный нерв, передающий увиденное глазом в язык, которым владеет собеседник. Озарение LLaVA в 2023 году заключалось в том, что не нужно создавать все три компонента с нуля. Возьмите готовый «глаз» (CLIP), готового собеседника (открытый чат-бот по имени Vicuna) и обучите лишь недорогой «зрительный нерв» между ними, а также проведите лёгкую дообработку собеседника. Это сделало обучение полноценной vision-language-модели возможным при скромном бюджете и задало шаблон, который каждое последующее поколение моделей лишь уточняло.
Четыре семейства
LLaVA – академический первопроходец, задавший шаблон
LLaVA расшифровывается как Large Language and Vision Assistant. Модель появилась в академических лабораториях в 2023 году и важна не столько тем, что её можно развернуть сегодня, сколько тем, что она доказала. Её метод – визуальная инструкция-настройка (visual instruction tuning) – впервые использовал текстовый GPT-4 для генерации обучающих диалогов о изображениях, а затем этими диалогами обучил связку «перемычка плюс чат-бот» отвечать на вопросы по картинкам. По исходной статье подход был нарочито экономным: соединить замороженный CLIP ViT-L/14 с замороженной языковой моделью Vicuna, обучить перемычку на наборе из 558 000 примеров выравнивания, а затем дообучить на примерно 150 000 сгенерированных GPT-4 инструкций. Этот двухэтапный подход сегодня стал стандартным шаблоном для всей области.
Линейка росла – LLaVA-1.5, LLaVA-NeXT (он же LLaVA-1.6), а затем LLaVA-OneVision, которая добавила понимание видео за счёт обработки клипа как последовательности кадров. На 2026 год её статус двойственный. Как производственная модель основная LLaVA уступила позиции: её показатели теперь ниже, чем у Qwen-VL и InternVL. Однако как открытый фреймворк линейка остаётся актуальной и продолжает устанавливать рекорды по степени открытости – релиз LLaVA-OneVision-1.5 (2025) опубликовал все обучающие данные и код, а также сообщил, что модель на 8 миллиардов параметров превосходит сопоставимую Qwen2.5-VL-7B по 18 из 27 бенчмарков. Поэтому классическую LLaVA сегодня редко используют в продуктах, но её статьи обязательно прочитают, чтобы понять контекст, а фреймворк OneVision – если в исследовании важна полная воспроизводимость. LLaVA – ключевой запрос, который ищут большинство; ответ на вопрос «стоит ли использовать LLaVA в продакшене в 2026?» обычно звучит так: «нет, лучше взять одну из следующих трёх, но поблагодарите LLaVA за рецепт, который они все используют».
Qwen-VL – всесторонний лидер в 2026 году
Qwen-VL – линейка vision-language моделей от команды Qwen в Alibaba. В 2026 году это будет открытая модель, которую большинству команд стоит попробовать в первую очередь. Текущее поколение – Qwen3-VL, выпущенное в конце 2025 года. Модель доступна в широком диапазоне размеров, чтобы можно было подобрать её под оборудование: компактные плотные версии на 2, 4, 8 и 32 миллиарда параметров – для работы на одной видеокарте и на edge-устройствах, а также крупные модели mixture-of-experts (архитектура, в которой при обработке каждого входа активируется лишь часть параметров модели, обеспечивая качество большой модели по стоимости меньшей). Флагманская версия насчитывает до 235 миллиардов параметров.
Две особенности делают Qwen-VL особенно сильным на видео. Во-первых – нативная поддержка очень длинного контекста: 256 000 токенов «из коробки», с возможностью расширения до миллиона. По расчётам, основанным на введении в VLM, этого достаточно, чтобы хранить и индексировать многочасовое видео с точностью до секунды. Во-вторых – предыдущее поколение, Qwen2.5-VL, ввело динамическое сэмплирование частоты кадров и абсолютное кодирование времени: модель не только помнит, какие кадры она видела, но и когда каждый из них произошёл в реальном времени. Это позволяет отвечать на вопросы вроде «что было на 4-й минуте 12-й секунде?», а не только «что происходило в видео?». Такая временная точность – именно то, что требуется для видеопродуктов. Модель Qwen2.5-VL с 72 миллиардами параметров показала конкурентоспособные результаты по сравнению с закрытыми моделями вроде GPT-4o, и по состоянию на май 2026 года линейка Qwen демонстрирует лучшие показатели среди открытых моделей по среднему уровню выполнения задач.
Есть ещё одна причина, по которой инженеры выбирают Qwen в первую очередь – и она не техническая: лицензия. Qwen3-VL выпущен под Apache 2.0 – открытой лицензией без ограничений на коммерческое использование в любом масштабе. Почему это важно – объясню ниже; часто это становится решающим фактором.
InternVL – самая сильная свободно лицензированная альтернатива
InternVL разработан в OpenGVLab (Шанхайская лаборатория ИИ и партнёры) и является ближайшим открытым конкурентом Qwen-VL. Текущее поколение, InternVL3, выделяется новым подходом к обучению, который звучит академично, но имеет важные практические последствия: нативное мультимодальное предобучение. Ранее, включая модели вроде LLaVA, сначала обучали языковую модель только на текстовых данных, а затем добавляли способность «видеть» на отдельном этапе. В отличие от этого, InternVL3 обучает язык и восприятие изображений одновременно с самого начала – за один проход предобучения. Как сообщают разработчики, это даёт преимущество: модель демонстрирует более высокое качество и согласованность в мультимодальном рассуждении, поскольку ей не нужно «подключать» зрение задним числом.
В цифрах крупнейшая модель InternVL3 (78 миллиардов параметров) набирает около 72 процентов на MMMU – сложном бенчмарке, включающем вопросы уровня колледжа, сочетающие изображения и текст, – что выводит её на первое место среди открытых моделей и делает близкой по результатам к закрытым. Меньшие версии модели сопоставимы с Qwen-VL по классу. Для видео InternVL использует тот же подход «кадры как токены», что и другие модели, и поддерживает расширенный мультимодальный контекст.
Отличительная причина выбрать InternVL – снова лицензия: модель выпущена под свободными условиями (вроде MIT), которые некоторые юридические команды предпочитают даже Apache 2.0 из-за краткости и отсутствия патентных или атрибуционных сложностей. Когда юристы компании стремятся к максимально чистой лицензии, а InternVL соответствует требованиям по качеству – это становится очевидным выбором.
Pixtral – самая мощная маленькая модель
Pixtral – заявка от Mistral, и её главная заслуга в том, что она превосходит ожидания для своей весовой категории. Pixtral 12B объединяет компактный визуальный анализатор на 400 миллионов параметров с языковой моделью на 12 миллиардов – достаточно небольшой, чтобы работать на одной массовой видеокарте, – и при выходе превзошла другие открытые модели своего класса по выполнению инструкций. Её визуальный модуль использует технику RoPE-2D, позволяющую обрабатывать изображения в их оригинальном разрешении и пропорциях, а не преобразовывать каждое в фиксированный квадрат, что особенно полезно для документов, диаграмм и широких кадров видео. Pixtral способна обрабатывать любое количество изображений в контексте до 128 000 токенов и распространяется под лицензией Apache 2.0.
Pixtral – модель, которую выбирают, когда ограничение – железо, а не вычислительная мощность. Если задача должна работать на одной скромной видеокарте – на edge-устройстве, в чувствительной к стоимости пакетной задаче или встроенной рядом с камерой – модель на 12 миллиардов параметров, которая справляется отлично, стоит дороже, чем флагман на 235 миллиардов, которого вы не можете себе позволить держать постоянно запущенным. Это выбор «влезает на одну видеокарту и при этом работает».
Семейства с одного взгляда
Таблица ниже – ориентировочный снимок на 2026 год, а не контракт. Модели с открытыми весами выпускают новые версии каждые несколько месяцев, и показатели бенчмарков постоянно меняются вместе с ними. Относитесь к баллам как к «порядку величины», а не как к точным данным для ТЗ.
| Семейство | Происхождение | Лучшее поколение 2026 | Размеры | Лицензия | Берите, когда… |
|---|---|---|---|---|---|
| LLaVA | Академия (UW-Madison и др.) | LLaVA-OneVision-1.5 | ~4B, 8B | Apache 2.0, полностью открытые данные | Нужен воспроизводимый исследовательский эталон, а не продакшен |
| Qwen-VL | Alibaba | Qwen3-VL | 2B–32B плотные, до 235B MoE | Apache 2.0 | Нужна лучшая всесторонняя открытая модель – безопасный выбор по умолчанию |
| InternVL | OpenGVLab / Shanghai AI Lab | InternVL3 | 1B–78B | типа MIT | Нужно топ-качество под максимально чистой лицензией |
| Pixtral | Mistral | Pixtral 12B | 12B (и вариант покрупнее) | Apache 2.0 | Функция должна влезть на одну скромную видеокарту |
Поколения и размеры – снимок 2026 года, обновляющийся каждые несколько месяцев. Все четыре доступны под дружественными бизнесу лицензиями – вот главный заголовок: открытый фронтир в 2026 году действительно пригоден для коммерческих продуктов.
Лицензия – это реальное решение, а не бенчмарк
Вот правило, которое удивляет большинство команд: для бизнеса, выпускающего продукт, лицензия на ПО обычно важнее пары баллов в бенчмарке. Лицензия – это юридический документ, определяющий, что вы можете делать со скачанными весами: можно ли использовать их в коммерческих целях, в каком масштабе и при каких условиях. Выберите модель, набравшую на два балла больше, но с лицензией, которую ваши юристы отклонят, – и вы фактически ничего не выбрали.
На открытом фронтире встречаются три основные формы лицензий, и важно уметь их различать. Apache 2.0 (Qwen-VL, Pixtral) и MIT (InternVL) – самые дружелюбные: они позволяют использовать, модифицировать и распространять модель в коммерческих целях в любом масштабе – на собственных серверах или в составе продаваемого продукта, без ограничений по объёму и без необходимости запрашивать разрешение. Третья форма – community-лицензия, применяемая некоторыми другими популярными открытыми моделями (в частности, семейством Llama от Meta): коммерческое использование разрешено, но с условиями – например, с оговоркой, срабатывающей только при гипермасштабе и ограничивающей крупнейшие компании (с сотнями миллионов пользователей в месяц), а также с требованием атрибуции. Для практически любой компании эта оговорка никогда не применяется, однако такая лицензия формально считается source-available, а не open-source, и некоторые отделы закупок принципиально отказываются от работы с такими моделями.
Практический вывод прост. Все четыре семейства моделей в этом уроке распространяются под по-настоящему свободными лицензиями – Apache 2.0 или MIT, – именно поэтому они входят в рекомендованный открытый фронтир: вы можете использовать их в продукте, который продаёте, без необходимости консультироваться с юристом. Когда модель за пределами этого набора предлагает более высокий балл, изучайте её лицензию до того, как смотреть бенчмарк. Распространённая и дорогостоящая ошибка – месяцами работать над прототипом на модели, чья лицензия запрещает то развёртывание, которое вы изначально планировали.
Сколько на самом деле стоит запустить её самому
Веса бесплатны, а железо – нет. Реальная стоимость открытой модели – это стоимость видеокарты (GPU) (специализированного чипа, на котором она работает) плюс труд инженеров по её эксплуатации. Пройдёмся по грубому примеру, потому что арифметика – это суть выбора «строить или покупать».
Допустим, вы арендуете одну облачную видеокарту, способную обслуживать VLM среднего размера, по примерной цене 2026 года – около 2,00 $ в час. Запустим её круглосуточно на месяц:
2,00 $/час × 24 часа × 30 дней = 1 440 $ в месяц, фиксированоЭти 1 440 долларов покупают машину, которая работает, независимо от того, занята она или простаивает – это и есть «стол и зарплата» из приведённой аналогии. Теперь сравним с арендой закрытого API. Если закрытая модель берёт примерно 0,05 доллара за анализ одного короткого видео (цифра, приведённая в уроке о закрытом фронтире), то точка безубыточности:
1 440 $ ÷ 0,05 $ за видео = 28 800 видео в месяцНиже 29 000 видео в месяц закрытый API выгоднее, потому что вы платите только за фактическое использование. Выше этой отметки выигрывает собственная видеокарта – её стоимость фиксирована, в то время как счёт за API растёт пропорционально объёму. Одна видеокарта обычно обрабатывает значительно больше 29 000 коротких видео в месяц, поэтому при действительно больших объёмах преимущество переходит на сторону собственного хостинга – и чем больше нагрузка, тем заметнее разрыв. Отсюда и говорят, что «в масштабе» выигрывает собственный путь: фиксированные затраты оправданы, только когда работы достаточно, чтобы держать машину загруженной. Та же арифметика, применённая к вашей реальной стоимости GPU и реальной цене API за видео, – основа любого честного решения «строить или покупать». Именно для таких расчётов и создан инструмент вроде калькулятора стоимости из урока о модели затрат.
Две стоимости, которые арифметика выше скрывает и о которых команды часто забывают. Первая – загрузка: если видеокарта простаивает 90 процентов времени, вы платите 1 440 \$ за работу на 144 \$, и точка безубыточности сильно смещается в вашу сторону – собственный хостинг окупается только при высокой загрузке. Вторая – эксплуатация: кто-то должен развернуть модель, поддерживать сервер в актуальном состоянии, следить за его работой и перезапускать в три часа ночи, когда он упадёт. Фреймворки вроде vLLM значительно упрощают эти задачи по сравнению с прошлыми временами, но «бесплатные веса» никогда не означают «бесплатное развертывание». Закладывайте в бюджет людей, а не только чипы.
Частая ошибка – выбор только одного лидерборда
Чаще всего мы видим ошибку выбора модели по одному числу бенчмарка – обычно по той, что возглавила график, попавший в соцсети на этой неделе. Три вещи делают такой подход обманчивым. Во-первых, основные бенчмарки (MMMU, OCRBench и подобные) тестируют изображения; модель может лидировать в них, но при этом плохо работать с видео, где важны временные бенчмарки вроде Video-MME, которых, скорее всего, нет на заскриненном графике. Если ваш продукт связан с видео – ориентируйтесь на видео-бенчмарки, а не на тесты по изображениям.
Вторая – разница в один-два балла обычно шум: в пределах, где другой промпт, другая частота сэмплирования кадров или другая версия ПО перевернули бы ранжирование. Считайте разрыв в два балла ничьёй и решайте по лицензии, размеру и стоимости обслуживания. Третья – лидерборды редко показывают лицензию, размер модели или железо, нужное для этих баллов, – а именно эти три фактора определяют, сможете ли вы запустить модель в продакшн. Лечение – это дисциплина, а не график: отберите шорт-лист по лицензии, отфильтруйте до размеров, которые тянет ваше железо, и только потом сравнивайте видео-бенчмарки среди оставшихся, а две лучшие прототипируйте на своих данных, прежде чем брать обязательства. Модель, которая выигрывает на вашем материале при вашем бюджете задержки, – правильная, независимо от того, кто возглавляет публичный график в этом месяце.
Где здесь Фора Софт
Мы внедряем эти открытые модели в реальные видеопродукты в тех отраслях, где работаем, и выбор конкретного семейства моделей во многом зависит от этих условий. В системах видеонаблюдения и телемедицины, где данные часто не могут покидать серверы заказчика по законодательным требованиям, локальная (on-premises) открытая модель – нередко единственный подходящий вариант. Поэтому мы начинаем с Qwen3-VL или InternVL3, развернутых на собственном оборудовании клиента. В e-learning и OTT-платформах, где функции вроде автоматического конспектирования лекций или тегирования контента обрабатывают большие объёмы данных, экономическая выгода от использования собственной видеокарты смещает баланс в сторону «разработать самому», а не «купить готовое». Дообученная открытая модель на приватном домене в таких случаях оказывается эффективнее универсальной закрытой. Для edge-вычислений и встроенных решений рядом с камерой компактный footprint Pixtral оправдывает своё применение. Главный вывод, который мы делаем, – тот самый, что и эта статья: сначала выбирайте модель по лицензии и стоимости эксплуатации, приоритизируйте видеобенчмарки перед изображениями и оставляйте закрытые API для задач с малым объёмом данных и быстрых прототипов, где важнее скорость вывода на рынок, чем удельная стоимость.
Ключевые выводы
- Модели с открытыми весами VLM позволяют обрабатывать видео на собственном оборудовании, хранить данные локально и дообучать модели.
- Все модели используют одинаковую архитектуру: компонент для анализа изображений, соединитель и языковая модель – подход, доказавший свою эффективность в LLaVA в 2023 году.
- Qwen3-VL – универсальный выбор по умолчанию в 2026 году; InternVL3 – наиболее чисто лицензированный конкурент; Pixtral – лучший вариант для запуска на одной видеокарте.
- Лицензия программного обеспечения зачастую важнее нескольких баллов в бенчмарках – изучайте её до того, как смотреть на лидерборды.
- Самостоятельный хостинг превосходит закрытые API только после достижения точки безубыточности; стоимость простого GPU и эксплуатационные расходы – скрытые затраты.
- При разработке продуктов с видео ориентируйтесь на видео-бенчмарки, такие как Video-MME, а не на метрики, рассчитанные на изображения, вроде MMMU.
Что читать дальше
- Закрытый фронтир – Gemini 2.5, GPT-5, Claude Opus 4 – альтернатива «аренде» всех этих моделей и источник цифры стоимости за видео.
- Видео-ВЛМ в 2026 – сэмплирование кадров против потоковой передачи токенов – математика токенов и контекстного окна, на которой основан этот урок.
- Решение «просто возьмём ВЛМ» – когда универсальная ВЛМ действительно может заменить кастомный пайплайн компьютерного зрения.