Справочник

Глоссарий ИИ в видеоинженерии

Короткие определения с синонимами и ссылками на статьи, где термин разобран подробно. Все термины на одной странице – ищите поиском или прыгайте по алфавиту.

С чего начать

Ключевые термины

Если читать словарь целиком некогда – это тот минимум, на котором держатся остальные 138 терминов.

А

Б

В

Векторная база данных

векторное хранилище

Хранилище для эмбеддингов, быстро находящее ближайшие к запросу. Движок извлечения под семантическим поиском и RAG.

Подробнее →

Веса модели

параметры

Обученные числа внутри нейросети. Обучение их создаёт; их количество (например, 7B = 7 млрд) говорит о размере, способностях и цене модели.

Подробнее →

Виртуальный фон

замена фона

Замена реального фона за человеком в звонке на картинку или сцену; строится на сегментации в реальном времени плюс композитинге.

Подробнее →

Внимание (attention)

самовнимание

Механизм, позволяющий модели взвешивать, какие части входа важнее для каждого выхода. Ключевая идея, заставляющая трансформеры работать.

Подробнее →

Выборка кадров (frame sampling)

отбор кадров

Выбор того, какие кадры подать модели, а не все подряд, чтобы снизить цену и токены, сохранив достаточно информации о клипе.

Подробнее →

Г

Д

Детекция лиц

обнаружение лиц

Поиск лиц на изображении рамками – без установления личности. Первый шаг перед размытием, кадрированием или распознаванием.

Подробнее →

Детекция с открытым словарём

open-set детекция

Обнаружение категорий, заданных текстом во время работы, а не фиксированным набором из обучения. Одна модель находит произвольные новые объекты.

Подробнее →

Диаризация говорящих

диаризация

Определение, кто и когда говорил в аудио – разметка сегментов «Говорящий 1», «Говорящий 2» – необязательно зная имена.

Подробнее →

Дистилляция знаний

дистилляция

Обучение маленькой модели-«ученика» копировать большую «учителя», чтобы получить почти то же качество за долю размера, цены и задержки.

Подробнее →

Диффузионная модель

диффузия

Доминирующий подход к генерации изображений и видео: начать с шума и шаг за шагом уточнять его в чистый результат по запросу.

Подробнее →

Дообучение (fine-tuning)

файн-тюнинг, доменная адаптация

Берётся общая предобученная модель и немного дообучается на своих данных под узкую задачу – без старта с нуля.

Подробнее →

Ж

З

И

ИИ-аватар

цифровой аватар, HeyGen, Tavus

Синтетический экранный ведущий, созданный из реального или придуманного лица, управляемый текстом или звуком, чтобы говорить и двигаться. Видео без съёмок.

Подробнее →

ИИ-агент

автономный агент

ИИ-система, идущая к цели, самостоятельно выбирая шаги – вызывая инструменты, читая результаты и действуя – вместо ответа на один запрос.

Подробнее →

ИИ-ассистент встреч

AI-нотетейкер, копилот встреч

Бот, который входит в звонки, чтобы транскрибировать, суммировать и фиксировать задачи; также ИИ-нотетейкер. Флагманская категория ИИ реального времени.

Подробнее →

ИИ-дубляж

автодубляж

Автоматический перевод и переозвучка видео на другой язык через ASR, перевод, синтез голоса и lip-sync, вместо найма актёров озвучки.

Подробнее →

ИИ-модерация контента

модерация, trust and safety

Автоматическая проверка живого или загруженного медиа на небезопасный контент – нагота, насилие, абьюз – чтобы блокировать, размывать или помечать на масштабе.

Подробнее →

Инстанс-сегментация

Пиксельные маски, разделяющие отдельные объекты – не просто «пиксели людей», а «человек 1» и «человек 2». Сочетает детекцию и сегментацию.

Подробнее →

Интеллектуальная видеоаналитика (IVA)

IVA, видеоаналитика

ПО, автоматически превращающее видеопотоки в бизнес- или охранные сигналы – подсчёты, оповещения, время пребывания – поверх детекции и трекинга.

Подробнее →

Инференс

инференс, предсказание

Запуск обученной модели на новых данных ради предсказания. Основная стоимость ИИ-функции возникает именно на инференсе, а не на обучении.

Подробнее →

Использование инструментов (tool use)

вызов функций, function calling

Возможность модели вызывать внешние функции – поиск, детектор, базу – чтобы действовать и доставать факты, а не полагаться только на память.

Подробнее →

К

Кадр (frame)

видеокадр

Одно неподвижное изображение в видео. Видео – это быстрая череда кадров; большинство CV работает покадрово, поэтому число кадров влияет на качество и цену.

Подробнее →

Квантизация

квантование

Уменьшение модели за счёт хранения весов с меньшей числовой точностью, чтобы она занимала меньше памяти и работала быстрее, обычно почти без потери точности.

Подробнее →

Классификация изображений

классификация

Присвоение одной метки всему изображению – «кот», «оружие», «безопасно» – без локализации. Простейшая CV-задача и кирпичик детекторов.

Подробнее →

Клонирование голоса

синтез голоса

Воссоздание голоса конкретного человека из образцов, чтобы TTS говорил этим голосом. Сильно для дубляжа, но юридически и этически сложно – нужно согласие.

Подробнее →

Ключевая точка (keypoint)

лэндмарк, ориентир

Один отслеживаемый ориентир – сустав, точка лица, кончик пальца. Модели позы и лица выдают наборы keypoints, описывающие форму и движение.

Подробнее →

Компьютерное зрение

CV, машинное зрение

Область, обучающая ПО извлекать смысл из изображений и видео – обнаруживать, классифицировать, отслеживать и измерять то, что в кадре.

Подробнее →

Контрастное обучение

Метод обучения, сближающий совпадающие пары и раздвигающий несовпадающие в пространстве эмбеддингов. Так CLIP связывает картинки с текстом.

Подробнее →

М

О

Облачный инференс

серверный инференс

Запуск моделей в удалённом дата-центре по сети. Легко масштабируется и использует мощные GPU, но добавляет задержку и плату за каждый вызов.

Подробнее →

Обнаружение аномалий

детекция аномалий

Выявление событий, отклоняющихся от нормы – падение, вторжение, дефект – без размеченного примера каждой возможной проблемы.

Подробнее →

Обнаружение объектов

детекция объектов

Поиск объектов на изображении с рамкой и меткой вокруг каждого. Базовый примитив для видеонаблюдения, ритейла и спортивного видео.

Подробнее →

Обучение

тренировка

Настройка модели на размеченных примерах, пока её внутренние веса не начнут давать верные предсказания. Делается один раз и стоит куда дороже инференса.

Подробнее →

Ограничивающая рамка (bounding box)

bbox, рамка

Прямоугольник, который детектор рисует вокруг объекта: координаты углов, метка и уверенность. Базовая форма вывода детекции.

Подробнее →

Окно контекста

длина контекста

Максимальный объём входа – в токенах – который модель учитывает за раз. Ограничивает, сколько видео, транскрипта или документа помещается в один запрос.

Подробнее →

Оптический поток (optical flow)

поле движения

Попиксельное движение между двумя кадрами в виде поля векторов. Лежит в основе стабилизации, интерполяции кадров и анализа движения.

Подробнее →

Оценка глубины (depth estimation)

монокулярная глубина

Предсказание расстояния каждого пикселя до камеры из обычного 2D-видео. Даёт 3D-эффекты, AR с учётом перекрытий и понимание сцены.

Подробнее →

Оценка позы (pose estimation)

трекинг позы

Поиск положения суставов – плечи, локти, колени – для считывания осанки и движения. Питает фитнес, спорт и жесты.

Подробнее →

П

Перевод в реальном времени

живой перевод

Перевод речи на другой язык по ходу разговора, чтобы два человека без общего языка могли говорить вживую.

Подробнее →

Повторная идентификация (Re-ID)

Re-ID

Повторное узнавание того же объекта или человека после ухода и возврата в кадр по визуальной сигнатуре. Позволяет трекингу переживать разрывы и смену камер.

Подробнее →

Пословные таймкоды

выравнивание, тайминги слов

Точное время начала и конца каждого расшифрованного слова. Позволяет субтитрам подсвечиваться синхронно и резать клипы по границам слов.

Подробнее →

Потоковый ASR

онлайн ASR

Расшифровка речи по мере произнесения, слово за словом, без ожидания конца аудио. Нужен для живых субтитров и голосовых агентов.

Подробнее →

Предобработка (preprocessing)

препроцессинг

Подготовка сырых кадров для модели – масштаб, кроп, цветокоррекция, нормализация – ради чистого согласованного входа. Незаметно решает многое для точности.

Подробнее →

Промпт-инжиниринг

промптинг

Составление инструкций и примеров для модели ради лучшего и надёжного результата, не меняя саму модель.

Подробнее →

Промптируемая сегментация

интерактивная сегментация

Сегментация того, на что указал пользователь – клик, рамка, текст – а не фиксированного списка классов. Модель взаимодействия, популяризованная SAM.

Подробнее →

Пропускная способность

QPS

Сколько работы система выполняет за единицу времени – кадров в секунду, запросов в секунду. Конфликтует с задержкой при пакетировании запросов.

Подробнее →

Р

С

Т

Ц

Ш

Э

A

AgentOps

наблюдаемость агентов

Практика и инструменты эксплуатации агентов в продакшене – оценка, трассировка, учёт стоимости и защита – чтобы автономные системы оставались надёжными и безопасными.

Подробнее →

AR-эффекты

AR-фильтры, бьюти-фильтр

AR-наложения в реальном времени на лицо или сцену в видео – фильтры, маски, сглаживание, коррекция взгляда – на основе трекинга лица и позы.

Подробнее →

ASR (распознавание речи)

STT, распознавание речи

Automatic Speech Recognition – превращение звучащей речи в текст. Базовый слой для субтитров, транскриптов, голосовых команд и заметок встреч.

Подробнее →

ASR на клиенте

ASR в браузере

Запуск распознавания речи в браузере или на устройстве пользователя вместо сервера: аудио остаётся локальным, поминутная облачная плата исчезает.

Подробнее →

AutoGen

Фреймворк Microsoft для многоагентных диалогов, где агенты общаются друг с другом и с инструментами ради решения задачи. Ранний влиятельный набор для агентов.

Подробнее →

B

C

C2PA

Content Credentials

Открытый стандарт привязки защищённого от подделки происхождения к медиа, фиксирующий, как файл создан или изменён. Техническая основа меток «сгенерировано ИИ».

Подробнее →

Claude

Claude Opus, Claude Sonnet

Семейство флагманских языковых и мультимодальных моделей Anthropic, используемое через API для рассуждений, длинного контекста, зрения и агентного вызова инструментов.

Подробнее →

Claude Agent SDK

Claude Code SDK

Набор Anthropic для построения автономных агентов, исполняющих собственный цикл вызова инструментов, с доступом к файлам и командам. Ранее Claude Code SDK.

Подробнее →

Claude Code

Агентный инструмент Anthropic для кодинга в терминале: читает кодовую базу, редактирует файлы и запускает команды для выполнения задач разработки.

Подробнее →

CLIP

Модель, отображающая изображения и текст в общее пространство, чтобы оценивать, насколько подпись соответствует картинке. Базовый приём за open-vocabulary зрением.

Подробнее →

Computer-use агент

Operator, Perplexity Comet

Агент, управляющий софтом как человек – смотрит на экран, кликает и печатает – выполняя задачи в приложениях без специальных API.

Подробнее →

CrewAI

Фреймворк агентов, организующий несколько ролевых агентов в «команду», совместно решающую задачу. Популярен для многоагентных сценариев.

Подробнее →

D

E

F

G

Gemini

Google Gemini

Семейство флагманских мультимодальных моделей Google, принимающих текст, изображения, звук и видео. Доступно через API как закрытая модель с очень большим контекстом.

Подробнее →

GGUF

Однофайловый формат для распространения квантованных языковых и мультимодальных моделей; популярен для эффективного запуска на CPU и потребительских GPU.

Подробнее →

GPT

ChatGPT, GPT-5

Линейка флагманских языковых и мультимодальных моделей OpenAI, доступная через платный API. Выбор закрытой модели по умолчанию для рассуждений и зрения.

Подробнее →

GPU

видеокарта, ускоритель

Graphics Processing Unit – параллельный чип, на котором работает почти весь современный ИИ. Доступность и цена GPU определяют стоимость self-hosting.

Подробнее →

Grounding DINO

Детектор с открытым словарём, находящий объекты по свободному текстовому запросу, а не по фиксированному списку – найти «красный рюкзак» без переобучения.

Подробнее →

I

J

K

L

LangGraph

Фреймворк для построения агентных приложений как графов шагов с точным контролем состояния, ветвлений и циклов. Ведущий инструмент оркестрации агентов.

Подробнее →

Lip-sync (синхрон губ)

синхронизация губ

Подгонка движений рта лица под заданную аудиодорожку, чтобы говорящая голова выглядела действительно произносящей слова. Ключ к ИИ-аватарам и дубляжу.

Подробнее →

LiveKit

LiveKit Agents

Открытый стек реального времени и фреймворк агентов, позволяющий ИИ войти в WebRTC-звонок полноценным участником, который слышит, видит и говорит.

Подробнее →

LLaVA

LLaVA-NeXT

Популярная открытая модель «зрение-язык», соединяющая энкодер изображений с открытой LLM; частая база для self-hosted мультимодальных функций.

Подробнее →

LLM (большая языковая модель)

большая языковая модель

Модель, обученная на огромных текстах, предсказывающая и генерирующая язык. Движок рассуждений за чатом, суммаризацией и большинством агентных систем.

Подробнее →

LLM-как-судья

оценка моделью

Использование сильной языковой или мультимодальной модели для автоматической оценки вывода другой модели, масштабируя проверку за пределы ручного ревью.

Подробнее →

LoRA

Low-Rank Adaptation

Low-Rank Adaptation – дешёвый метод дообучения, тренирующий маленькие добавочные слои вместо всей модели, чтобы кастомизировать большие модели на скромном железе.

Подробнее →

M

N

O

P

Q

R

RAFT

Lucas-Kanade

Глубокая модель оптического потока, точная на сложном движении. Современный выбор по умолчанию, когда классических методов вроде Lucas-Kanade не хватает.

Подробнее →

RAG (генерация с извлечением)

генерация с извлечением

Подача языковой модели релевантных фактов, извлечённых из ваших данных в момент запроса, чтобы ответы опирались на реальные источники, а не только на память.

Подробнее →

Real-ESRGAN

Популярная открытая модель апскейла реальных изображений и видео, хорошо восстанавливающая детали в сжатом или повреждённом материале.

Подробнее →

RNNoise

Крошечная эффективная открытая модель шумоподавления голоса в реальном времени, достаточно лёгкая для запуска в браузере через WebAssembly.

Подробнее →

Runway

Runway ML

Коммерческая платформа генеративного видео с text- и image-to-video и инструментами монтажа; популярна у креаторов и пост-продакшена.

Подробнее →

S

T

V

Veo

Google Veo

Модель text-to-video от Google, известная генерацией синхронного звука вместе с изображением и выводом высокого разрешения.

Подробнее →

Video RAG

мультимодальный RAG

Применение RAG к видеоархиву: находить нужные моменты по смыслу, а затем дать модели ответить на вопросы или их суммировать.

Подробнее →

Vision Transformer (ViT)

ViT

Нейросеть, применяющая архитектуру трансформера к участкам изображения вместо слов. Сегодня – основа большинства передовых моделей зрения.

Подробнее →

vLLM

PagedAttention

Открытый высокопроизводительный движок для обслуживания языковых и мультимодальных моделей; использует PagedAttention и непрерывное пакетирование, чтобы упаковать много запросов на GPU.

Подробнее →

VLM (модель «зрение-язык»)

модель зрение-язык

Модель, принимающая изображения или видео плюс текст и выдающая текст – описывая, отвечая на вопросы или рассуждая об увиденном.

Подробнее →

VRAM

память GPU

Память видеокарты. Модель запустится, только если её веса и рабочие данные помещаются в VRAM, поэтому объём VRAM ограничивает выбор моделей.

Подробнее →

W

WebAssembly (WASM)

WASM

Быстрый переносимый бинарный формат, исполняющий близкий к нативному код в браузере; используется для запуска ИИ-моделей вроде шумоподавления и ASR на клиенте.

Подробнее →

WebGPU

Браузерный API с прямым доступом к GPU, чтобы ИИ-модели работали быстро на стороне клиента без установки.

Подробнее →

WebRTC

Web Real-Time Communication

Открытый стандарт, позволяющий браузерам и приложениям напрямую обмениваться аудио, видео и данными в реальном времени. Транспортный слой под большинством видеозвонков.

Подробнее →

WER (пословная ошибка)

пословная ошибка

Стандартная метрика точности распознавания речи: доля неверных слов, меньше – лучше. Позволяет сравнивать ASR на одном аудио.

Подробнее →

Whisper

faster-whisper

Открытое семейство моделей распознавания речи от OpenAI, сильное во многих языках. Частый бесплатный базис для транскрипции и субтитров.

Подробнее →

WhisperX

Улучшенный конвейер Whisper с точными пословными таймкодами и метками говорящих, чтобы транскрипт плотно совпадал со звуком и с тем, кто говорил.

Подробнее →

Y

Z

Термин встретился в статье без определения? Напишите нам – добавим в глоссарий.

Нужен не словарь, а команда?

Разрабатываем видеопродукты с 2005 года: стриминг, ВКС, ИИ на видео. 250+ проектов.