Содержание статьи +
- TL;DR
- Почему это важно
- Что именно вы строите
- Хребет: два правила, переживающие модели
- Что на деле означают слова «100 000 в день»
- Продакшн-архитектура, стадия за стадией
- Строить или купить: вердикт 2026 года, компонент за компонентом
- Поле инструментов 2026 года – и почему вы его игнорируете
- Модель затрат: почему воронка бьёт очевидный дизайн примерно девять к одному
- Стратегия точности: две ошибки, которые не равны
- Governance: закон, несовершеннолетние и люди в петле
- Порядок сборки: каждый майлстоун защищает пользователей
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
TL;DR
Этот итоговый проект сваривает computer-vision, мультимодальную и real-time линии курса в один готовый продукт: конвейер, который принимает поток видео, загружаемого пользователями платформы – сто тысяч клипов в день – и решает по каждому, можно ли его опубликовать, нужно ли заблокировать или отдать человеку, оставляя при этом запись, которую примут и регулятор, и юрист. Хребет сборки – два правила, которые держатся, как бы ни менялись модели: запускайте самую дешёвую проверку первой и позволяйте каждой стадии либо решить, либо передать видео выше, дороже, так чтобы дорогая машинерия видела только малую долю контента, которой она действительно нужна; и относитесь к каждому решению как к тому, что вы обязаны уметь объяснить, а к нелегальному контенту – как к тому, о чём по закону нужно сообщить, а не просто удалить. Мы даём точный список стадий с вердиктом «строить или купить» по каждой, поле инструментов 2026 года с реальными ценами на hash-базы, на классификаторы-API и на vision-language-модели, арифметику пропускной способности и затрат, показывающую, почему отправлять каждое видео в moderation-API целиком стоило бы примерно в десять раз дороже конвейера, стратегию точности, в которой пропущенное нелегальное видео и ошибочно удалённый кулинарный ролик – это совершенно разные ошибки, и карту governance – обязательная отчётность, защита несовершеннолетних и благополучие людей в петле – которая отделяет конвейер, который платформа реально может эксплуатировать, от того, что превращается в скандал. Там, где урок про real-time-модерацию показывал, как отсматривается один поток вживую, этот итоговый проект – асинхронная фабрика, которая переживает аудит регулятора и десятикратный всплеск трафика.
Почему это важно
Эта статья – для основателя, продакт-лида или trust-and-safety-лида любой платформы, куда незнакомые люди загружают видео: соцсеть, dating-приложение, маркетплейс для авторов, live-shopping-сервис, форум-сообщество с клипами, любой видеопродукт. В момент, когда платформа разрешает пользователям публиковать видео для других пользователей, вы наследуете проблему, которая не исчезает и которую закон больше не считает необязательной: какая-то доля загруженного будет нелегальной, какая-то нарушит ваши правила, и вы теперь отвечаете за то, чтобы поймать это на скорости и масштабе, недостижимых для команды людей с просмотром. Этот итоговый проект показывает, сколько такой конвейер реально стоит, как объём пропускается через воронку, чтобы счёт оставался вменяемым, какие части покупают, а какие строят, где закон проводит жёсткие линии и как относиться к людям, делающим финальную проверку, как к первоклассной части системы, а не как к статье расходов. Он одинаково полезен и инженеру, прочитавшему отдельные уроки по computer vision и мультимодальному ИИ и желающему собрать их в одну развёртываемую систему с названными технологиями, реальными ценами и честным разбором того, где автоматическая модерация ломается. К концу вы сможете нарисовать конвейер на доске, назвать точную технологию 2026 года в каждой стадии, защитить стоимость на видео перед финансами, выстроить сборку так, чтобы первая версия защищала пользователей за недели, и отличить дизайн, который пройдёт аудит Ofcom или Еврокомиссии, от того, что попадёт в заголовки.
Что именно вы строите
Зафиксируйте продукт раньше любой технологии. Вы строите сервис с одной задачей: каждый раз, когда пользователь загружает видео, сервис решает – быстро и сам для подавляющего большинства случаев – разрешено ли это видео к публикации, должно ли быть заблокировано или должно быть эскалировано человеку, потому что машина не уверена. Вокруг этого решения стоят две вещи, важные не меньше его самого: запись о том, почему сделан каждый выбор, в форме, которую можно передать регулятору, и путь отчётности, который для узкого класса контента, нелегального, а не просто против правил, отправляет требуемый отчёт нужному органу, а не тихо удаляет улику.
Два термина в этом описании весомы. UGC значит «user-generated content» – всё, что загружают сами пользователи, в отличие от контента, который производит платформа. Это определяющая черта любого социального, dating-, community- и авторского продукта, и именно его нельзя проверить заранее, потому что вы его не делали и его слишком много. Модерация здесь – весь процесс решения, что остаётся опубликованным: не один вызов модели, а конвейер автоматических проверок и человеческого суждения между кнопкой загрузки и остальными пользователями платформы.
Внутри техники лежит форма, с которой вы уже сталкивались в каждом итоговом проекте: воронка. Простая версия этой идеи – как аэропорт проверяет багаж: не вскрывая каждый чемодан, а пропуская всё через дешёвый рентген, отбирая лишь те, что выглядят подозрительно, и вручную досматривая лишь крошечную долю, которую второй взгляд не снял. Дешёвый, быстрый автоматический скрининг – для всего; дорогое, медленное человеческое внимание – почти ни для чего. Конвейер модерации – это и есть такой аэропорт, и всё искусство построения его недорого сводится к тому, чтобы понять, что каждый уровень проверки стоит, что он ловит и что он вправе пропустить сам.
Линия охвата – самое важное: зачем нужен конвейер. Он существует для того, чтобы различать две вещи, которые часто путают: закон, единый для всех и от которого нельзя отказаться, и собственные правила платформы, которые принадлежат вам и могут быть строже закона. Видео может быть полностью законным, но всё равно нарушать ваши правила – например, спам, реклама конкурента, нагота на платформе, где она запрещена. Видео может быть нелегальным независимо от ваших правил, и этот узкий, но серьёзный класс – прежде всего материалы сексуального насилия над детьми (CSAM) – влечёт за собой обязательства, не связанные с вашими условиями использования, но напрямую предусмотренные законодательством. Архитектура, описанная ниже, построена так, чтобы эти две задачи были принципиально разделены, потому что самая дорогостоящая ошибка в этой области – спутать юридическое обязательство с предпочтением в политике контента.
Рис. 1. Конвейер – это воронка. Каждое видео поступает сверху; на каждой стадии либо принимается решение, либо видео передаётся на более дорогую стадию выше; внизу человек видит лишь крошечную долю от первоначального объёма. Общая стоимость системы определяется тем, насколько эффективно дешёвые стадии сокращают объём на своих этапах.
Хребет: два правила, переживающие модели
Две идеи лежат в основе всей сборки. Если их реализовать правильно – всё остальное станет лишь деталями. Как и в любом итоговом проекте курса, эти правила существуют потому, что технологии развиваются быстрее, чем любая статья может за ними угнаться. Классификатор, выбранный в этом квартале, будет побит в следующем; закон и форма конвейера не сдвинутся так быстро и близко.
Первое правило – сначала самая дешёвая проверка: каждая стадия либо решает вопрос, либо передаёт его дальше, и дорогие стадии вообще не видят основную массу трафика. Вы выстраиваете проверки от почти бесплатной до дорогой и организуете процесс так, чтобы большинство видео обрабатывалось на дешёвых стадиях и не доходило до дорогих. Это не вопрос предпочтений – это необходимость, диктуемая арифметикой, которую раздел затрат делает очевидной. Платформа, принимающая сто тысяч видео в день, не может отправлять каждое целиком в самую мощную доступную модель – счёт пойдёт на миллионы в год, а самая мощная модель ещё и самая медленная, так что вы провалитесь и по стоимости, и по скорости сразу. Поэтому вы строите воронку: видео, которое обнаруживает проверка за цент, остаётся на этой стадии и дальше не проходит; лишь небольшой остаток, который дешёвые проверки не закрыли, передаётся vision-language-модели, и только часть этого остатка доходит до человека. Поддерживать стадии упорядоченными по стоимости и чётко понимать, что каждая способна решить сама, – это единственная и самая полезная ментальная модель для контроля бюджета всего конвейера.
Второе правило – каждое решение должно сопровождаться причиной, а нелегальный контент – фиксироваться в отчёте, а не просто удаляться. Каждый выбор конвейера – разрешить, заблокировать или эскалировать – должен фиксироваться вместе с причиной, по которой он был принят, в форме, пригодной для представления регулятору, суду или пользователю, подавшему апелляцию, даже спустя месяцы. А для узкого класса нелегального контента удаление – не конец обязательств: закон большинства рынков, где вы работаете, требует сообщить о таком контенте в уполномоченный орган и сохранить доказательства, а не просто тихо удалить их. Это принципиальная разница между конвейером, защищающим платформу, и системой, которая незаметно уничтожает те самые записи, на которые позже может опираться расследование по защите детей или ваша собственная защита в деле о принуждении. Фиксация данных – не бюрократическая приставка в конце процесса. Это ограничение, которое должно действовать на всех этапах конвейера: каждая стадия должна выдавать не только вердикт, но и обоснование к нему, иначе в audit-следе окажутся пробелы ровно там, где они окажутся наиболее критичными.
Держите два правила вместе – и конвейер обретает чистую форму. Первое правило отвечает на вопрос где живёт стоимость – почти целиком на человеческой стадии и на стадии VLM, поэтому вы так стараетесь держать объём подальше от них. Второе правило определяет, что делает конвейер защитимым – не хитрость отдельной модели, которая быстро устареет, а непрерывная цепь от загрузки до решения, до причины и, при необходимости, до отчёта. Всё остальное в статье заполняет промежуточные стадии, решает, что строить, а что покупать, и оценивает это в деньгах.
Что на деле означают слова «100 000 в день»
Прежде чем проектировать архитектуру, оцените масштаб – ведь именно число определяет существование воронки. Сто тысяч видео в день – это не аккуратная струйка. Распределённые равномерно, они дают 100 000 ÷ 86 400 секунд, около 1,16 видео в секунду, но трафик никогда не бывает ровным. Загрузки скапливаются вечером и вокруг событий, поэтому реалистичная цель проектирования – пик в три-четыре раза выше среднего, скажем, четыре видео в секунду, которые фронт конвейера должен обрабатывать без отставания. Если не справиться – очередь будет расти без ограничений; затор в модерации – это не косметическая задержка, а непросмотренный контент перед пользователями.
Теперь превратите видео в то, что реально обрабатываете. Например, среднее видео длится две минуты – короткие UGC-контент короче, но две минуты делают расчёты честными. Сто тысяч видео по две минуты – это 100 000 × 2, то есть 200 000 видеоминут в день входящих. Запомните это число: именно оно определяет, можете ли вы позволить себе модерировать контент по минутам или вынуждены ограничиться проверкой отдельных кадров.
Вот ловушка, губящая наивные дизайны, изложенная так прямо, как она того заслуживает.
«Частая ошибка: модерировать видео поминутно. Очевидный первый инстинкт – отправить каждое видео целиком в video-moderation-API. По репрезентативной цене 2026 года – около десяти центов за минуту анализируемого видео – ваши 200 000 видеоминут × $0,10 обходятся в $20 000 в день, то есть около $7,3 млн в год, чтобы просматривать каждую секунду каждой загрузки, большая часть которой – человек, говорящий в камеру ни о чём. Это ещё и медленно: анализ видео от начала до конца занимает время, которого у вас нет при четырёх загрузках в секунду. Вы не модерируете поминутно. Вы модерируете по горстке выбранных кадров плюс аудиотранскрипт и тратите реальные деньги лишь на малую долю видео, которую дешёвый проход не закрыл.»
Это единственное решение – выбирать, а не просто смотреть: именно такая петля лежит в основе всей модели затрат, и это та же идея, что лежит в основе прореживания кадров в computer vision. Двухминутный клип при шестидесяти кадрах в секунду содержит 7 200 кадров, почти все из которых – near-дубликаты соседних. Вы сводите это к нескольким десяткам осмысленных ключевых кадров ещё до того, как модель их увидит. Механика такого сведения описана в уроке про предобработку для ML на видео; здесь этот подход делает возможным скрининг ста тысяч видео в день.
Продакшн-архитектура, стадия за стадией
Реальное развёртывание – это больше, чем просто вызов модели модерации. В каждом UGC-конвейере модерации, который мы прорабатывали, присутствуют пять стадий плюс уровень governance, и точное их определение – первый шаг любого проекта. Эти этапы упорядочены по первому правилу хребта: сначала – то, что дешевле.
Конвейер начинается с приёма и подготовки – с незаметной входной двери, до любого суждения. Загрузка поступает, временно сохраняется, перекодируется в формат, понятный нижестоящим моделям, и сводится к двум недорогим представлениям, на которых и работает остальная часть конвейера: небольшой набор выбранных ключевых кадров (несколько десятков стоп-кадров, фиксирующих содержание видео) и аудиотранскрипт, полученный с помощью автоматического распознавания речи (ASR) – той же технологии, что используется для создания субтитров в уроке про WhisperX, здесь применённой, чтобы преобразовать речь в текст для поиска и оценки. С этого момента «модерировать видео» в основном означает модерировать именно эти кадры и транскрипт – именно поэтому это так дёшево.
Стадия 0 – сопоставление по hash с базами известно-плохого, и это и самая дешёвая стадия, и единственная, которую закон фактически предписывает. Hash – короткий цифровой отпечаток файла, несколько сотен байт, заменяющий всё изображение или видео. Перцептивный hash, в частности, построен так, что два визуально похожих файла дают похожие отпечатки, поэтому совпадение сохраняется при перекодировке, обрезке или наложении водяного знака – в отличие от точного (exact-copy) отпечатка. Конвейер вычисляет перцептивный hash каждого входящего видео и его ключевых кадров, сравнивая их с курируемыми базами отпечатков уже известного нелегального контента – прежде всего CSAM, каталогизированного органами защиты детей. Каноническая система для изображений – PhotoDNA, созданная Microsoft и лицензируемая платформам; каноническая открытая система для видео и изображений – PDQ (для фото) и TMK+PDQF (для видео) от Meta, открытые в 2019 году и построенные для работы на масштабах платформ. Совпадение здесь – не догадка: оно означает, что именно этот известный нелегальный контент загружают снова, поэтому может обрабатываться автоматически – блокировать загрузку, подавать требуемый законом отчёт и сохранять улику. Решающее ограничение, к которому вернётся раздел о точности: hash-сопоставление ловит только уже известный контент; оно не видит ничего нового. А взрыв CSAM, сгенерированного ИИ, у которого по природе нет предыдущего отпечатка, – именно та причина, по которой существуют поздние стадии.
Стадия 1 – банк дешёвых автоматических классификаторов, запускаемых на выбранных ключевых кадрах и транскрипте. На этой стадии обрабатывается основная часть контента. Классификатор – это модель, которая анализирует фрагмент контента и выдаёт оценки по фиксированному набору категорий модерации: явный сексуальный контент, графическое насилие, символы ненависти, оружие, селф-харм и так далее. Вы запускаете image-классификатор на ключевых кадрах и text-классификатор на транскрипте – и большинство видео получают низкие оценки по всем параметрам: человек готовит еду, демонстрирует продукт, играет с собакой – и разрешаются без дальнейших проверок, минуя более дорогие стадии.
Честная инженерная реальность: эту стадию чаще покупают, чем строят. Зрелые решения – это managed-решения вроде Amazon Rekognition content moderation, Hive, Microsoft Azure AI Content Safety, Google Cloud SafeSearch и Sightengine. Самостоятельный хостинг используют реже, применяя открытые модели, такие как NudeNet (локализует оголённые участки тела, а не просто помечает всё изображение) или CLIP-основанный zero-shot-классификатор, оценивающий кадр по текстовым промптам вроде «на этом изображении есть оружие».
Самый важный выбор на этой стадии – порог. Если установить планку «явно безопасно» слишком высоко – слишком много контента будет отправлено на дорогие стадии обработки. Если поставить её слишком низко – нелегальный контент может пройти незамеченным. Пороги задаются по каждой категории отдельно, а не глобально, по причинам, которые подробно объясняются в разделе точности.
Стадия 2 – vision-language-модель, читающая неоднозначную середину, и она существует потому, что оценка одного кадра не может определить контекст. Vision-language-модель, или VLM, – это модель, которая принимает изображение и письменный вопрос и отвечает словами. Она может посмотреть видео и сказать не просто, что на нём нож, а что повар разделывает рыбу, а не представляет угрозу; не просто, что на кадре кровь, а что это урок по оказанию первой помощи, а не кровавый контент ради крови. Большинство по-настоящему сложных случаев модерации – именно такие контекстные задачи, и VLM – первый инструмент в конвейере, способный решать их без участия человека. Вы направляете лишь небольшую долю видео, которые дешёвые классификаторы пометили как неопределённые – достаточно тревожные, чтобы обратить внимание, но недостаточно, чтобы блокировать автоматически – на VLM с чётким промптом, задающим конкретный вопрос по политике, и сохраняете её письменное объяснение как часть записи. Поле 2026 года охватывает управляемые frontier-модели (Google Gemini, Anthropic Claude, мультимодальные модели OpenAI) и открытые веса для самовнедрения (LLaVA, Qwen-VL) – предмет урока про открытые VLM. Решение о том, когда VLM должна полностью заменить кастомный классификатор, – отдельная тема в уроке «просто возьмём VLM».
Стадия 3 – очередь человеческой проверки, и это самая дорогая стадия, которую невозможно полностью исключить. Некоторые решения слишком важны, слишком зависят от контекста или слишком юридически чувствительны, чтобы доверять их модели: пограничный случай, который может быть искусством, а может – насилием, апелляция пользователя, чей контент был удалён, или тип материалов, по которым ваша политика требует окончательного вердикта человека. Такие случаи попадают в очередь, где обученный проверяющий принимает финальное решение. На этой стадии реализуется вторая часть системы governance, потому что люди, выполняющие эту работу, по самой сути своей деятельности сталкиваются с худшим из того, что попадает в систему. Поэтому забота о их благополучии – не просто моральный долг, а инженерное требование, и всё чаще – юридическая и контрактная обязанность.
Под всеми четырьмя стадиями находится этаж управления и аудита – журнал решений, коннекторы обязательной отчётности, средства защиты несовершеннолетних, правила хранения данных и процедура апелляций. Для системы, которая ежедневно определяет, что сотне тысяч незнакомых людей можно говорить, этот этаж – не дополнительная инфраструктура; это то, что делает всю систему законной в использовании.
Рис. 2. Конвейер стадия за стадией. На каждой стадии видео либо разрешается (разрешить, заблокировать или сообщить), либо неопределённый случай передаётся на следующую, более ресурсоёмкую стадию; governance-этаж фиксирует каждое решение и несёт юридические обязательства, которые не снимаются даже при удалении.
Строить или купить: вердикт 2026 года, компонент за компонентом
Способная команда не создаёт всё с нуля и не покупает всё подряд. Правило большого пальца совпадает с подходом других итоговых проектов курса: используйте зрелую инфраструктуру, арендуйте или размещайте сами быстро меняющиеся модели, а строите только то, что действительно является вашим продуктом – здесь это логика маршрутизации, определяющая, куда и при каких условиях направлять данные, хранилище решений и аудит-трейл, слой отчётности и governance и инструменты проверки, которыми пользуются сотрудники. Эти компоненты делают конвейер точным, законным и гуманным; всё остальное – покупается или берётся в пользование.
| Компонент | Строить или купить | Конкретный выбор 2026 | Почему |
|---|---|---|---|
| CSAM / hash известно-плохого | КУПИТЬ / ПАРТНЁР | PhotoDNA; Meta PDQ + TMK; наборы hash NCMEC и IWF | Вы не вправе строить или держать это сами; вы подключаетесь к системам органов |
| Дешёвые классификаторы (NSFW/насилие) | КУПИТЬ или HOST | Rekognition / Hive / Azure Content Safety / открытые NudeNet / CLIP | Зрелое, commodity; меняйте свободно по цене и точности |
| Транскрипция аудио для модерации | КУПИТЬ / HOST | ASR класса Whisper | Решено; переиспользовано из audio-фазы |
| VLM для контекстной проверки | КУПИТЬ / HOST | Gemini / Claude / GPT или открытые LLaVA / Qwen-VL | Самая быстро меняющаяся часть; арендуйте и держите сменной |
| Выборка кадров / ключевые кадры | СТРОИТЬ | Downsample + дедуп ключевых кадров | Стандартный CV; малый, свой, дешёвый |
| Маршрутизация + пороги + эскалация | СТРОИТЬ | Ваша политика как код | Это и есть ваш продукт модерации |
| Хранилище решений + audit-след | СТРОИТЬ | Append-only журнал на каждую загрузку | Ваша юридическая улика; нельзя делегировать |
| Коннекторы отчётности + хранения | СТРОИТЬ / ПАРТНЁР | NCMEC CyberTipline; хранилище сохранения | Уставная обязанность; стройте по спецификации |
| Инструменты проверки + благополучие | СТРОИТЬ или ПАРТНЁР | Своя консоль или T&S-вендор | Сложнее всего сделать гуманно; никогда не задним числом |
Паттерн тот же, что проходит через весь курс: арендуйте модели, приобретайте готовую инфраструктуру и оставляйте за собой те компоненты, которые кодируют вашу политику, вашу ответственность и вашу обязанность заботы. Классификаторы и VLM будут меняться; логика маршрутизации, audit-след и слой governance – то, что остаётся с вами.
Поле инструментов 2026 года – и почему вы его игнорируете
Две стадии конвейера зависят от внешних инструментов, которые быстро меняются и следует воспринимать как сменные компоненты, а не как фиксированный выбор: банк дешёвых классификаторов и VLM-проверяющий. Подключите каждый из них через тонкий внутренний интерфейс – единственный вызов classify(frames, transcript) и единственный review(clip, question), содержимое которых можно менять, не затрагивая остальной конвейер, – и смена поставщика станет правкой конфигурации, а не переписыванием кода. Это важно, потому что рынок действительно турбулентен: цены колеблются, лидеры по точности сменяются, а модель, на которую вы опираетесь, могут в любой момент вывести из эксплуатации – как это уже происходило с embedding-моделями в прошлом итоговом проекте.
К 2026 году классификаторы managed-API консолидируются вокруг привычной ценовой зоны. Azure AI Content Safety обрабатывает изображения примерно по $1,50 за 1000 (около $0,0015 за изображение) и текст – около $1,00 за 1000 за запись. Amazon Rekognition для модерации контента стоит около $0,10 за минуту за видео, анализируемое целиком – именно поэтому его принято подавать через image-API по отдельным кадрам, а не целиком. Google Cloud SafeSearch бесплатен для первых тысячи вызовов в месяц, затем цена составляет около $1,50 за 1000, снижаясь до $0,60 за 1000 при объёме свыше пяти миллионов. Hive работает по индивидуальному тарифу, примерно $3 за 1000 за изображение при месячном объёме в миллион. Sightengine предлагает пакеты операций от примерно $29 в месяц. Открытый self-hosted-путь – такие решения, как NudeNet, CLIP-основанный скорер или небольшая дообученная vision-модель – заменяют плату за вызов на фиксированную стоимость аренды GPU, что становится выгоднее при объёмах, превышающих точку безубыточности.
Со стороны VLM frontier-модели – по два цента за вызов – и self-hostable открытые модели находятся в совершенно разных точках кривой «стоимость – контроль», и правильный ответ обычно оба: дешёвая открытая VLM для рутинных контекстных задач, а frontier-модель – в резерве для по-настоящему сложных или high-stakes сценариев. Весь смысл интерфейса в том, что такая маршрутизация – это вопрос настройки, а не архитектурного решения.
Есть одна категория инструментов, которую вы не выбираете по цене – и диаграмма это наглядно показывает: системы hash известно-плохого. Вы не создаёте собственный детектор CSAM, не формируете собственную библиотеку материалов и не проводите тендер среди поставщиков. Вы подключаетесь к устоявшимся системам – PhotoDNA, базам хешей, поддерживаемым National Center for Missing & Exploited Children (NCMEC) в США и Internet Watch Foundation (IWF) в Великобритании, а также к кросс-индустриальным программам обмена, таким как Lantern и Video Hash Interoperability Project от Tech Coalition, – и направляете совпадения в официальные каналы отчётности. Это единственная стадия, где «строить» – неверный ответ по юридическим и этическим, а не техническим причинам.
Рис. 3. Две из трёх категорий инструментов – commodity – те, которые вы абстрагируете за тонким интерфейсом и меняете по цене и точности. Третья – системы hash известно-плохого – партнёрство с органами защиты детей, огороженное, поскольку управляется законом и этикой, а не закупкой.
Модель затрат: почему воронка бьёт очевидный дизайн примерно девять к одному
Весь экономический аргумент конвейера умещается в одном сравнении, и арифметику стоит проделать вслух – результат покажет, жизнеспособен ли продукт. Все цифры – иллюстративные цены-листы 2026 года; ваши реальные значения будут зависеть от контрактов и состава контента, но форма остаётся устойчивой.
Начните с наивного дизайна из ловушки выше – отправлять каждое видео целиком в video-Moderation-API:
200 000 видеоминут/день × $0,10 / минута = $20 000 / день ≈ $7,3 млн / годТеперь оценим воронку, стадия за стадией, на фоне тех же ста тысяч видео в день. Стадия 0, хеш-сопоставление – это вычисление хеша и поиск в базе; при самохостинге это составляет доли цента за видео; возьмём щедрую оценку $0,0005 × 100 000 = $50/день. Стадия 1, дешёвые классификаторы, работает не с полными минутами, а с отобранными ключевыми кадрами – например, дюжина кадров на видео – плюс краткий транскрипт. По $0,0015 Azure за обработку одного изображения двенадцать кадров обходится в $0,018 на видео, так что скрининг всего дневного объёма – $0,018 × 100 000 = $1 800/день. Эта стадия самостоятельно отсекает большинство загрузок. Стадия 2, VLM, анализирует лишь неопределённый остаток – скажем, консервативно семь процентов видео, или 7 000 в день – примерно по два цента за единицу: $0,02 × 7 000 = $140/день. Стадия 3, человеческая проверка, применяется только к самому сложному остатку – допустим, один процент, или 1 000 видео в день – при стоимости проверки около четверти доллара (подробности по экономике проверки приведены отдельно): $0,25 × 1 000 = $250/день.
Стадия 0 hash $50/день
Стадия 1 классификаторы $1 800/день
Стадия 2 VLM $140/день
Стадия 3 люди $250/день
-------------------------------------
Итого воронка ≈ $2 240/день ≈ $818K / годВоронка обходится примерно в 800 тысяч долларов в год против 7,3 млн – почти девятикратная экономия – и при этом она точнее, а не наоборот: дорогие стадии фокусируют внимание только на том контенте, который действительно требует внимания, а не растягивают его на миллионы минут чужого обеда. Ключевой рычаг экономии – процент трафика, который каждая стадия передаёт дальше: повысите долю очистки на Стадии 1 за счёт настройки порогов – и общая стоимость снизится; дайте трафику течь дальше – и Стадии 2 и 3 раздуются. Поэтому именно настройка порогов, а не выбор модели, – это то, где команда модерации реально тратит своё время. Более широкий набор инструментов – батчинг, кэширование, дешёвые модели, зарезервированная ёмкость – описан в уроке про оптимизацию затрат.
Рис. 4. Воронка стоит примерно девятую часть от очевидного дизайна и при этом точнее. Экономия достигается почти полностью за счёт того, сколько объёма дешёвые стадии отсекают до запуска дорогих.
Стратегия точности: две ошибки, которые не равны
Каждое решение модерации может ошибаться в двух направлениях, и ключевое понимание всей области в том, что эти ошибки не равны по последствиям. Ложноотрицательная (false negative) – пропустить то, что следовало удалить. Ложноположительная (false positive) – удалить то, что следовало оставить. Наивная система использует одну настройку, пытаясь сбалансировать их как симметричные. Серьёзная система отвергает эту предпосылку, поскольку цена двух ошибок полностью зависит от того, что было пропущено или ошибочно удалено.
Возьмите крайности. Пропуск нелегального CSAM – катастрофа: для ребёнка, для платформы и для руководителей, которые могут нести личную ответственность. Приемлемой доли такого по сути нет – поэтому этот класс обрабатывается детерминированным хеш-сопоставлением плюс обязательным человеческим подтверждением, а не вероятностным классификатором с настраиваемым порогом. Ошибочное удаление легального кулинарного видео, напротив, – досадная ошибка, которую легко исправить через апелляцию. Две ошибки различаются на порядки по стоимости, и ваши пороги должны это отражать. Поэтому вы не задаёте одну глобальную чувствительность; вы задаёте порог на класс вреда, настроенный под цену ошибок в этом классе – крайне агрессивный (реагировать на малейший сигнал) для самых тяжёлых, юридически определённых видов вреда и более мягкий для низкорисковых категорий политики, где ложное срабатывание лишь раздражает, а апелляция всё исправляет.
Честная карта, где этот конвейер ломается, выделяет три ключевые области – и их осознание помогает спроектировать систему с учётом этих слабых мест.
Первая – разрыв между известным и новым. Hash-сопоставление работает идеально на контенте, который уже встречалось, и совершенно бесполезно – на том, чего раньше не виделось. Оно никогда не обнаружит совершенно новое видео, не имеющее ни одного хеша в базах – и всплеск CSAM, сгенерированного ИИ, у которого по построению нет предыдущих хешей, полностью остаётся в этом разрыве. Лечение – не отказываться от хеширования, а добавить над ним классификаторы и VLM, чтобы новому вредному контенту давался второй и третий шанс быть распознанным по содержанию, а не по отпечатку, и передавать подтверждённые новые случаи в организации, ведающие хеш-базами, чтобы завтра они уже были известны.
Вторая – ловушка контекста. Покадровый классификатор видит нож, кожу или кровь, но не может отличить преступление от кулинарного шоу, урока плавания или хирургического туториала. Полагаться только на классификаторы – значит либо переблокировать (например, убрать урок плавания), либо недоблокировать (пропустить реальный вред, который по отдельности выглядит безобидно). Решение – стадия VLM, анализирующая сцену целиком, а не отдельный кадр, и человеческая проверка на следующем этапе для случаев, которые не распознаёт даже VLM.
Третья – состязательный обход. Те, кто пытается протолкнуть вредный контент, активно стремятся обойти систему модерации: перекодируют файлы, чтобы нарушить точные хеши (что нейтрализуется перцептивным хешированием, устойчивым к таким изменениям), добавляют шум или прячут полезную нагрузку в несколько секунд иначе невинного видео (что обнаруживается при достаточно плотной выборке и анализе аудиодорожки). Полностью закрыть эту область невозможно – вы рассматриваете модерацию как состязательную, постоянно эволюционирующую систему, регулярно проверяете её на отложенном наборе тестовых случаев с известными ответами и принимаете, что это вечное противостояние, а не задача, решаемая раз и навсегда.
Рис. 5. Две ошибки несимметричны, поэтому пороги задаются по классу вреда, а наиболее тяжёлые виды вреда обрабатываются детерминированно, а не с помощью настраиваемой оценки. Три области отказа – новый контент, контекст и состязательный обход – устраняются проектированием, а не удовлетворением пожеланий.
Governance: закон, несовершеннолетние и люди в петле
UGC-конвейер модерации – одна из самых строго регулируемых систем, которые может построить инженер, и уровень управления под ней держится на трёх несущих столпах. Нижеизложенное не является юридической консультацией – это инженерный контекст, который грамотная команда обязана понимать до обращения к юристам за реальной консультацией.
Первый столп – обязательная отчётность и сохранение нелегального контента. В США федеральный закон (18 U.S. C. § 2258A) обязывает провайдеров электронных услуг сообщать о предполагаемом CSAM в NCMEC CyberTipline сразу после получения информации об этом и сохранять связанный контент и записи – срок хранения недавно был увеличен до одного года – вместо их удаления. Масштаб работы системы не абстрактен: CyberTipline получил 20,5 млн отчётов в 2024 году, в которых упоминались почти 63 млн файлов, а доля изображений, сгенерированных ИИ, выросла более чем в тринадцать раз за год. Инженерная реализация здесь конкретна и крайне чувствительна к ошибкам: если на Стадии 0 обнаруживается известный CSAM, правильное действие – заблокировать, сообщить и сохранить в хранилище, предусмотренном законом – ни в коем случае не тихое удаление, которое уничтожает улику, необходимую для расследования по защите детей, и само по себе может стать преступлением. Этот путь строится строго по опубликованной спецификации, а не по импровизации, а решение о том, что подлежит отчёту, принимается совместно с юристом, а не на code review.
Второй столп – прозрачность и защита несовершеннолетних в новых платформенных законах. Digital Services Act (DSA) Евросоюза требует, чтобы платформы давали пользователям ясное изложение причин (statement of reasons) по решениям модерации и подавали их в публичную базу прозрачности, и подкрепляет это штрафами до шести процентов глобального годового оборота для крупнейших платформ – выше 45 млн ежемесячных пользователей в ЕС. Его Статья 28 налагает конкретные обязанности по защите несовершеннолетних, с руководствами Еврокомиссии 2025 года. Online Safety Act Великобритании, чьи обязанности по illegal harms стали исполнимыми в марте 2025 года и по которому регулятор Ofcom к 2026 году открыл более двадцати расследований, требует от сервисов в охвате оценивать риск нелегального контента и действовать против него. А Статья 50 EU AI Act, применяемая с августа 2026 года, требует помечать сгенерированные и манипулированные ИИ медиа как таковые – что пересекается с этим конвейером напрямую, потому что система модерации всё чаще должна рассуждать, реально ли то, на что она смотрит, – вопрос, поднятый в уроке про C2PA и раскрытие ИИ. Инженерное следствие: audit-след и генератор изложения причин – не опциональные фичи; это то, как вы остаётесь по правильную сторону законов со штрафами масштаба оборота.
Третий столп – тот, о котором команды забывают, пока он не становится скандалом: благополучие людей-модераторов. На Стадии 3 люди вынуждены просматривать худший контент, который производит система, – и история отрасли в этом плане печальна. Документально подтверждено, что аутсорс-модераторы зачастую получают считанные доллары в час, а опросы показывают: подавляющее большинство считает, что работодатели недостаточно заботятся о их психическом здоровье. К 2026 году это уже не просто этическая проблема: глобальные трудовые организации предложили обязательные протоколы – лимиты на ежедневное воздействие травмирующего контента, отказ от нереалистичных норм по скорости, регулярную психологическую поддержку и достойную оплату. Платформы всё чаще привязывают себя к этим стандартам контрактами и репутацией.
Инженерные последствия – это реальные требования к дизайну: по умолчанию размытые и серые превью, чтобы модератор не столкнулся с полным ужасом внезапно; жёсткие лимиты на количество тяжёлого контента, который один человек может увидеть за смену; ротация с самых тяжёлых очередей и маршрутизация, использующая автоматические стадии, чтобы держать как можно больше такого контента подальше от человеческих глаз. Конвейер, который относится к модераторам как к расходному материалу, не только неправ – он всё чаще становится юридически и коммерчески опасным.
Рис. 6. Три столпа governance несут конвейер: юридическая обязанность сообщать о нелегальном контенте и сохранять его, обязательства по прозрачности и защите несовершеннолетних, установленные новыми платформенными законами, а также благополучие людей, выполняющих проверку – каждый из них представляет собой конкретное инженерное требование, а не просто политическую сноску.
Порядок сборки: каждый майлстоун защищает пользователей
Выстройте сборку так, чтобы каждый майлстоун выдавал нечто, защищающее пользователей, а не исчезал на квартал ради постройки всего конвейера до первого запуска. Пять майлстоунов по порядку.
Майлстоун один – hash-сопоставление и обязательная отчётность – Стадия 0 и юридический этаж под ней идут первыми, потому что это и самая дешёвая стадия, и та, что требует закон. Подключите системы hash-обнаружения известных угроз, реализуйте действия «заблокировать – сообщить – сохранить» и ведите audit-журнал. Уже этого достаточно, чтобы платформа стала заметно безопаснее и юридически защищённой уже в первый день.
Майлстоун два – дешёвый проход классификаторов с консервативными порогами – Стадия 1, настроенная на щедрую эскалацию, а не агрессивную очистку. Сначала вы предпочтёте отправить на проверку слишком много, а не слишком мало; вы ужесточаете пороги по мере накопления данных о надёжности классификаторов. Это стадия, превращающая конвейер из «ловит известное» в «отсматривает новое».
Майлстоун три – консоль и очередь человеческой проверки – Стадия 3 до Стадии 2, намеренно, потому что нужна точка, куда попадают эскалации, и гуманный, хорошо инструментированный инструмент проверки до того, как вы начнёте доверять VLM сокращать очередь. Строите фичи благополучия – размытые превью, лимиты воздействия, ротацию – в эту консоль с первой версии, а не задним числом.
Майлстоун четыре – VLM-стадия контекста – вторая стадия, вставленная между классификаторами и людьми, чтобы сократить очередь задач, требующих участия человека, автоматически решая контекстные вызовы. К этому моменту у вас уже есть размеченные данные с человеческой стадии, на основе которых можно оценить эффективность VLM и доказать, что она действительно помогает, а не просто надеяться на это.
Майлстоун пять – масштаб, измерение и состязательная петля – цель по пропускной способности, достигаемая на пике, отложенный оценочный набор случаев с известными ответами, который непрерывно прогоняется, настройка порогов, основанная на измеренных ценах ошибок, и обратная связь, передающая подтверждённые новые виды вреда в модерационные системы. Это майлстоун, который никогда полностью не завершается, потому что модерация – это эволюционирующее состязание, а не готовая функция.
Где здесь Фора Софт
Мы создаём продукты, которые порождают именно эту проблему. За два десятилетия развития видеоконференций, live-стриминга, OTT-платформ, приложений для знакомств и социальных сетей, e-learning и видеонаблюдения стало ясно: как только продукт позволяет пользователям публиковать видео для других, конвейер модерации перестаёт быть опциональным. Команды, запускающие такие продукты, впервые сталкиваются с hash-базами, классификаторами-API, проверкой на основе VLM, законом об обязательной отчётности и требованиями к благополучию модераторов – всё сразу, под жёсткий дедлайн. Повторяющийся инженерный процесс – это сама воронка: упорядочить стадии по стоимости, настроить пороги по уровню вреда, чтобы и расходы, и точность оставались в рамках, и построить аудит- и отчётный уровень, превращающий контент-фильтр в систему, которую примет регулятор. Паттерны этого финального этапа – те, что проявляются, когда live-shopping-, dating-, социальному или community-видеопродукту нужно быть безопасным при запуске одновременно в ЕС, Великобритании и США.
Ключевые выводы
- Модерация в масштабе – это воронка: сначала проходит недорогая проверка, на каждой стадии решение либо принимается, либо вопрос эскалируется; люди видят менее 1% контента.
- Модерируйте ключевые кадры и аудиотранскрипты, а не целые видео по минутам – именно такой подход определяет модель затрат.
- Воронка обходится примерно в девятую часть стоимости отправки каждого видео в API и при этом работает точнее.
- Hash-системы выявляют известный нелегальный контент и обязательны по закону; классификаторы и VLM обнаруживают новое.
- Пропущенное нелегальное видео и ошибочно удалённый легальный контент – это неравные ошибки; пороги следует задавать с учётом класса вреда.
- О нелегальном контенте необходимо сообщить и сохранить его, а не просто удалить; забота о благополучии модераторов – это инженерное требование.
Что почитать дальше
- Модерация контента в реальном времени в SFU – модерация живого потока на лету, синхронный аналог этого асинхронного конвейера.
- ИИ в dating, соцсетях и UGC – инженерный playbook – направление, где этот конвейер необходим с самого начала.
- Открытые VLM – LLaVA, Qwen-VL и поле – модели, используемые на стадии контекстной проверки.