Содержание статьи +
- Кратко
- Почему это важно
- Три способа преодолеть языковой барьер
- Один конвейер, три выхода
- Стадия первая: транскрипция – возьмите слова и часы
- Стадия вторая: перевод – и проблема длины, которая ломает наивные конвейеры
- Стадия третья: голос – синтетический диктор или клонированный спикер
- Авто-субтитры как надо: формат и правила скорости чтения
- Контроль качества: где каждая стадия тихо проваливается
- Закон: раскрытие голосов, доступность субтитров
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Есть три способа сделать видео понятным на другом языке – субтитры на экране, синтетический закадровый голос поверх оригинала и полный дубляж, при котором голос заменяется, а губы актёра остаются в синхроне, – и все три основаны на одном машинном конвейере: распознавание речи, перевод и последующее преобразование в текст или озвучку. Сложность никогда не в переводе, а в тайминге: немецкая фраза может быть на четверть длиннее английской, поэтому наивный конвейер выдаёт либо дубляж, ускоренный до писка, либо субтитры, мелькающие быстрее, чем их успевают прочитать. В 2026 году ИИ-дубляж стоит примерно $1–20 за минуту против $20–40 за минуту у студий с людьми – экономия около 90%, и именно поэтому функция локализации теперь включена в дорожную карту каждого видео-продукта. Этот урок строит конвейер по стадиям, решает проблему тайминга с помощью показанной арифметики, задаёт правила форматов и скорости чтения субтитров в соответствии с реальными спецификациями W3C и Netflix, а также учитывает два юридических обязательства – статью 50 EU AI Act для клонированных голосов и закон FCC/CVAA о доступности субтитров.
Почему это важно
Раньше локализация была бюджетной статьёй, утверждаемой раз в год, и поручалась подрядчику по письму; теперь это внутренняя функция продукта, за работу которой отвечает кто-то из команды. Урок предназначен для продакт-менеджера, основателя или техлида, которому нужно добавить возможность «просматривать видео на испанском» или «включать субтитры» в видеоплатформу и который хочет разобраться в деталях настолько, чтобы оценить объём работ, выбрать подрядчика и избежать сбоев, из-за которых локализованное видео окажется хуже, чем его полное отсутствие. Урок расположен ниже по цепочке от речевых уроков – урока про потоковый ASR и урока про WhisperX и диаризацию для транскрипции, урока про клонирование голоса и урока про потоковый TTS для синтеза речи – и объединяет эти компоненты в одну готовую к выпуску функцию.
Три способа преодолеть языковой барьер
Прежде чем писать код, определитесь, какой из трёх продуктов вы создаёте – они стоят по-разному, связаны с разными рисками и ориентированы на разные аудитории. Когда люди говорят: «Переведите моё видео», они имеют в виду одну из трёх совершенно разных вещей.
Самый простой вариант – субтитры: оригинальная аудиодорожка остаётся без изменений, а перевод отображается внизу экрана. Зритель слышит настоящий голос и одновременно читает смысл. Это самый дешёвый способ производства, наиболее безопасный с юридической точки зрения – ведь ни один голос не клонируется – и проще всего реализовать без ошибок. Однако он требует от зрителя умения читать, а на это не всегда способна аудитория.
Средний вариант – закадровый голос (voice-over, иногда «UN-style» или просто начитка). Синтетический диктор озвучивает перевод поверх оригинала, который приглушают (ducking), но остаётся едва различимым на заднем плане. Зритель слышит новый язык без необходимости читать, а губы на экране больше не синхронизированы – но для документальных фильмов, новостей, обучающих и объяснительных видео это не вызывает проблем, ведь речь героя изначально не была главным элементом.
Самое тяжёлое – полный дубляж: оригинальный голос убирают и заменяют переведённым, в идеале – клонированным под исходного спикера, и в идеале – с точным таймингом и попаданием в губы. Это вариант кинокачества. Он дороже всех, ошибается чаще всех и единственный вызывает юридические риски, потому что клонированный голос реального человека – это дипфейк.
Ошибка, которую часто допускают команды, – стремление к полному дубляжу по умолчанию, ведь он звучит эффектнее всего. Однако субтитры или закадровое озвучивание могли бы лучше удовлетворить аудиторию при значительно меньших затратах и рисках. Выбирайте самый простой способ, который решает задачу.
Один конвейер, три выхода
Вот идея, которая объединяет всё нижеследующее: все три режима проходят через одну и ту же начальную часть конвейера, а затем расходятся. Общая начальная часть отвечает на два вопроса – что было сказано и что это значит на целевом языке – и оба ответа необходимы каждому режиму. Различие между режимами – только в способе доставки ответа: текстом на экране, голосом поверх или голосом-заменой.
Пройдёмся по стадиям слева направо. Приходит видео. Транскрипция превращает речь в текст с таймкодом для каждого слова и указанием, кто говорил. Перевод преобразует этот текст на целевой язык, стараясь сохранить исходную длительность. Далее конвейер разветвляется. Для субтитров на стадии вёрстки перевод разбивается на экранные реплики (cue), соответствующие правилам скорости чтения, и формируется файл субтитров. Для закадрового озвучивания и дубляжа на стадии синтеза речи перевод превращается в аудио с помощью модели text-to-speech или клонирования голоса, на стадии тайминга аудио растягивается или переформулируется под исходную длительность, опциональная стадия lip-sync корректирует движение губ, а стадия мукса возвращает новую аудиодорожку к видео.
Видеть это как единый конвейер выгодно с практической точки зрения: дорогая и требующая высокой точности работа – распознавание и перевод – общая для всех трёх продуктов, поэтому её создают один раз и используют повторно. Дешёвая на первый взгляд, но легко недооцениваемая задача – тайминг – это то место, где каждый режим либо преуспевает, либо терпит неудачу.
Стадия первая: транскрипция – возьмите слова и часы
Конвейер начинается с преобразования речи в текст – задача модели автоматического распознавания речи, программы, которая анализирует аудио и записывает слова, сокращённо ASR. В 2026 году доминирующей открытой моделью является OpenAI Whisper и её продакшн-обёртка WhisperX, о которой мы подробно рассказываем в уроке про WhisperX; управляемые сервисы вроде Deepgram и AssemblyAI выполняют ту же работу, и мы сравниваем их в уроке про потоковый ASR.
Для локализации ASR должен выдавать не одну, а три вещи. Очевидный результат – слова. Два других, о которых часто забывают, – часы и состав. «Часы» – это таймкод каждого слова: момент начала и окончания. Без них и субтитры, и дубляж невозможно корректно привязать ко времени, а транскрипт без временных меток становится бесполезным для обеих задач. «Состав» – это метка спикера: «эту фразу сказала Anna, ту – Boris». Её обеспечивает этап под названием диаризация, и он особенно важен, когда в видео выступает более одного человека, ведь для дубляжа нужен отдельный клонированный голос на каждого из них.
Качество этой стадии измеряют частотой ошибок по словам, сокращённо WER (word error rate) – она показывает количество ошибок на сто слов. Формула суммирует три вида ошибок и делит их на количество фактически произнесённых слов:
WER = (замены + пропуски + вставки) / слов_в_эталонеЕсли в клипе из 100 слов обнаружено 3 ошибочных, 1 пропущенное и 1 выдуманное слово, арифметика такова:
WER = (3 + 1 + 1) / 100 = 0.05 = 5%5% ошибок в распознавании слов – цифра небольшая, но каждая из них накапливается: неправильно услышанное слово переводят с ошибкой, а затем уверенно произносят на иностранном языке. Стадия транскрипции – это момент, когда ошибки проще всего исправить и дороже всего игнорировать; поэтому в серьёзных системах человеку дают возможность отредактировать текст до перевода, особенно когда речь идёт об именах собственных и жаргоне, с которым модель ранее не сталкивалась.
Стадия вторая: перевод – и проблема длины, которая ломает наивные конвейеры
Перевод – стадия, которую все считают сложной, и с которой современные модели в целом справляются хорошо. Проблема в другом: в длине. Языки используют разное количество слогов для передачи одной и той же мысли. Фраза, которую на английском произносят за три секунды, на немецком или испанском займёт три с четвертью – увеличение продолжительности перевода на 20–30% для таких языковых пар считается нормальным. Перевод точен; просто он не укладывается во временной интервал, затраченный исходным говорящим.
Для субтитров это означает, что реплика, рассчитанная на три секунды, теперь содержит больше текста, чем зритель успевает прочитать за это время. Для дубляжа ситуация ещё хуже: синтетический голос вынужден уместить более длинную фразу в тот же временной интервал, поэтому либо ускоряется – получается тот самый «писклявый» дубляж, с которым все сталкивались и который все ненавидят, – либо выходит за рамки и перекрывает следующую строку.
Инженерный термин для этой цели – изохрония (isochrony): переведённая речь должна быть синхронизирована по времени с оригиналом, совпадая не только по общей продолжительности, но и по паузам, а для lip-sync – и по движениям губ. Для достижения этого существует два способа, и качественные конвейеры используют оба.
Первый – перевод с контролем длины: попросить модель выдать не просто точный, а близкий по длине к целевой перевод, измеренной в символах или оценочной длительности произношения. Исследовательские системы вроде isochrony-aware machine translation и VideoDubber закладывают требование по длительности прямо в процесс перевода, поэтому модель выбирает более короткий синоним вместо более длинного, если оба варианта корректны. Второй – ограниченное растяжение во времени: после генерации голоса аудио растягивают или сжимают под нужный временной слот, но только в узком диапазоне – за пределами примерно ±10–15% человеческое ухо начинает замечать искажения. Если и после этих шагов перевод остаётся слишком длинным, конвейер сокращает формулировку, а не ускоряет речь до неестественного темпа.
Качество перевода оценивают двумя способами. Старый стандарт – BLEU, который подсчитывает, сколько последовательностей слов совпадает между машинным переводом и человеческим эталоном: он быстр и дешёв, но грубоват. Стандарт 2026 года для любых серьёзных задач – COMET, нейронная метрика, обученная предсказывать человеческие оценки качества и коррелирующая с ними гораздо лучше, чем BLEU. Используйте BLEU для быстрой проверки регрессий, а COMET – для полноценного контроля качества.
Стадия третья: голос – синтетический диктор или клонированный спикер
Когда перевод готов, вы превращаете его в звук. Существует два пути, и выбор имеет как качественное, так и юридическое значение.
Простой путь – text-to-speech, или TTS, – это программа, которая озвучивает текст обобщённым, но естественным голосом из своей библиотеки. Такой подход подходит для закадрового озвучания: диктор документального фильма, ведущий обучающего курса, диктор новостей. Поскольку реальный голос конкретного человека не копируется, вопрос согласия не возникает. Мы сравниваем производственные движки TTS – ElevenLabs, Kokoro, Cartesia, OpenAI – в уроке про потоковый TTS.
Более сложный путь – клонирование голоса – заключается в захвате тембра и ритма исходного спикера по короткому образцу, чтобы дубляж звучал так, будто это он говорит на новом языке. Именно это делает полный дубляж естественным на слух, а также превращает результат в дипфейк реального человека, что влечёт за собой обязательства по согласию и раскрытию информации. Мы подробно разбираем механику клонирования и подход к инженерии согласия в уроке про клонирование голоса.
Качество голоса оценивают по средней экспертной оценке (MOS – mean opinion score), которая представляет собой среднюю оценку, выставляемую слушателями синтетической речи по пятибалльной шкале от одного до пяти. Этот субъективный метод стандартизирован в Рекомендации ITU-T P.800. MOS около 4,0 – примерная граница, выше которой большинство слушателей перестают замечать искусственность голоса при озвучивании текста. Однако синхронный с движениями губ диалог оценивается строже, поскольку зритель одновременно видит рот говорящего.
Инструменты, которые делают всё «от и до», в 2026 году активно конкурируют. ElevenLabs Dubbing поддерживает более 90 языков и тарифицирует каждый целевой язык отдельно – в Dubbing Studio можно редактировать транскрипцию, переназначать дикторов и перегенерировать отдельные фрагменты. HeyGen Video Translate охватывает 175+ языков с синхронизацией губ и предлагает фиксированную ставку за минуту на тарифе для авторов. Rask AI поддерживает более 130 языков и работает по поминутной модели, но стоимость растёт с увеличением объёма. Google Aloud, встроенный в YouTube Studio, дублирует ограниченный набор языковых пар бесплатно, однако без эмоций и синхронизации губ. Правильный выбор зависит от нужного языкового покрытия, необходимости lip-sync и того, как поминутная оплата ложится на ваш объём – та же логика юнит-экономики, что мы разбираем в уроке про стоимость.
Авто-субтитры как надо: формат и правила скорости чтения
Субтитры могут показаться простым делом, но сделать их неправильно – проще простого. Хорошие субтитры подчиняются двум правилам: формату файла, который поддерживает плеер, и правилам тайминга, позволяющим человеку реально читать текст.
Выберите правильный формат
Есть четыре формата, которые важны и не взаимозаменяемы. Таблица ниже – это решение, собранное в одном месте.
| Формат | Что это | Где используется | Стилизация | Статус стандарта |
|---|---|---|---|---|
| SRT (SubRip) | Простой текст: номер, таймкод, строка | Окна загрузки, YouTube, монтажки | Нет | Только де-факто; нет спецификации |
| WebVTT | Веб-наследник SRT, .vtt | Браузеры (HTML <track>), HLS, DASH | Позиционирование, базовый CSS | W3C Candidate Recommendation |
| TTML | XML timed-text, broadcast-авторинг | TV-обмен, мастеринг | Богатая (XML + CSS-like) | W3C Recommendation |
| IMSC1 | Ограниченный профиль TTML для доставки | Broadcast/OTT в fMP4/CMAF | Цвет, позиция, ruby на реплику | W3C Recommendation |
На практике: принимайте SRT на входе – он есть у всех; отдавайте WebVTT для веба и адаптивного стриминга; отдавайте IMSC1 – broadcast-профиль, переносимый внутри фрагментированных сегментов MP4, W3C Recommendation с 2018 года, – когда выпускаете контент на OTT или телеплатформы. Взаимодействие субтитров и форматов в стриминговом стеке мы разбираем в статье про субтитры и мультиаудио в разделе Streaming.
Подчинитесь арифметике скорости чтения
Субтитр, технически правильный, но появляющийся на экране слишком кратко, – это неудачный субтитр. Индустрия устанавливает такие ограничения через норму скорости чтения, измеряемую в символах в секунду (CPS, characters per second), а также задаёт пределы по длине строки и длительности отображения. Широко используемый Netflix Timed Text Style Guide устанавливает для большинства языков максимальное значение около 17 CPS для взрослого контента и 13 CPS – для детского, не более двух строк на реплику, не более 42 символов в строке, минимальную длительность – пять шестых секунды и максимальную – семь секунд.
Превратите лимит скорости чтения в правило, управляющее нарезкой реплик. Если реплика отображается на экране три секунды, а ваш лимит – 17 символов в секунду, то максимальное количество символов, которое она может содержать:
макс. символов = 3.0 с × 17 CPS = 51 символЗначит, строка из 80 символов не может уместиться в трёхсекундную реплику: конвейер либо должен разбить её на две реплики, либо продлить длительность. Если речь длилась ровно три секунды, разбиение – единственный честный вариант. Это арифметика, которую стадия автосубтитров применяет к каждой реплике: берётся текст и таймкоды из ASR, слова группируются в реплики, а затем строки разделяются, пока каждая не пройдёт проверки по CPS, количеству строк, длине строки и длительности. Пропустите этот этап – и получите автосубтитры, которые все видели: стену текста, исчезающую раньше, чем её успевают прочитать.
«Частая ошибка: выпускать сырой транскрипт ASR как субтитры. Самая распространённая ошибка при локализации – взять транскрипт с таймкодами прямо из речевой модели и сохранить его как SRT. Результат нарушает все правила читаемости сразу: реплики слишком длинные, слишком быстрые, разбиты не в тех местах и обрезаны посреди фразы. ASR даёт вам слова и временные метки, но не субтитры. Этап верстки, на котором одно превращается в другое – с соблюдением CPS, максимум двух строк, 42 символов на строку и разрывов по границам предложений, – это не дополнительная полировка. Это разница между просто текстом и читаемыми субтитрами, и именно эту работу пропускают дешёвые функции «авто-субтитров».»
Контроль качества: где каждая стадия тихо проваливается
Каждая стадия этого конвейера может завершиться неудачно так, что машина сочтёт результат корректным, а человек – нет. Поэтому функциям локализации необходим автоматический контроль качества с чёткими метриками на каждом этапе – та же дисциплина «падать закрыто», о которой мы говорим в уроке про контроли генеративного видео. Установите верхний порог WER для транскрипции, нижний порог COMET для перевода, проверку скорости чтения для каждой реплики субтитров и оценку MOS или соответствие длительности для сгенерированного аудио. Если клип не проходит пороговые значения – отправляйте его на ручную проверку, а не в финальный выпуск. Ведь уверенно неправильный дубляж на языке, который ваша команда не понимает, остаётся для вас незаметным, но очевиден вашей аудитории. Самая доступная страховка – двуязычная выборочная проверка человеком, объём которой зависит от вашего уровня допустимого риска. В регулируемых сферах, таких как телемедицина или e-learning, требуется полный просмотр всей выборки.
Закон: раскрытие голосов, доступность субтитров
Этот конвейер регулируется двумя разными правовыми системами, и они действуют в противоположных направлениях – одна требует сообщить людям, что это синтетика, другая – обеспечить доступность для всех.
Клонированные голоса нужно раскрывать
Дубляж, клонирующий голос реального человека, создаёт синтетическое аудио – аудио-дипфейк. С 2 августа 2026 года статья 50 EU AI Act вводит два требования, применимые к таким системам. Провайдеры систем, генерирующих синтетическое аудио, обязаны помечать результат как искусственный в машиночитаемой форме. Деплойеры, создающие дипфейки – контент с участием реального человека, который может быть воспринят как подлинный, – должны информировать зрителей о его искусственном происхождении. Нарушение этих правил прозрачности влечёт штрафы до 15 миллионов евро или 3% мирового годового оборота компании.
Практическая реализация следует тому же трёхуровневому подходу, что и в случае генеративного видео: машиночитаемая метка, запись согласия и видимая метка. Процесс начинается до генерации – с получения разрешения от исходного спикера на клонирование его голоса, которое необходимо зафиксировать. Подробности этой дисциплины мы описываем в уроке про клонирование голоса и согласие. Обычный TTS-закадр не требует таких мер, поскольку не имитирует конкретного реального человека – ещё одна причина использовать самый простой рабочий режим.
Субтитры – это обязательство по обеспечению доступности
Пока закон о раскрытии регулирует синтетические голоса, закон о доступности – субтитры и подписи, и он действует дольше и применяется лучше. В США FCC устанавливает четыре стандарта качества для закрытых субтитров на охваченных видео: точность (подписи соответствуют словам и передают интонацию), синхронность (они совпадают с аудио и остаются читаемыми), полнота (охватывают всё видео от начала до конца) и размещение (не перекрывают лица или текст на экране). Закон о коммуникациях и доступности видео XXI века (CVAA) распространяет эти требования на онлайн-видео, ранее выходившее в эфир, требуя, чтобы субтитры были «как минимум такого же качества», как в эфире. Руководство по доступности веб-контента (WCAG) рассматривает субтитры для заранее записанных видео как базовое требование к доступному сайту. Значение для вашего конвейера: правила скорости чтения и размещения – это не просто профессиональные рекомендации, а измеримое ядро юридического стандарта. Функция автоматических субтитров, игнорирующая их, может нарушить соответствие так же, как и плохая читаемость.
Где здесь Фора Софт
Мы разрабатываем видеопродукты, в которых изначально заложены функции локализации – видеоконференции, OTT- и интернет-телевизионные платформы, системы электронного обучения и телемедицинские приложения – и интегрируем эти конвейеры задолго до появления ИИ-решений. Когда клиент хочет свои e-learning-курсы на восьми языках, или OTT-каталог с субтитрами по стандартам вещания, или конференц-продукт с живыми субтитрами в реальном времени, модель – это лишь лёгкая часть задачи; основная работа – подгонка тайминга, адаптация субтитров с учётом скорости чтения, дубляж с учётом особенностей спикеров, а также обеспечение слоёв раскрытия и доступности, которые делают продукт законным на каждом рынке. Мы рассматриваем выбор между субтитрами, закадровым переводом и полным дубляжом как продуктовое решение, принимаемое с учётом вертикальной специфики и бюджета, а не как стандарт по умолчанию – ведь в регулируемых отраслях самый простой совместимый режим зачастую и есть правильный.
Ключевые выводы
- Локализация – это три продукта (субтитры, закадровое озвучивание, дубляж), объединённые на одном конвейере.
- Общая начальная часть – транскрипция и перевод; различаются только этапы доставки.
- Сложность заключается не в переводе, а в тайминге: целевой текст становится длиннее, и его нужно уместить в те же временные рамки.
- Изохрония достигается за счёт контроля длины перевода и последующего растяжения на ±10–15%.
- Автоматические субтитры подчиняются арифметике скорости чтения: 3 секунды × 17 символов в секунду = максимум 51 символ.
- Использование клонированных голосов может повлечь раскрытие по статье 50 EU AI Act; субтитры регулируются законами FCC/CVAA.