Содержание статьи +
- Коротко
- Почему это важно
- Задача в одном предложении
- Четыре типа дорожек, которые вы реально отгрузите
- Как HLS маркирует звуковые дорожки
- Как DASH маркирует звуковые дорожки
- Два способа доставки тифлокомментария: broadcast-микс и receiver-микс
- Что на самом деле требует закон
- Сурдоперевод: визуальная дорожка доступности
- Арифметика хранения и CDN
- Частая ошибка: рассинхрон языкового тега
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Опубликовано: 2026-06-06 · Время чтения: 21 мин · Автор: Николай Сапунов, CEO Фора Софт
Коротко
Один и тот же фильм в стриминге может содержать сразу несколько звуковых дорожек – оригинал, несколько дубляжей и отдельную дорожку с описанием изображения для незрячих зрителей – а плеер выбирает одну из них на основе меток, которые вы указали для каждой дорожки в манифесте. В HLS эти метки находятся в теге EXT-X-MEDIA (язык, название, дорожка по умолчанию, автовыбор и признак доступности), в DASH – в элементе AdaptationSet с дескриптором Role, значения которого включают main, alternate, dub, commentary и description. Правильные метки теперь – не просто вопрос качества, но и закон: США требуют 87,5 часа описанного контента в квартал от крупных сетей, а европейский Закон о доступности (EAA) с июня 2025 года делает доступное аудио обязательным для стриминговых сервисов. Эта статья рассказывает, как готовить аудиодорожки, чем отличаются две модели тифлокомментирования (broadcast-микс и receiver-микс) и как рассчитать стоимость «налога на многодорожечность».
Почему это важно
Если вы разрабатываете стриминговый продукт, конвейер локализации или OTT-платформу, аудио – это та часть задачи «выпусти это на семи языках», где мелкие ошибки в тегах могут привести к неправильной дорожке у зрителя, провалу аудита доступности или письму от регулятора. Продакт-менеджер, планирующий локализацию, операционный лидер, утверждающий спецификацию доставки, и инженер, собирающий манифест, – все работают с одним и тем же набором тегов. Правила для этих тегов задают стриминговые стандарты (HLS и DASH) и законы о доступности (американский CVAA, европейский EAA). Эта статья простым языком объясняет, что представляет собой каждый тип дорожки, показывает точную разметку в манифесте, которая заставит плеер выбрать её правильно, и даёт расчёт объёма хранения, чтобы «налог на многодорожечность» стал предсказуемой статьёй расходов, а не сюрпризом в облачном счёте.
Задача в одном предложении
Одно видео – много звуковых дорожек. Фильм, снятый на английском, может выходить с оригинальным английским звуковым сопровождением, французским дубляжом, испанским дубляжом, немецким дубляжом – и отдельно с английской дорожкой, описывающей происходящее на экране для зрителей, не видящих изображение. Изображение остаётся одинаковым для всех. Меняется только звук. Задача стриминговой системы – сохранить все эти дорожки один раз, доставлять только ту, что выбрана зрителем, и переключаться между ними без повторной загрузки видео.
Последний пункт – и есть причина, по которой всё работает. В современных адаптивных потоках видео и аудио хранятся в отдельных файлах, а плеер объединяет их в процессе воспроизведения. (Если идея разделения аудио и видео на независимые дорожки внутри контейнера для вас нова, разбор «как MP4, MKV, fMP4 и MPEG-TS несут звук» поможет разобраться в механике.) Поскольку аудиодорожка независима, добавление десятого языка требует лишь одного дополнительного небольшого звукового файла – а не десятой полной копии фильма.
Проблема в том, что плееру нужно сообщить, что представляет собой каждый звуковой файл: какой из них французский, какой – оригинальный, какой – описанный, и какой воспроизводить по умолчанию, если зритель не указал своих предпочтений. Эти инструкции хранятся в текстовом файле – манифесте, – и остальная часть статьи посвящена тому, как его правильно составить.
Четыре типа дорожек, которые вы реально отгрузите
Перед разметкой – словарь. В реальных каталогах встречается четыре вида звуковых дорожек, и три из них легко спутать, потому что выглядят как «ещё один язык».
Дорожка языка оригинала – это звук в том виде, в каком он присутствует в оригинальном произведении: английский для голливудского фильма, корейский для корейской дорамы. Это эталон, по которому оценивается всё остальное.
Дубляж – это полная замена звуковой дорожки на другом языке, при которой переведённые реплики накладываются поверх оригинальной музыки и звуковых эффектов. Французский зритель английского фильма слышит французских актёров, но те же самые взрывы и ту же музыку. Дубляж представляет собой готовый, самостоятельный микс: плеер воспроизводит всю дорожку целиком, не накладывая ничего дополнительно.
Дорожка тифлокомментария – в Европе её называют audio description (AD), в Северной Америке – described video service (DVS) – это звуковая дорожка для незрячих и слабовидящих зрителей. Диктор добавляет описания происходящего на экране в паузах между диалогами поверх обычной звуковой дорожки: «Она прячет письмо во внутренний карман пальто и выходит под дождь». Это отдельная, законченная дорожка, а не опция обычной.
Дорожка сурдоперевода – здесь всё иначе, потому что «звуковая» потребность в доступности на самом деле визуальная: сурдопереводчик передаёт реплики с помощью жестов. В стриминге она обычно идёт как дополнительная видеодорожка (небольшая врезка с переводчиком), а не как аудиодорожка – где именно её размещать, мы рассмотрим в конце. Мы включаем её сюда, потому что продуктовые команды часто группируют её с «доступными аудиоверсиями», хотя техническая реализация отличается.
Почему различие важно: дубляж и описанная дорожка могут оба быть «английским аудиофайлом», но плеер не должен их путать. Зрячий французский зритель хочет французский дубляж; незрячий английский зритель – английскую описанную дорожку. Ни один из них не хочет то, что нужно другому. Метки в манифесте – это то, что их разделяет.
Как HLS маркирует звуковые дорожки
HLS – HTTP Live Streaming, стриминговый формат Apple – описывает альтернативное аудио с помощью тега EXT-X-MEDIA. Одна строка EXT-X-MEDIA объявляет одну аудиодорожку, а группа таких строк с одинаковым значением GROUP-ID сообщает плееру: «вот варианты звука для этого видео». Плеер воспроизводит ровно один из них одновременно с видео.
Атрибуты, определяющие выбор, указаны в спецификации HLS – IETF RFC 8216, раздел 4.3.4.1. Вот те, что важны для многоязычности и доступности.
LANGUAGE несёт языковой тег вроде en, fr или es. NAME – это человекочитаемая подпись, которую видит пользователь в меню звука: «Français», «English (described)», – и RFC 8216 делает NAME обязательным атрибутом каждой дорожки. DEFAULT – перечислимое значение «да/нет»; когда оно YES, спецификация говорит, что клиент «SHOULD play this Rendition … in the absence of information from the user indicating a different choice» – то есть это дорожка, которая играет, если зритель ничего не выбрал.
AUTOSELECT тоньше. Когда оно YES, клиент «MAY choose to play this Rendition in the absence of explicit user preference because it matches the current playback environment, such as chosen system language». Так французский зритель, у которого язык устройства французский, может автоматически попасть на французский дубляж – но только если вы пометили эту дорожку AUTOSELECT=YES. RFC 8216 добавляет правило, которое стоит запомнить: «If the AUTOSELECT attribute is present, its value MUST be YES if the value of the DEFAULT attribute is YES». Дорожка по умолчанию по определению автовыбираема.
Признак доступности – это CHARACTERISTICS. Это список идентификаторов, разделённых запятыми, и для аудио важен public.accessibility.describes-video. RFC 8216 прямо указывает: «An AUDIO Rendition MAY include the following characteristic: 'public.accessibility.describes-video'». Именно эта одна строка позволяет плееру и инструментам аудита доступности распознавать вашу английскую описанную дорожку как тифлокомментарий, а не как второй английский дубляж.
Вот минимальная HLS-группа аудио с оригиналом, дубляжом и описанной дорожкой:
#EXT-X-MEDIA:TYPE=AUDIO,GROUP-ID="aud",LANGUAGE="en",NAME="English",DEFAULT=YES,AUTOSELECT=YES,URI="en/audio.m3u8"
#EXT-X-MEDIA:TYPE=AUDIO,GROUP-ID="aud",LANGUAGE="fr",NAME="Français",DEFAULT=NO,AUTOSELECT=YES,URI="fr/audio.m3u8"
#EXT-X-MEDIA:TYPE=AUDIO,GROUP-ID="aud",LANGUAGE="en",NAME="English (described)",DEFAULT=NO,AUTOSELECT=NO,CHARACTERISTICS="public.accessibility.describes-video",URI="en-ad/audio.m3u8"Читайте это как три предложения. Первая дорожка – английская, она по умолчанию и выбирается автоматически. Вторая – французская, не по умолчанию, но автоматически выбирается на устройствах с французским языком. Третья – английская, никогда не по умолчанию, никогда не выбирается автоматически – воспроизводится только по явному запросу зрителя – и помечена как тифлокомментарий. Обратите внимание на здравое правило, заложенное в стандарт: атрибут FORCED, обозначающий обязательный контент, может использоваться только для дорожек субтитров, но не для аудио – RFC 8216 гласит: «The FORCED attribute MUST NOT be present unless the TYPE is SUBTITLES».
Частая ошибка – оставить у описанной дорожки AUTOSELECT=YES включённой по умолчанию. Устройство с французским языком и отключённым тифлокомментарием может в таком случае автоматически выбрать английскую описанную дорожку поверх французского дубляжа, и зритель услышит комментарий, которого не просил. Описанные дорожки AUTOSELECT=NO следует помечать и показывать только тогда, когда пользователь включил тифлокомментарий.
Как DASH маркирует звуковые дорожки
DASH – Dynamic Adaptive Streaming over HTTP, стандарт ISO/IEC 23009-1 – использует иную, но параллельную структуру. Каждая независимая звуковая версия представляет собой AdaptationSet, а назначение этого набора указывается дескриптором Role. Значения ролей берутся из опубликованного списка – схемы urn:mpeg:dash:role:2011, определённой в ISO/IEC 23009-1 и расширенной в руководствах DASH-IF (Part 8: Audio).
Значения ролей для многоязычности и доступности: main (основная, полностью воспроизводимая дорожка), alternate (другая полностью воспроизводимая дорожка, например дубляж), dub (дорожка, явно помеченная как переведённая или дублированная), commentary (дорожка, предназначенная для сведения с другой – например, авторский комментарий или receiver-mix-тифлокомментарий) и description (дорожка, описывающая видео для целей доступности). Элемент <Label> содержит человекочитаемое имя для меню, а атрибут lang на AdaptationSet указывает язык.
Руководство DASH-IF чётко различает случаи, когда дорожка main/alternate, а когда commentary. Если набор адаптации представляет собой полную звуковую службу для прямого воспроизведения, его роль – main или alternate. Если же его необходимо декодировать и смешивать с другой полной службой перед воспроизведением – паттерн receiver-mix, который мы объясним далее, – его роль – commentary. Роль description определяет, как плеер отличает описанную дорожку от обычного дубляжа, когда обе дорожки представлены на одном языке.
Урезанный DASH-манифест с оригиналом, французским дубляжом и английским тифлокомментарием выглядит следующим образом:
<AdaptationSet contentType="audio" lang="en">
<Role schemeIdUri="urn:mpeg:dash:role:2011" value="main"/>
<Label>English</Label>
<!-- representations … -->
</AdaptationSet>
<AdaptationSet contentType="audio" lang="fr">
<Role schemeIdUri="urn:mpeg:dash:role:2011" value="dub"/>
<Label>Français</Label>
</AdaptationSet>
<AdaptationSet contentType="audio" lang="en">
<Role schemeIdUri="urn:mpeg:dash:role:2011" value="description"/>
<Accessibility schemeIdUri="urn:tva:metadata:cs:AudioPurposeCS:2007" value="1"/>
<Label>English (described)</Label>
</AdaptationSet>Структура полностью повторяет HLS: дорожка main, дубляж, помеченный как дубляж, и тифлокомментарий с ролью description и дополнительным дескриптором Accessibility (значение 1 в стандартной схеме TV-Anytime означает «для слабовидящих, с описанием»). Если вы публикуете DASH-поток, межсекционный разбор «структура манифеста MPEG-DASH» подробно рассматривает периоды, наборы адаптации и представления.
Два способа доставки тифлокомментария: broadcast-микс и receiver-микс
Тифлокомментарий бывает двух форматов, и выбор формата влияет как на стоимость хранения, так и на совместимость с плеерами.
В модели broadcast-mix комментарий уже смешан со всей дорожкой на студии. Вы отдаёте готовый автономный файл: реплики, музыка, звуковые эффекты и комментарий – всё сведено воедино. Плеер работает с ним так же, как с дубляжом – это просто ещё одна законченная аудиодорожка для замены. Эту модель использует HLS, и она самая простая: любой плеер, способный переключать аудио, воспроизведёт её, потому что при декодировании не требуется ничего особенного. Платой становится объём хранения. 90-минутный фильм, предлагающий комментарий на пяти языках, хранит пять дополнительных полных дорожек.
В модели receiver-mix вы передаёте только комментарий – тонкую дорожку голоса диктора и тишины – плюс инструкции, как громкость этой дорожки смешивать с основной. Плеер декодирует два потока и объединяет их в реальном времени. Хранить такой формат значительно дешевле, поскольку дорожка комментария в основном состоит из тишины без музыки и эффектов, а зритель может отдельно регулировать её громкость. DASH поддерживает это через роль commentary и отдельную разметку receiver-mix; такой подход распространён в европейском вещании (DVB) и системах цифрового телевидения. Минус – требования к плееру: устройство должно уметь одновременно декодировать и смешивать два потока, а не каждая веб- или ТВ-платформа способна на это.
Практическое правило: если ваш охват включает браузеры и широкий спектр смарт-ТВ, то broadcast-mix-дорожки тифлокомментария – безопасный выбор по умолчанию, поскольку от плеера не требуется ничего особенного. Если вы контролируете плеер, а ключевую роль играет стоимость хранения – много титров, много языков – то receiver-mix оказывается эффективнее. Крупные каталоги вроде Netflix поддерживают оба паттерна в зависимости от территории и устройства.
Что на самом деле требует закон
Доступное аудио не является опциональным на двух крупнейших медиарынках. Детали важны, поскольку соответствие оценивается конкретными числами и точными датами.
В США тифлокомментарий регулируется Законом о доступности связи и видео XXI века (CVAA), который Федеральный комитет по связи (FCC) реализовал через правило 47 CFR 79.3. Крупные вещательные сети (ABC, CBS, Fox, NBC) и крупные кабельные и спутниковые операторы обязаны предоставлять 87,5 часа описанного контента в календарный квартал – примерно семь часов в неделю, из которых не менее 50 часов должны приходиться на прайм-тайм или детские программы. Географический охват правила постепенно расширяется: с 1 января 2026 года оно будет распространяться на телерынки с 111-го по 120-й, а далее – на десять рынков в год. Для невещающихся сетей FCC ежегодно определяет топ-5 каналов; текущий список (утверждён 1 июля 2024 года) включает TLC, HGTV, Hallmark, TNT и TBS, причём TNT и TBS имеют ограниченное освобождение до 30 июня 2027 года.
В Европе Закон о доступности (EAA) вступил в силу 28 июня 2025 года. Он делает функции доступности – включая тифлокомментарий, где это применимо, – обязательными для широкого круга цифровых услуг, в том числе для аудиовизуальных медиауслуг. Технической основой является гармонизированный стандарт EN 301 549, основанный на Рекомендациях по доступности веб-контента (WCAG). EAA действует в согласии с Директивой об аудиовизуальных медиауслугах (AVMSD), которая обязывает страны-участники поощрять провайдеров постепенно обеспечивать доступность контента с помощью субтитров, тифлокомментария и сурдоперевода. EAA предусматривает переходный период для ранее опубликованного контента, однако новые каталоги по запросу должны соответствовать требованиям с момента их появления.
Сами рекомендации по доступности проводят чёткую грань. Согласно WCAG, тифлокомментарий для записанного видео – это требование уровня AA (критерий 1.2.5), на которое ориентированы большинство законов. Сурдоперевод для записанного аудио – критерий 1.2.6 уровня AAA, относящийся к желаемым, но не обязательным. Именно эта разница объясняет, почему тифлокомментарий рассматривается как базовая юридическая обязанность, а сурдоперевод чаще остаётся дополнительной ценностью.
Практическое следствие для инженерии: описанные дорожки – не «приятное дополнение», которое добавляют потом. Если ваш каталог обслуживает США или ЕС, описанная дорожка и её правильная разметка в манифесте – часть спецификации доставки, и аудит доступности проверит, что HLS public.accessibility.describes-video или роль DASH description и дескриптор назначения аудио действительно присутствуют и выставлены верно.
Сурдоперевод: визуальная дорожка доступности
Сурдоперевод при планировании продукта объединяют с доступным аудио, но с технической точки зрения это задача видео. Переводчик передаёт реплики с помощью жестов, поэтому контент для доступности – это движущееся изображение, а не звук.
Доставить его можно двумя способами. Проще – открытый сурдоперевод: переводчик появляется в небольшой врезке внутри основного видео – в окне «картинка в картинке», обычно в нижнем углу, иногда смещённом, чтобы не перекрывать текст на экране. Его видят все, и отключить нельзя. Гибче – закрытый сурдоперевод: переводчик передаётся отдельной переключаемой видеодорожкой (в DASH – отдельный видео-AdaptationSet, часто с ролью sign), которую плеер может показать или скрыть, а в идеале – развернуть на весь экран по запросу. Оба подхода работают со стандартными плеерами HLS и DASH; закрытый вариант предпочтительнее, потому что не навязывает врезку тем, кому она не нужна.
Причина, по которой это уровень AAA, а не AA, – в стоимости и меньшей охвате аудитории, но инженерный паттерн стоит знать: когда продуктовая команда просит «поддержку сурдоперевода», она на самом деле просит не просто дополнительную аудиодорожку, а отдельное видеопредставление и элемент интерфейса плеера для его включения.
Арифметика хранения и CDN
Каждая лишняя дорожка требует дополнительных байтов на хранение и на доставку. Арифметика проста: проделав её один раз, вы избавляетесь от страха, что десять языков «взорвут» счёт.
Возьмём 90-минутный фильм. Битрейт аудио измеряется в килобитах в секунду (kbps) – то есть в тысячах битов за секунду. Стереодубляж при типичном стриминговом битрейте 128 kbps рассчитывается так:
размер (бит) = битрейт (бит/с) × длительность (с)
= 128 000 × (90 × 60)
= 128 000 × 5400
= 691 200 000 бит
размер (байт) = 691 200 000 ÷ 8
≈ 86 400 000 байт
≈ 86 МБЗначит, одна стереодорожка языка для 90-минутного фильма – около 86 МБ. Отгрузите восемь языков дубляжа – и получите примерно 8 × 86 МБ ≈ 691 МБ, то есть меньше трёх четвертей гигабайта. Теперь сравните с видео. Одно представление 1080p того же фильма, скажем, при скорости 5 Мбит/с (5000 кбит/с):
5 000 000 × 5400 ÷ 8 ≈ 3 375 000 000 байт ≈ 3,4 ГБОдно только представление 1080p занимает около 3,4 ГБ. Восемь дополнительных языковых дорожек вместе (≈ 0,69 ГБ) составляют примерно пятую часть одного видеопредставления – а реальная адаптивная лестница хранит несколько видеопредставлений, так что аудио занимает малую долю общего объёма. Ключевая мысль: языки аудио дёшевы относительно видео. Описанная broadcast-микс-дорожка стоит те же ~86 МБ, что и дубляж; receiver-микс-дорожка комментария, в основном состоящая из тишины, часто сжимается до доли этого объёма.
Исключение – иммерсивное аудио. Дорожка Dolby Atmos для того же фильма при стриминговом битрейте около 768 кбит/с – примерно:
768 000 × 5400 ÷ 8 ≈ 518 400 000 байт ≈ 518 МБОдин язык Atmos примерно эквивалентен шести стереоязыкам. Предложение Atmos на восьми языках (около 4,1 ГБ) уже сопоставимо по объёму с самим видео, поэтому стриминговые сервисы обычно ограничивают иммерсивное аудио оригинальным языком и небольшим количеством премиальных дубляжей. (Подробно о технических аспектах иммерсивного звука – в статье «Atmos и иммерсивное аудио в стриминге». Чтобы рассчитать эти параметры для своего каталога, воспользуйтесь памяткой ниже – на одной странице собраны данные по размерам файлов по языкам, теги разметки и юридические пороги.
Частая ошибка: рассинхрон языкового тега
Самый частый баг в продакшене многоязычного аудио – не битрейт и не микс, а несовпадающий или отсутствующий языковой тег. Если внутренние метаданные файла указывают eng, а в манифесте HLS (LANGUAGE) или DASH (lang) указан fr, разные плееры разрешают конфликт по-разному: одни доверяют манифесту, другие – файлу – и в результате в меню отображается неверная подпись или автоматически выбирается неправильная дорожка. Тот же класс ошибок приводит к исчезновению описанной дорожки, если при переупаковке теряется её CHARACTERISTICS или дескриптор Accessibility – тогда аудит доступности тихо проваливается, хотя само аудио остаётся безупречно. Проверяйте, чтобы языковой тег в манифесте, метаданные контейнера и подпись в меню совпадали для каждой дорожки на каждом этапе упаковки: теги – это контракт, а тихий рассинхрон хуже отсутствия дорожки, потому что его никто не заметит, пока зритель не пожалуется.
Где здесь Фора Софт
Многоязычное и доступное аудио – неотъемлемая часть всех видеопродуктов, которые мы создаём. В OTT- и интернет-ТВ-платформах задача сводится к корректной сборке манифестов HLS и DASH, чтобы дубляжи, оригинальные и описанные аудиодорожки надёжно выбирались в браузерах, на мобильных устройствах и смарт-ТВ. В онлайн-образовании и телемедицине наличие многоязычного аудио и доступности зачастую является требованием закупки, а стек описанных дорожек и субтитров должен пройти аудит. В видеоконференцсвязях и AR/VR языковые дорожки и потоки переводчиков в реальном времени порождают те же вопросы разметки – но уже в живом сценарии. Во всех этих направлениях возникает одна и та же задача: заставить плеер каждый раз выбирать правильную дорожку для каждого зрителя – и доказать, что он это делает.
Главное
- Одно видео – несколько дорожек; плеер выбирает одну из них по меткам в манифесте.
- HLS помечает аудиодорожки тегом EXT-X-MEDIA: LANGUAGE, NAME, DEFAULT, AUTOSELECT, CHARACTERISTICS.
- DASH использует для маркировки аудио элемент AdaptationSet с атрибутом Role: main, dub, description, commentary.
- Описанные дорожки следует помечать атрибутом public.accessibility.describes-video (в HLS) или атрибутом роли description (в DASH).
- Broadcast-mix проще для плееров; receiver-mix дешевле хранить, но требует более продвинутого плеера.
- Закон США обязывает предоставлять 87,5 часа описанного контента в квартал; EAA с июня 2025 года сделал доступное аудио обязательным.