MPEG-H 3D Audio: открытый стандарт иммерсивного звука ISO

Автор: Николай СапуновОбновлено: август 202618 мин чтения
Содержание статьи +

Кратко

MPEG-H 3D Audio – это открытая система звука, стандартизированная в ISO, на основе которой строятся вещание нового поколения и иммерсивная музыка. Эта статья рассматривает её устройство изнутри, а не снаружи. Основной приём, лежащий в основе всей системы, – это блок описательных данных под названием Metadata Audio Elements: он передаётся вместе со звуком и сообщает плееру, что представляет собой каждый элемент, какие параметры пользователь может изменять и какой уровень громкости должен сохраняться в итоге. Эти данные передаются в рамках пакетного формата MHAS, который можно разделять, переключать и комбинировать одновременно по эфирной антенне и интернет-каналу – именно так одна и та же программа может транслировать стадионный микс по эфиру и редкий языковой комментарий через широкополосный канал. К концу статьи вы поймёте модель сцены, пакетный транспорт, профили, реально реализуемые телевизионным чипом, механику громкости и области применения формата в 2026 году.

Почему это важно

Если вы разрабатываете OTT-сервис, продукт интернет-ТВ, приложение иммерсивной музыки или что-то, что передаёт звук на современный smart-TV или в наушники, MPEG-H – одна из двух ключевых звуковых систем новой эры вещания. Решение о её использовании – это решение по всему вашему конвейеру доставки.

Этот материал – глубокий разбор для продакт-менеджера, основателя или операционного руководителя, который уже примерно представляет, что такое MPEG-H 3D Audio: об этом подробно рассказано в статье MPEG-H 3D Audio простыми словами. Теперь ему нужно понять, как система устроена, достаточно глубоко, чтобы оценить интеграцию, поставить задачу команде или проверить заявление вендора.

Старший инженер тоже должен прочитать этот текст и счесть его точным: каждое число здесь основано на управляющем стандарте – ISO/IEC 23008-3 и ATSC A/342 Part 3, – а не на чужом пересказе.

Короткая отстройка: что здесь значит «система 3D-звука»

Перед механикой – одно определение, потому что из него вытекает весь дизайн. Традиционный формат звука – это запись: фиксированный набор каналов, замороженный в один микс, который плеер просто декодирует и проигрывает. MPEG-H – не запись. Это сцена – описание звуков программы плюс инструкции по их сборке, – которую плеер рендерит заново под те колонки или наушники, что есть у слушателя.

Слово «рендерит» здесь – ключевое. Renderer в этом контексте – часть декодера, которая берёт описанные звуки и определяет, как они будут распределены в вашей конкретной системе. Одна и та же сцена превращается в микс 7.1.4 на одном устройстве, в стереомикс с имитацией высоты в наушниках – на другом, и в микс для саундбара – на третьем. При этом перекодирование не требуется, потому что финальная сборка происходит в момент воспроизведения. Сравните это с более старыми кодеками, описанными в статье короткая история аудиокодеков, где микс «запекался» ещё в студии, и у плеера не было никакого выбора.

MPEG-H публикуется группой ISO/IEC Moving Picture Experts Group как ISO/IEC 23008-3, «High efficiency coding and media delivery – Part 3: 3D audio». Нормативно ссылается на издание ISO/IEC 23008-3:2022 текущий вещательный профиль США (ATSC A/342-3:2025-10, §2.1). Стандарт поддерживает одновременно три вида звука – фиксированные каналы, подвижные объекты и записанное звуковое поле – и позволяет вещателю предоставить зрителю доступ к выбранным элементам управления. Именно об этом рассказывается в MPEG-H 3D Audio простыми словами. Всё, что будет ниже, – это слой под ним.

Звуковая сцена: как MPEG-H описывает звук

Самая важная структура в MPEG-H – это звуковая сцена, формальное описание всего, что содержит программа, и всего, что слушателю разрешено с ней делать. Она передаётся в блоке статических данных, который стандарт называет Metadata Audio Elements, сокращённо MAE (ISO/IEC 23008-3, Clause 15; ATSC A/342-3:2025-10, §4.2.1). MAE – это разница между кодеком и системой. Кодек сжимает звук; MAE его объясняет.

MAE организована в виде небольшой иерархии, и имена стоит запомнить, поскольку любая интерактивная функция в итоге сводится к ним. На вершине – AudioSceneInfo, корень, обозначающий «всю программу целиком». Ниже него находятся три вида структур (ATSC A/342-3:2025-10, §4.2.1.1–4.2.1.3):

Group собирает сигналы-элементы, которые нужно обрабатывать как единое целое. Стереозапись, два канала которой всегда должны двигаться вместе, – одна группа; сабмикс микрофонов толпы – другая. Группировка – это способ сказать инженеру: «эти сигналы связаны между собой, обрабатывайте их как один объект».

Switch Group объединяет взаимоисключающие элементы: в каждый момент времени активен только один. Это механизм выбора языка: три комментаторские дорожки (например, два варианта английского и один иноязычный фид) находятся в одной группе переключения, и декодер гарантирует, что вы слышите ровно одну. Случайно наложить две дорожки невозможно – структура этого не позволяет.

Preset – это сохранённая именованная комбинация групп и объектов со своими уровнями громкости и позициями, готовый «опыт в одно касание». Собственные примеры стандарта наглядно это демонстрируют: пресет «Dialogue Enhancement», который повышает громкость диалога и понижает фон, и пресет «Live Mix» для спортивных трансляций с усиленной атмосферой, дополнительным объектом звука толпы и приглушённым комментарием (ATSC A/342-3:2025-10, §A.4.1). Именно благодаря пресетам зритель может выбрать опцию «только стадион», не разбираясь в деталях, лежащих в основе этого выбора.

Рис. 1. Иерархия MAE. В корне – AudioSceneInfo; группы объединяют связанные звуки; Switch Group обеспечивает выбор ровно одного языка; Presets – это именованные режимы «в одно касание», доступные зрителю.

Ключевое свойство: MAE описывает не только что происходит в сцене, но и что зрителю разрешено изменять и в каких пределах. Каждый элемент имеет флаги – можно ли регулировать усиление, перемещать позицию – и границы этих изменений (ATSC A/342-3:2025-10, §A.4.1). Вещатель определяет допустимые рамки; декодер их строго соблюдает. Поэтому персонализация никогда не нарушает художественный замысел: микс-инженер задаёт, что комментарий можно поднять максимум на 12 дБ, и ни один ползунок зрителя не превысит этот предел.

MHAS: пакетный формат, который всё это объединяет

Описанию сцены и трём видам звука нужен контейнер, который можно резать, переключать и объединять в реальном времени – в точке вещательного сплайса, при смене канала или в середине потока при изменении программы. Такой контейнер – MPEG-H Audio Stream, сокращённо MHAS (ISO/IEC 23008-3, Clause 14; ATSC A/342-3:2025-10, §5.2.1). Представьте MHAS как поезд из подписанных вагонов: каждый вагон – это пакет с указанием типа, и этот тип позволяет любому устройству на линии определить, что внутри, не декодируя сам звук.

Несколько типов пакетов несут всю систему. Пакет конфигурации PACTYP_MPEGH3DACFG хранит настройки декодера – раскладку каналов, количество объектов, параметры ядра-кодека. Пакет сцены PACTYP_AUDIOSCENEINFO содержит описанную выше MAE, и спецификация требует, чтобы он следовал сразу за пакетом конфигурации в каждой точке входа (ATSC A/342-3:2025-10, §5.2.2.2). Сам звук передаётся в пакетах PACTYP_MPEGH3DAFRAME. Когда зритель крутит ручку, результат возвращается в поток в виде пакета PACTYP_USERINTERACTION, который декодер обрабатывает перед рендерингом следующего кадра (ATSC A/342-3:2025-10, §A.4.3).

Два проектных решения делают MHAS необычно гибким. Во-первых, полезная нагрузка каждого пакета выровнена по байтам, так что устройство сплайсинга может определить границу и выполнить разрез без декодирования звука – это необходимо для вставки рекламы на точный видеокадр (ATSC A/342-3:2025-10, §4.2.3). Во-вторых, специальный пакет усечения PACTYP_AUDIOTRUNCATION позволяет укоротить последний звуковой кадр перед сплайсом, чтобы аудио завершалось ровно в тот момент, когда заканчивается видео, хотя аудио и видео почти никогда не используют одинаковую частоту кадров.

Рис. 2. Поток MHAS как поезд из типизированных пакетов. Sync-образец содержит конфигурацию и информацию о сцене, чтобы декодер мог начать работу «с нуля»; пакеты взаимодействия и усечения вставляются в поток на лету без перекодирования звука.

Подключение и переключение без щелчка

Вещательный зритель постоянно переключает каналы, а стриминговый плеер меняет битрейт каждый раз, когда сеть начинает тормозить. И в том, и в другом случае декодеру нужно уметь корректно запуститься или перезапуститься посреди потока. MPEG-H решает эту задачу с помощью Random Access Point (RAP) – «sync sample», содержащего всё необходимое для холодного старта: пакет конфигурации, пакет сцены, пакет тайминга буфера и аудиокадр – именно в таком порядке (ATSC A/342-3:2025-10, §5.2.2.2). Попав на RAP, можно начать декодирование с нуля. Стандарт даже рекомендует 100-миллисекундный fade-in на первом выходном буфере после подключения, чтобы звук появлялся плавно, а не с щелчком (ATSC A/342-3:2025-10, §A.3.1).

Для бесшовной адаптации битрейта – звукового аналога того, что видео делает в аудио в HLS, DASH, CMAF – MPEG-H использует Immediate Play-out Frames, или IPF. IPF содержит достаточно информации о предыдущих кадрах, чтобы декодер мог перейти к другому битрейтовому представлению на границе сегмента без слышимого шва (ATSC A/342-3:2025-10, §4.2.4). Размещение IPF на границах сегментов и позволяет реализовать адаптивный стриминг MPEG-H без щелчков.

Два потока, одна программа: гибрид «эфир + broadband»

Вот возможность, которой не обладает ни один классический вещательный кодек, – и это самый ясный аргумент в пользу того, что звук нового поколения – это система, а не просто улучшенный компрессор. Одну программу MPEG-3 можно разделить на два или более независимых потока – один для эфирного вещания, один или несколько – для интернета, – и декодер объединит их в единую звуковую сцену (ATSC A/342-3:2025-10, §4.2.2, §5.2.2.4).

Механизм – пример записи mhm2 (многопоточный вариант обычной записи mhm1). Главный поток содержит как минимум презентацию по умолчанию и помечен mae_isMainStream = 1; вспомогательные потоки несут дополнительные компоненты – дополнительные языки, дорожку аудиоописания – и помечены 0. Пока потоки синхронизированы по времени и их точки доступа выровнены, декодер объединяет их в единую звуковую сцену при воспроизведении (ATSC A/342-3:2025-10, §5.2.2.4).

Практическая выгода очевидна. Вещатель транслирует популярный контент – основную программу и два основных языка – по дефицитному и дорогому вещательному спектру, а «длинный хвост» – редкий язык, дорожку аудиоописания, авторский комментарий – передаёт по broadband, где пропускная способность дешевле. Зритель получает единую бесшовную программу, а оператор платит вещательные тарифы только за те каналы, которые смотрит большинство. Это та экономика мультидорожек, которую мы разбираем в статье хранение и CDN-математика мультиязычного аудио, теперь реализованная на уровне кодека.

Ядро-кодек: где на самом деле экономятся биты

Под моделью сцены и пакетным транспортом лежит обычная задача – эффективно сжать звуковые сигналы. Движок сжатия MPEG-H построен на том же семействе математических методов, что и AAC, и система Unified Speech and Audio Coding (USAC), используя улучшенное модифицированное дискретное косинусное преобразование – MDCT – для превращения звука в «частотные ингредиенты» и расходования битов только там, где их замечает ухо (ISO/IEC 23008-3; четыре ключевых идеи за этим – в статье как работает сжатие звука). Ядро может обрабатывать до 128 core-каналов кодека, что позволяет одному декодеру одновременно обрабатывать большую подложку, множество объектов и амбисонические компоненты.

Когда сцена включает записанное звуковое поле – например, Higher Order Ambisonics (HOA), естественный выбор для звука в VR с поворотом головы, как подробно разобрано в статье Ambisonics, HRTF и бинауральный рендеринг – энкодер разбивает это поле на набор доминирующих направленных сигналов и сигнал атмосферы, кодируя каждый из них с помощью кодека на базе USAC (ISO/IEC 23008-3). Рендерер выполняет обратное преобразование под текущую позицию слушателя, включая поворот всего звукового поля в соответствии с движением наушников при head-tracking.

Стоит запомнить: ядро-кодек работает хорошо, но это не его главное преимущество. У AAC и AC-4 ядра тоже надёжные. Сильная сторона MPEG-H – всё, что добавлено поверх ядра: описание сцены, метаданные, интерактивность. Поэтому статья уделяет им основное внимание.

Профили и уровни: что реально делает телевизионный чип

Гибкой системе нужны ограничители, иначе дешёвый телевизор и премиальный ресивер не смогли бы честно заявлять о поддержке «MPEG-4». Эти ограничители – профили (какие инструменты обязаны быть реализованы) и уровни (сколько звука должен обрабатывать декодер). Полный набор – Main profile с пятью уровнями, на вершине – 64 канала колонок и 128 core-каналов, что достаточно для зала 22.2 и далеко за пределами бытовых нужд (ISO/IEC 23008-3). Однако Main profile почти никто не реализует в потребительских устройствах.

Для вещания и стриминга важны два урезанных профиля. Low Complexity (LC) profile, добавленный в Amendment 3 (конец 2016 года), сохраняет инструменты для работы с каналами, объектами и HOA, но снижает сложность декодера примерно вдвое по сравнению с более полным набором – настолько дёшево, что его можно реализовать в TV-SoC (Fraunhofer IIS; ISO/IEC 23008-3). Baseline (BL) profile, получивший финальный статус в 2020 году, – это подмножество LC, ориентированное на вещание, стриминг и иммерсивную музыку; он поддерживает каналы и объекты, упрощает обработку метаданных и исключает продвинутую обработку HOA (Fraunhofer IIS; audioXpress, 2020).

Что отгружается в ATSC 3.0 сегодня – конкретно: ревизия вещательного стандарта США 2025 года добавила Baseline-профиль рядом с LC, и оба ограничены только Уровнями 1, 2 или 3 – высокие уровни Main в эфире не используются (ATSC A/342-3:2025-10, §5.1). Из этого выбора следуют два реальных потолка. LC Profile Level 3 ограничивает выход декодера на колонки 12 каналами – с запасом хватает на 7.1.4 (двенадцать колонок), что и есть практическая иммерсивная цель для дома (ATSC A/342-3:2025-10, §A.2.1). А вещательный максимум битрейта ограничен 1 200 kbps, поднимаясь до 1 540 или 2 400 kbps лишь в специфических конфигурациях с большим числом каналов (ATSC A/342-3:2025-10, §5.2.1).

ПрофильГде применяетсяНесомые инструментыИспользуется в ATSC 3.0
Main (5 уровней)Reference / студияКаналы + объекты + полный HOA, до 64 колонокНет
Low Complexity (LC)Вещательные TV-чипыКаналы + объекты + HOA, ~50% ниже сложностьДа (Уровни 1–3)
Baseline (BL)Телевизоры, муз. устройстваКаналы + объекты, упрощённые метаданные, без продвинутого HOAДа (Уровни 1–3)

Табл. 1. Три практических профиля MPEG-H. Потребительское вещание и музыка используют LC или Baseline на уровнях 1–3; полный Main предназначен для студийного и эталонного применения. Источник: ISO/IEC 23008-3; ATSC A/342-3:2025-10, §5.1; Fraunhofer IIS.

Рабочий пример: почему объект выгоднее второго микса

Персонализация требует дополнительных каналов, и её объём легко рассчитать – это важно при планировании вещательного мультиплекса. Допустим, спортивная программа нуждается в 5.1-стерео с подложкой стадиона и двумя вариантами комментирования. Традиционный подход предполагает передачу двух полных миксов в формате 5.1, оставляя выбор одного из них на усмотрение плеера:

два полных микса 5.1 = 2 × 192 kbps = 384 kbps

Подход MPEG-H передаёт одну подложку 5.1 и добавляет каждый язык в виде монообъекта комментария внутри группы переключения:

одна подложка 5.1 + два моно-объекта = 192 kbps + (2 × 48 kbps) = 288 kbps

Это 96 кбит/с экономии – сокращение на 25%, – и разрыв увеличивается с каждым новым языком, потому что каждая дополнительная опция – это отдельный небольшой объект, а не целый surround-микс. Пять языков «в лоб» заняли бы 5 × 192 = 960 кбит/с; «объектным» способом – 192 + (5 × 48) = 432 кбит/с, то есть экономия 55%. Точные цифры зависят от энкодера, но суть в структуре: объекты позволяют персонализации расти сублинейно, а дублированные миксы – линейно.

Громкость и динамический диапазон: то, на чём настаивают вещатели

У системы, позволяющей зрителям регулировать громкость, есть регуляторная проблема: если увеличить уровень диалога, программа в целом становится громче, а правила громкости – такой как CALM Act в США и аналогичные законы в других странах, основанные на измерениях из статьи громкость, peak, RMS, LUFS – этому препятствуют. MPEG-H решает эту проблему, встроив контроль громкости непосредственно в формат, а не оставляя его на усмотрение playout-цепочки вещателя.

MPEG-H унаследовал механизмы громкости и динамического диапазона от MPEG-D DRC, формально ISO/IEC 23003-4:2025 (ATSC A/342-3:2025-10, §4.2.5, §2.1). В поток включены метаданные громкости, измеренные по стандарту ITU-R BS.1770 – тому же алгоритму, что лежит в основе статьи нормализация громкости: EBU R128, BS.1770, ATSC A/85 – и набор профилей DRC, из которых устройство выбирает в зависимости от типа вывода: AV-ресивер, динамик телевизора или телефон (ATSC A/342-3:2025-10, §A.5). Нормализация громкости в декодере должна быть включена постоянно.

Самое умное – компенсация громкости. Каждый раз, когда вещатель разрешает интерактивное усиление для какого-либо элемента, поток должен также содержать данные компенсации, которые декодер применяет автоматически: когда зритель повышает громкость диалога, система незаметно снижает общий уровень, чтобы измеренная громкость программы оставалась неизменной (ATSC A/342-3:2025-10, §4.2.6, §5.3). Зритель получает чёткий диалог, а регулятор – программу, соответствующую нормам. Стандарт устанавливает диапазон целевой громкости, который должны покрывать наборы DRC, – от −31 дБ до 0 дБ, непрерывно (ATSC A/342-3:2025-10, §5.3). DRC также предоставляет вещателям ducking, зависящий от времени – автоматическое понижение громкости выбранных элементов под закадровый голос или аудиоописание, что напрямую связано со статьёй стек доступности: субтитры и аудиоописание.

Частая ошибка: путать сцену с рендером

Самая частая ошибка продуктовых команд с MPEG-H – воспринимать бинауральный выход в наушники как мастер-микс. Это не так. Декодер MPEG-H может отрендерить аудиосцену в наушники, используя head-related transfer functions (HRTF) и бинауральные импульсные характеристики, передаваемые согласно ISO/IEC 23008-3, пункт 13, – и стандарт ограничивает количество таких рендеров по уровням: максимум 2 бинауральные пары на Уровне 1, 6 – на Уровне 2, 11 – на Уровне 3 (ATSC A/342-3:2025-10, §A.2.2). Такой бинауральный микс – производный рендер, вычисляемый на устройстве под конкретную пару ушей. То, что поставляется и архивируется, – это сама сцена: каналы, объекты, HOA и MAE. Из-за путаницы команды «мастерят в бинаурале», теряя ту самую гибкость, ради которой и был выбран формат. Создавайте сцену – пусть рендерер сам делает бинауральный микс.

Где MPEG-2 реально применяется в 2026 году

MPEG-H – система для вещания и музыки, и к 2026 году её перспективы стали яснее, чем когда-либо. Якорем по-прежнему остаётся Южная Корея, где стандарт TTA, опубликованный в июне 2016 года, определил MPEG-H единственным аудиокодеком для наземного UHD-вещания. Вещатели SBS, MBC и KBS запустили постоянные сервисы ATSC 3.0 31 мая 2017 года – это был первый в мире аудиокодек нового поколения, работавший в эфире 24/7 (TTA, 2016; Fraunhofer IIS; audioXpress, 2017). Он транслировал зимние Олимпийские игры 2018 года в Пхёнчхане в иммерсивном звуке и с тех пор работает непрерывно.

Более масштабное событие 2026 года – два новых национальных обязательства. В США переход на ATSC 3.0 («NextGen TV») остаётся добровольным, но активно продвигается; обновлённый национальный план развёртывания теперь ориентирован на 2027 год, а аудиостандарт снова пересмотрен – A/342-3:2026-04 (апрель 2026) – это актуальная версия после ревизии октября 2025 года, в которой был добавлен Baseline-профиль (ATSC; ATSC A/342-3:2025-10). А Бразилия официально утвердила систему на базе ATSC 3.0 под брендом DTV+ (TV 3.0), при этом MPEG-4 Audio является обязательным компонентом, с целью достичь коммерческой готовности к Чемпионату мира по футболу FIFA 2026 (ATSC; V-Nova; TV Tech, 2025). Бразилия стала первой национальной системой, в которой MPEG-4-звук обязателен наряду с видео на основе VVC и LCEVC.

С точки зрения музыки Sony 360 Reality Audio, запущенный 8 января 2019 года, построен на объектной модели MPEG-H и распространяется через стриминговых партнёров; Sony лицензировала декодер MPEG-H как для ATSC 3.0, так и для DVB-устройств (Sony / Fraunhofer IIS, 2021). Вывод для продуктовой команды: если вы работаете с вещанием в Корее или Бразилии, с приёмниками ATSC 3.0, с приложениями иммерсивной музыки или с новыми smart-TV, MPEG-H – это формат, с которым вы столкнётесь, и теперь вы знаете, что происходит «под капотом».

Где здесь Фора Софт

Мы разрабатываем платформы OTT и интернет-ТВ, бэкенды видеостриминга, системы видеоконференций и телемедицины – и именно звуковой слой часто становится тем, где продукт либо тихо преуспевает, либо терпит неудачу. Для клиентов, интересующихся вещанием нового поколения или доставкой иммерсивного звука, задача редко сводится к созданию кодека – ключевое здесь – интеграция вокруг него: упаковка MPEG-H 3D Audio (MPEG-H) в нужный контейнер, передача элементов персонализации в интерфейс плеера, обеспечение согласованности громкости на всём протяжении воспроизведения и корректная обработка гибридного слияния «эфир + широкополосный интернет», чтобы редкие языковые дорожки доходили до пользователя без искажений. Мы поставляем звуковые конвейеры для стриминга и конференций с 2005 года, и накопленный опыт работы с объектным, управляемым метаданными звуком напрямую применяется в таких функциях, как пространственные конференции и поддержка доступности – всё это всё чаще запрашивают наши клиенты.

Ключевые выводы

  • MPEG-H – это модель сцены, а не запись: плеер собирает аудиомикс под каждое устройство.
  • Metadata Audio Elements (MAE) – группы, переключаемые группы, пресеты – лежат в основе всей персонализации.
  • Пакеты MHAS содержат конфигурацию, сцену, аудиоданные и информацию о взаимодействии; сплайсинг возможен без перекодирования.
  • Гибридная доставка объединяет эфирный и широкополосный потоки в единую программу.
  • Потребительские устройства работают на профилях LC или Baseline, уровнях 1–3, а не на полном профиле Main.
  • Компенсация громкости поддерживает уровень программ в норме, даже если зритель меняет аудиомикс.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.