Содержание статьи +
- Кратко
- Почему это важно
- Один вопрос, который разделяет всё пространство звука
- Подход 1: канальное аудио – называем динамики
- Подход 2: объектное аудио – называем звуки, а не динамики
- Подход 3: сценное аудио – описываем всё звуковое поле
- Два частных случая ADM: matrix и binaural
- Три подхода рядом
- MPEG-H: стандарт, который объединяет три технологии
- Как выбрать, в одном абзаце
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Описать звуковую сцену компьютеру можно тремя способами: перечислить динамики (канальное аудио), указать звуки и их положение (объектное аудио) или описать всё звуковое поле как набор математических слоёв (сценное аудио). Канальное – самый старый и простой формат: «5.1» означает шесть фиксированных каналов, привязанных к динамикам, – но он работает только тогда, когда комната соответствует студии. Объектное аудио, на котором построен Dolby Atmos, хранит каждый звук и его позицию, позволяя «рендереру» пересобрать микс под любые динамики – от наушников до кинозала с 64 колонками. Сценное аудио на базе амбисоники описывает само звуковое поле и необходимо для VR и видео 360°, потому что оно поворачивается вместе с головой.
Почему это важно
Если вы разрабатываете или покупаете продукт с видео – стриминг, конференции, OTT, e-learning, телемедицину, видеонаблюдение или VR – рано или поздно вас спросят про «пространственный звук», «Dolby Atmos» или «амбисонику». Эти три термина соответствуют трём подходам, описанным в статье, и путаница между ними обходится дорого: запустили пайплайн на 5.1, хотя клиенту нужна была объектная доставка, или сохранили обычное стерео, тогда как VR-гарнитуре требовалось вращаемое звуковое поле. Эта статья даёт продакт-менеджеру полную картину: что хранит каждый подход, во сколько он обходится, где выигрывает и как современные стандарты – Dolby Atmos, MPEG-H, амбисоника – связаны между собой. Это поможет оценить аудиофичу и говорить с инженерами без догадок. Никаких специальных знаний в области аудио не требуется: каждый термин объясняется до первого употребления.
Один вопрос, который разделяет всё пространство звука
Любой формат иммерсивного звука отвечает на один и тот же вопрос одним из трёх способов. Вопрос звучит так: что именно мы записываем в файл?
Можно задать динамики напрямую – «воспроизведи этот сигнал из левого тылового динамика». Можно указать звуки и их позиции – «вертолёт сверху справа, движется влево; сам определи, какие динамики задействовать». Или записать всё звуковое поле как набор математических слоёв и потом декодировать его под любой конфигурацию динамиков. Вот и вся классификация: канальная, объектная и сценная. Всё остальное – Atmos, DTS: X, MPEG-H, амбисоника, Apple Spatial Audio – это продукты, построенные на одной или нескольких из этих идей.
Деление на три – не маркетинговый ход. Оно закреплено в международном стандарте, которым пользуются вещатели и разработчики инструментов: Рекомендации ITU-R BS.2076, известной как Audio Definition Model, или ADM. ADM – это формальный словарь; можно сказать, грамматика, позволяющая файлу заявить: «Я – звук такого-то типа». Действующая редакция, BS.2076-3, опубликована в феврале 2025 года. Хотя ADM выделяет пять типов (включая matrix и binaural как частные случаи – о них кратко ниже), для практически любого продуктового решения важны три: канал, объект и сцена.
Подход 1: канальное аудио – называем динамики
Канальное аудио – то, которым человечество пользуется со времён первого воскового цилиндра. Канал – это один поток звука, который без изменений воспроизводится через динамик, находящийся в определённой позиции. Stereo – два канала: левый и правый. «5.1» – шесть каналов. Руководство EBU по ADM называет этот тип DirectSpeakers именно для того, чтобы подчеркнуть суть: сигнал идёт напрямую на динамик, без обработки.
Разберём «5.1» как следует – это обозначение сбивает с толку почти всех. Первое число указывает количество полнодиапазонных каналов на уровне ушей, второе – наличие отдельного канала для баса.
«5.1 = пять полнодиапазонных каналов (Left, Centre, Right, Left Surround, Right Surround), каждый из которых передаёт звуки в диапазоне примерно от 20 Гц до 20 000 Гц, плюс один канал низкочастотных эффектов – «LFE», предназначенный исключительно для глубокого баса в диапазоне около 20–120 Гц. Обозначение «.1» означает, что этот басовый канал занимает примерно десятую часть полосы пропускания обычного канала. Это канал вашего сабвуфера. Он называется «точка один», потому что представляет собой частичный канал, а не потому что он единственный.»
Полезная аналогия: канальный микс – это набор заранее подписанных конвертов. Студия пишет на конверте «левый тыловой динамик» и запечатывает звук внутри. Пока в вашей комнате есть левый тыловой динамик в нужном месте, письмо доставлено идеально.
Сила очевидна – всё просто и не требует вычислений при воспроизведении. Слабость столь же очевидна: микс звучит правильно только в комнате, повторяющей расстановку студии. Если студия микшировала под пять динамиков, а у вас два, что-то должно свести пять в два. Это сведение называется downmix и всегда теряет информацию. Сдвиньте динамик или уберите один – и пространственная картина исказится.
Есть и вторая, менее заметная, но важная для стриминга слабость: каждая расстановка динамиков – это отдельный файл. Хотите передавать звук в форматах stereo, 5.1 и 7.1.4 (раскладку с потолочными динамиками – о третьем числе чуть ниже)? Тогда придётся хранить и транслировать три отдельные аудиоверсии. Цифры по стоимости хранения приведём позже.
Куда дотягивается канальный подход
Канальное аудио не ограничивается форматом 5.1. Количество каналов увеличивается с ростом числа динамиков:
- 7.1 добавляет два surround-канала: восемь каналов на уровне ушей плюс LFE.
- 7.1.4 сохраняет семь каналов на уровне ушей и один LFE, а затем добавляет четыре потолочных канала. Третье число – «.4» – обозначает количество потолочных динамиков. То есть «7.1.4» – это двенадцать динамиков: семь вокруг вас, один сабвуфер и четыре над вами.
- 22.2, вещательная раскладка NHK, использует двадцать четыре динамика в трёх вертикальных слоях.
Заметьте закономерность. Как только звук пошёл вверх – появилась высота – канальный подход начал давать сбои. Двадцать четыре подписанных конверта – это очень много конвертов, и почти ни в одной гостиной нет динамиков, чтобы их открыть. Именно это напряжение подтолкнуло индустрию ко второму подходу.
Подход 2: объектное аудио – называем звуки, а не динамики
Объектное аудио меняет подход. Вместо команды «воспроизведи это из левого заднего динамика» система говорит: «вот звук вертолёта, а вот его позиция – сверху, сзади, с дрейфом влево». Файл содержит сам звук (аудиообъект) и метаданные – информацию о нём, в частности, его трёхмерную позицию во времени. Отдельная программа на стороне воспроизведения – рендерер – анализирует эти данные и рассчитывает, какие из ваших динамиков и с какой громкостью должны проиграть звук, чтобы он оказался в нужном месте.
Аналогия: объектное аудио – это GPS-адрес, а не запечатанный конверт. Студия указывает: «этот звук находится по таким-то координатам». Ваш рендерер – как местный водитель, знающий особенности вашей комнаты и расположение динамиков, – доставляет звук точно в нужную точку, независимо от планировки помещения. Один и тот же адрес работает в любом пространстве.
Это и есть главное преимущество, и его стоит сформулировать прямо: один объектный мастер звучит одинаково хорошо на наушниках, саундбаре, системе 5.1 или в кинозале с 64 динамиками – без необходимости создавать отдельный микс для каждого случая. Рендерер адаптирует звук под устройство. Канальному аудио нужен отдельный файл для каждой конфигурации; объектному – один файл и рендерер.
Dolby Atmos – объектный (с канальной подложкой)
Самая известная объектная система – Dolby Atmos. Однако Atmos – не чисто объектная, а гибридная система, и именно понимание её гибридной природы является ключом к пониманию современного иммерсивного звука.
В миксе Atmos две составляющие. Первая – bed (подложка): набор обычного канального аудио (часто раскладка 7.1.2 – семь каналов на уровне ушей, один LFE, два потолочных) для фоновых звуков, музыки и всего, что не требует точного позиционирования. Вторая – набор объектов: отдельные звуки с метаданными о позиции, которые рендерер размещает динамически. Хлопок двери, проезжающая машина, реплика диалога – всё это объекты.
Dolby Atmos Renderer – программа, используемая студиями, – поддерживает до 128 входов суммарно, где каждый канал подложки и каждый объект считаются отдельными входами. В кинозале подложка обычно занимает 9.1 каналов (часто обозначается как 7.1.2), оставляя до 118 объектов для свободного перемещения. При воспроизведении система Atmos каждого зала в реальном времени рендерит эти объекты с учётом известных позиций динамиков именно этого помещения – поэтому один и тот же мастер Atmos корректно звучит как в зале с 12 динамиками, так и в зале с 64.
Трюк домашней доставки: spatial coding
Отдавать в гостиную 128 отдельных каналов звука непрактично – это огромный битрейт. Поэтому для домашней доставки Atmos использует spatial coding: алгоритм группирует 128 подложек и объектов примерно в 12–16 перцептивно различимых «кластеров», после чего передаёт эти кластеры вместе с метаданными в рамках обычного кодека. В формате Dolby Digital Plus (технически E-AC-3 с «Joint Object Coding», или JOC) именно так стриминговый сервис умещает Atmos в битрейт, который выдержит домашний интернет, оставаясь обратно совместимым – устройство, не поддерживающее Atmos, всё равно корректно декодирует базовый 5.1.
Этот трюк стоит запомнить для любого стримингового продукта: объектный звук записывается в студии с использованием до 128 каналов, после чего разумно сжимается до примерно 12–16 кластеров для доставки. Вы не транслируете 128 каналов.
Расчёт для наглядности. Наивный подход «стримить каждый объект отдельно» при частоте дискретизации 48 кГц и глубине 24 бита на отсчёт без сжатия обходится в следующие затраты на один объект:
48 000 отсчётов/с × 24 бита/отсчёт = 1 152 000 бит/с = 1,152 Mbps на объект
128 объектов × 1,152 Mbps = 147,5 Mbps147 Мбит/с только на звук – абсурд для домашнего стриминга. Spatial coding до ~16 кластеров в E-AC-3 позволяет доставлять Atmos с практической скоростью всего несколько сотен килобит в секунду – сжатие примерно в 100 раз. Вот в чём разница между «студийным форматом» и «форматом доставки», и поэтому никогда не стоит считать, что количество объектов в студии равно числу каналов при стриминге.
DTS:X – другая объектная система
Главный соперник Dolby – DTS:X – тоже объектный и гибкий по раскладке: он не привязывает микс к фиксированному числу динамиков и позволяет декодеру адаптироваться под особенности помещения. При выборе продуктового решения относитесь к DTS:X и Atmos как к одной категории (объектные, управляемые рендерером, иммерсивные), конкурирующей по экосистеме и лицензированию, а не по базовой философии.
Подход 3: сценное аудио – описываем всё звуковое поле
Третий подход не использует ни динамики, ни звуки напрямую. Он фиксирует всё звуковое поле в определённой точке пространства как совокупность математических слоёв, а затем воссоздаёт его для любой конфигурации динамиков – или, что важнее, поворачивает его, когда слушатель поворачивает голову.
Это амбисоника. Сначала – простыми словами, без математики. Представьте, что вы стоите в одной точке и задаёте вопрос: «С каких направлений и с какой силой до меня доходит звук?» Амбисоника отвечает на этот вопрос с помощью набора каналов, которые вместе описывают звуковое поле со всех сторон сразу. Она не привязана к динамикам – это описание звука у вашей головы.
Самая простая версия – First Order Ambisonics (FOA) – использует ровно четыре канала, обычно обозначаемые как W, X, Y и Z. W – это всенаправленный канал, отражающий суммарное звуковое давление, то есть «общее количество звука». Каналы X, Y и Z описывают, как звук распределён по трём осям: спереди-назад, слева-направо и сверху-вниз. Четыре значения – и у вас получается грубое, но полное 360°-описание звукового поля.
Чтобы уточнить картину, добавляют дополнительные слои. Это Higher Order Ambisonics (HOA). Связь между порядком и числом каналов выражается простой формулой, и её стоит продемонстрировать один раз:
каналы = (порядок + 1)²
порядок 1 (FOA): (1 + 1)² = 2² = 4 канала
порядок 2: (2 + 1)² = 3² = 9 каналов
порядок 3: (3 + 1)² = 4² = 16 каналов
порядок 7: (7 + 1)² = 8² = 64 каналаВыше порядок – точнее пространственное разрешение (звуки локализуются точнее), но за счёт большего числа каналов для хранения и передачи. Третий порядок (16 каналов) – распространённый компромисс для качественного VR; первый порядок (4 канала) используется в большинстве потребительских видео 360°.
Аналогия: амбисоника – это панорамное фото звука. Захват первого порядка – панорама низкого разрешения: примерно понятно, где что. Захват третьего порядка – панорама с более высоким разрешением: чёткие края, ясные позиции. И как панораму, всё изображение можно потом панорамировать и поворачивать. Последнее свойство и есть магия.
Почему VR и видео 360° нуждаются в сценном звуке
Когда вы поворачиваете голову в VR-гарнитуре, всё звуковое поле должно повернуться вместе с вами – то, что раньше было спереди, теперь оказывается сбоку. С канальным аудио это сделать сложно; с объектным – возможно, но потребуется заново отрендерить каждый звуковой объект. А со сценным аудио достаточно одной простой математической операции поворота, применённой ко всему звуковому полю сразу. Поверните четыре (или шестнадцать) амбисонических каналов одной матрицей – и весь мир звука повернётся правильно. Поэтому звук в VR с отслеживанием головы почти всегда основан на сценном подходе.
Поддержка пространственного звука YouTube для видео 360° и VR – яркий пример массового применения. YouTube принимает First Order Ambisonics в виде 4-канальной дорожки (порядок каналов: W, Y, Z, X) с частотой дискретизации 48 кГц, либо FOA плюс «head-locked» стереопару (6-канальная дорожка: W, Y, Z, X, L, R, минимум 768 кбит/с) – для закадрового голоса или музыки, которые не должны следовать за поворотом головы. Когда зритель перемещает 360°-вид, YouTube поворачивает амбисоническое поле в реальном времени.
О форматах обмена: ACN и SN3D
Если ваши инженеры работают с амбисоникой, перед ними возникнут два акронима. ACN (Ambisonic Channel Number) определяет порядок хранения каналов: вместо традиционных обозначений W, X, Y, Z каждый компонент получает свой номер. SN3D (Schmidt Semi-Normalisation) задаёт, как каналы масштабируются относительно друг друга. Практическая выгода в том, что ни один из компонентов не превышает уровень всенаправленного канала W – это помогает избежать клиппинга. Широко используемый открытый формат обмена AmbiX, представленный в 2011 году исследователями IEM Graz, сочетает порядок ACN с нормализацией SN3D и хранит каналы в виде обычного PCM внутри файлов WAV или CAF. Глубокие математические знания для практического применения не требуются, но фраза «мы используем AmbiX, ACN/SN3D» однозначно говорит о том, что команда работает со сценным аудио.
Два частных случая ADM: matrix и binaural
Ещё два типа ADM дополняют общую картину; оба лучше воспринимать как производные от трёх основных.
Matrix-аудио комбинирует каналы с помощью простой арифметики, создавая новые. Классический пример – кодирование Mid/Side в FM-радио: канал «Mid» – это сумма левого и правого каналов, а «Side» – их разность. Если слабый сигнал Side теряется, моно-версия всё равно восстанавливается из канала Mid. Downmix Lt/Rt, сводящий 5.1-канальный звук к двум каналам, – тоже матрица. Можно считать матрицу обратимым способом сжатия поверх канального аудио.
Binaural-аудио – это двухканальный сигнал, созданный специально для наушников, чтобы каждое ухо воспринимало звук в полном 3D-пространстве. Обычно это результат работы рендерера, а не формат записи: рендерер берёт объектное или сценное аудио и преобразует его в бинауральную пару с помощью модели того, как ваша голова и уши изменяют звук с разных направлений («head-related transfer function», подробнее – в статье об амбисонике и HRTF). Apple Spatial Audio – это потребительская реализация такого подхода: мастер-запись в формате Atmos (объектный звук), отрендеренная в бинауральный формат с отслеживанием поворота головы для AirPods.
Три подхода рядом
Вот сравнение, которое действительно важно для продукта. Слегка подсвеченные ячейки показывают, где подход становится естественным победителем.
| Критерий | Канальное | Объектное | Сценное |
|---|---|---|---|
| Что хранит файл | Каналы на динамики | Звуки + метаданные позиции | Слои поля (W, X, Y, Z…) |
| Привязка к раскладке? | <span>Да – файл под каждую</span> | <span style="background:#E8F4EC">Нет – рендерер адаптирует</span> | <span style="background:#E8F4EC">Нет – декод под любую</span> |
| Вычисления при playback | <span style="background:#E8F4EC">Минимум (нет)</span> | Средние (рендерер) | Средние (декод/поворот) |
| Поворот головы (VR) | Сложно | Возможно, ререндер объектов | <span style="background:#E8F4EC">Один дешёвый поворот поля</span> |
| Точные движущиеся звуки | Ограниченно | <span style="background:#E8F4EC">Отлично</span> | Хорошо, растёт с порядком |
| Диффузный эмбиент / «эффект присутствия» | Хорошо | Норм | <span style="background:#E8F4EC">Отлично</span> |
| Типичное число каналов | 2–24 | 1 bed + до ~128 объектов (студия) | 4 (FOA) до 16+ (HOA) |
| Флагманы | Stereo, 5.1, 7.1, 22.2 | Dolby Atmos, DTS:X | Амбисоника, YouTube/VR |
| Якорные стандарты | ITU-R BS.775 | ETSI/Dolby; объекты MPEG-H | ITU-R BS.2076 (HOA) |
Таблица 1. Три подхода по осям, определяющим решение «build or buy».
Частая ошибка, которую стоит назвать прямо:
«Подводный камень – «Atmos – это просто больше каналов». Нет. Atmos – объектный формат: он хранит звуки и их позиции, а при воспроизведении рендерит их под вашу конкретную акустику. Трактовка «это 7.1.4 каналов» с фиксированным хранением двенадцати каналов убивает адаптивность – а она и есть главная суть формата. В результате звук будет звучать неправильно на любой раскладке, кроме точной 7.1.4. Если поставщик описывает Atmos как фиксированное число каналов, он не понял суть формата.»
MPEG-H: стандарт, который объединяет три технологии
Если три подхода кажутся соперниками, MPEG-H 3D Audio – стандарт, который не делает выбора. Специфицированный как ISO/IEC 23008-3 (MPEG-Part 3), он объединяет канальное, объектное и сценное (HOA) аудио в одном битстриме и позволяет автору комбинировать их – например, канальную подложку, движущиеся объекты и амбисонический слой окружения, всё вместе. Поддерживает до 64 выходных каналов для динамиков и 128 кодек-каналов ядра.
Практическая выгода для зрителя – интерактивность: поскольку объекты несут метаданные, декодер MPEG-H может позволить пользователю прибавить диалог, выбрать другой язык комментария или подстроить баланс – всё из одного вещательного потока. Поэтому его приняли вещатели. MPEG-H – единственная аудиосистема UHD-сервиса ATSC 3.0 («Next Gen TV») в Южной Корее. В США аудиостандарт ATSC 3.0 (A/342) допускает и MPEG-H, и Dolby AC-4, и развёртывания в США в основном использовали AC-4. Система нового поколения Бразилии под брендом DTV+ / «TV 3.0» принята в августе 2025 года и тоже построена на технологиях ATSC 3.0. То есть та же классификация из трёх лежит в основе вещательных стандартов, разворачивающихся по миру.
Как выбрать, в одном абзаце
Для большинства стриминговых и OTT-решений сегодня основой стал объектный подход: создавайте аудио в Dolby Atmos (или MPEG-H, если это требуется вещанием), передавайте с использованием spatial coding, чтобы битрейт оставался разумным, а рендеринг оставьте устройствам – пусть они адаптируют звук под возможности зрителя. Канальный стерео и 5.1 держите как резервный вариант для устаревших устройств – это элементарная гигиена. Применяйте сценную амбисонику только там, где есть отслеживание головы: в VR, AR и 360°-видео, где звуковое поле должно вращаться вместе со зрителем. Чистое канальное аудио сегодня – в основном резервный и универсальный формат, а не основа премиум-опыта.
Где здесь Фора Софт
Фора Софт делает видеопродукты с 2005 года – стриминг, OTT/Internet TV, видеоконференции, e-learning, телемедицину, видеонаблюдение и AR/VR, – и звук в каждом из этих pipeline пользователь замечает первым, когда он ломается. В OTT и стриминге мы настраиваем объектную доставку (Atmos через E-AC-3 JOC или MPEG-H под вещательные цели) с канальными запасными stereo и 5.1, чтобы тайтл играл верно от телефона до домашнего кинотеатра. В AR/VR и 360°-проектах мы работаем в сценной амбисонике, чтобы поле следовало за гарнитурой. Знание всех трёх подходов не академично: так вы оцениваете аудиофичу, которая поедет на устройствах, реально имеющихся у ваших пользователей.
Ключевые выводы
- Существует три подхода: называть динамики, звуки или звуковое поле.
- Канальный (5.1, 7.1.4) – простой, но требует отдельного файла для каждой конфигурации.
- Объектный (Dolby Atmos, DTS:X) хранит звуки и их позиции; рендерер адаптирует звучание под конкретную комнату.
- Atmos поддерживает до 128 студийных элементов, пространственное кодирование – до ~12–16 кластеров для доставки.
- Сценный (амбисоника) описывает всё звуковое поле; FOA – 4 канала, HOA – (порядок + 1)².
- В VR и 360° требуется сценный звук, потому что звуковое поле вращается вместе с головой.
- MPEG-H (ISO/IEC 23008-3) поддерживает все три формата одновременно и предоставляет зрителю интерактивность.