Ambisonics, HRTF и бинауральный рендеринг

Автор: Николай СапуновОбновлено: август 202617 мин чтения
Содержание статьи +

Кратко

Пространственный звук в наушниках строится на трёх ключевых идеях, объединённых в единый конвейер: способ записи или описания звукового поля вокруг слушателя (ambisonics), измерение того, как ваша голова и уши изменяют звук с разных направлений (HRTF), и финальный этап – преобразование этих данных в двухканальный сигнал, который реально воспроизводят наушники (бинауральный рендеринг). Ambisonics представляет звуковое поле в виде набора каналов – четыре в базовой версии, шестнадцать – в формате, используемом, например, YouTube, – и это поле можно мгновенно поворачивать при движении головы. HRTF – это индивидуальный «отпечаток», который помогает мозгу определить, откуда приходит звук: сверху, сзади или слева. Универсальный HRTF работает «достаточно хорошо», а персональный – заметно точнее. Если все три компонента реализованы правильно, обычная пара наушников убедит мозг, что звук исходит из конкретной точки в комнате, даже если вы двигаетесь; но ошибка в HRTF приведёт к тому, что всё восприятие схлопнется в нечёткий комок внутри головы.

Почему это важно

Если вы работаете с VR или AR, видео 360°, иммерсивными видеоконференциями или любым продуктом, где звук должен исходить откуда-то, а не просто из наушников, эти три технологии – ваш полный инструментарий, и выбор между ними определяет битрейт, задержку и воспринимаемое качество. Статья предназначена для менеджера продукта, основателя или операционного лидера, которому нужно оценить возможность пространственного звука, поставить задачу команде инженеров или проверить утверждение вендора об «иммерсивном звуке» – при этом он может никогда не слышать о сферических гармониках. Старший аудиоинженер тоже найдёт здесь точные цифры: допуски локализации, количество каналов и частотные границы основаны на стандартах и первичных исследованиях, а не на маркетинговых текстах. К концу статьи вы поймёте, как захватывается звуковое поле, как уши определяют направление и как эти процессы реализуются в рендерере, который управляет всеми современными пространственными наушниками.

Проблема: у наушников два канала, а у мира бесконечно много направлений

Начнём с задачи, которую решает любая система пространственного звука. В реальной комнате звук приходит со всех сторон одновременно – голос спереди, хлопок двери сзади, шаги слева. Два уха и мозг за ними без усилий строят из этого трёхмерную карту. Но пара наушников передаёт ровно два звуковых потока – по одному на ухо. Вся область пространственного звука – это наука о том, как подать в эти два канала сигналы, хитро сформированные так, что мозг восстанавливает полную 3D-карту, словно вы находитесь в исходной комнате.

Два канала звучат как «слишком мало» – и долгое время так и было. Прорыв заключается в том, что мозгу на самом деле не нужно полное звуковое поле – ему достаточно тех двух сигналов, которые поступили бы в уши, если бы поле было реальным. Если система способна вычислить эти два сигнала, иллюзия становится полной. Именно это вычисление и является темой статьи, и оно чётко разбивается на три задачи: описать поле (ambisonics), измерить, как голова преобразует направление звука в ушной сигнал (HRTF), и пропустить поле через эту модель, чтобы получить два канала (бинауральный рендеринг).

Замечание об охвате. Пространственный звук для фиксированных конфигураций колонок – 5.1, 7.1, 7.1.4 – это отдельная задача, рассмотренная в материалах о каналах и конфигурациях каналов, а также в подробных обзорах Dolby Atmos и MPEG-H 3D Audio. Эта статья посвящена случаю с наушниками, поскольку именно в них реализуются технологии VR, AR, мобильные устройства и большинство видеоконференций.

Как мозг находит звук: три признака

До любой технологии – биология. Мозг использует три физических признака, чтобы локализовать звук в пространстве, и каждая система пространственного звука на Земле – это всего лишь устройство для воспроизведения этих трёх признаков через наушники. Понять их – значит получить ключ, после которого всё остальное становится на свои места.

Первый признак – межушная разница во времени, или ITD – это промежуток между моментом, когда звук достигает одного уха, и моментом, когда он достигает другого. Звук, приходящий справа, попадает в правое ухо на долю миллисекунды раньше, чем в левое, потому что левое ухо находится дальше. Этот интервал очень мал – максимум около 0,6–0,7 миллисекунды для звука, находящегося прямо сбоку, – но мозг определяет его с высокой точностью. ITD – главный признак локализации для низких частот; дуплексная теория локализации, вековая модель, используемая и сегодня, устанавливает переход примерно на 1 500 Гц: ниже этой частоты мозг полагается на временные различия ([Wikipedia, Sound localization]; ряд акустических справочников).

Второй признак – громкость, межушная разница в уровне (или ILD) – разница в громкости между ушами. Голова выступает физическим препятствием, и на высоких частотах создаёт акустическую «тень», из-за чего дальнее ухо воспринимает звук тише. Выше примерно 1500 Гц именно ILD становится основным признаком, поскольку длина волн высоких частот достаточно мала, чтобы голова их экранировала (акустические справочники; дуплексная теория).

ITD и ILD вместе отлично передают мозгу лево–право – но оставляют известную неоднозначность. Звук прямо спереди и звук прямо сзади дают почти одинаковые время и уровень на обоих ушах, потому что находятся на одинаковом расстоянии. То же самое касается звука сверху и снизу под тем же углом. Это «конус неопределённости», и его устраняет третий признак.

Третий признак – ушная раковина (pinna), видимая часть наружного уха. Её складки и выступы по-разному фильтруют входящий звук в зависимости от направления, создавая характерные провалы – спектральные «зарубки» – в частотном спектре. Центральная частота наиболее заметного провала предсказуемо смещается, когда источник звука перемещается вверх или вниз, – именно так мозг определяет высоту положения. Эти признаки проявляются в высоких частотах: наиболее выраженная фильтрация раковиной происходит в диапазоне 4 000–9 000 Гц, а надёжная оценка высоты обычно требует наличия энергии выше примерно 7 000 Гц (по обзорам исследований локализации). Кроме того, ушная раковина строго индивидуальна – у всех людей она устроена по-разному, – поэтому возможен персонализированный пространственный звук, о чём мы ещё поговорим.

Рисунок 1. Три признака, по которым мозг определяет положение звука. Разница во времени (ITD) и уровне громкости (ILD) позволяют оценить положение слева–справа с переходом около 1500 Гц; спектральные провалы в ушной раковине помогают определить направление спереди–сзади и сверху–снизу.

HRTF: ваша голова, превращённая в математику

Теперь объединим все три признака в один объект. Head-related transfer function, или HRTF, – это математическое описание того, как звук с определённого направления изменяется под влиянием вашей головы, туловища и ушей, прежде чем достигнет барабанной перепонки. Оно объединяет ITD, ILD и резонансные провалы ушной раковины в единое описание – для одного направления. Измерьте достаточно направлений по всей сфере вокруг слушателя – и вы получите его полный набор HRTF: таблицу, отвечающую на вопрос «если звук идёт оттуда, что именно попадает в каждое ухо?».

HRTF – важнейший элемент в пространственном звуке для наушников, поэтому стоит чётко объяснить, что это такое. Для каждого направления – например, 30° вправо и 15° вверх – HRTF хранит пару коротких фильтров, по одному для каждого уха. Пропустите любой звук через нужную пару фильтров – и он приобретёт все характерные признаки направления. Мозг воспринимает результат через обычные наушники и правильно определяет, что звук исходит с 30° вправо и 15° вверх.

Откуда берутся HRTF? Их измеряют. Человек сидит в безэховой камере с миниатюрными микрофонами в ушных каналах, а колонка воспроизводит тестовые сигналы из сотен позиций вокруг него. Записанные звуковые сигналы, сравниваемые с исходным источником, и составляют HRTF. Поскольку такие измерения для каждого человека слишком дороги, индустрия использует общие исследовательские базы – CIPIC, SADIE, LISTEN, FABIAN, HUTUBS, ARI и десятки других – многие из которых опубликованы в едином формате, с которым мы скоро познакомимся (списки баз SOFA Conventions, 2024–2025). Продукт с «универсальным» пространственным звуком почти всегда использует одну проверенную HRTF из такой базы – часто измеренную на манекенной голове – для всех пользователей.

Универсальный или персональный HRTF

Универсальный HRTF – это компромисс: он создан на основе чужих ушей, поэтому провалы в раковине могут приходиться на частоты, не совпадающие с вашими. Тем не менее для большинства людей хороший универсальный HRTF обеспечивает убедительное восприятие слева и справа, а также достаточное ощущение пространства, поскольку ITD и ILD в основном зависят от размера головы и расстояния между ушами – параметров, которые варьируются меньше, чем форма ушной раковины. Слабость проявляется в определении высоты и направления «спереди – сзади» – признаков, зависящих от формы раковины: при несоответствии HRTF возникают ошибки – звук, который должен быть спереди, «схлопывается» внутрь головы, а восприятие высоты становится размытым.

Поэтому персональный HRTF стал в 2026 году полем борьбы между продуктами. Apple Personalized Spatial Audio предлагает отсканировать голову и уши с помощью фронтальной камеры iPhone – повернуть голову влево до сигнала, затем вправо – чтобы создать профиль, соответствующий вашей анатомии (Apple Support, Control Spatial Audio and head tracking, 2024–2025). Dolby Atmos Personalized Rendering использует фотографии головы и ушей, чтобы вычислить персональный HRTF, сокращённо PHRTF, в облаке (audioXpress, 2024). Исследования всё чаще применяют машинное обучение для предсказания HRTF по фото или нескольким антропометрическим измерениям, избегая полного измерения в безэховой камере. Обзор за декабрь 2024 года перечисляет конкурирующие подходы: физическое моделирование, антропометрию и машинное обучение (MDPI Applied Sciences, A Review on HRTF Generation for Spatial Audio, 2024).

«Подводный камень – «звук как будто внутри головы». Это классический признак несоответствия HRTF (или его отсутствия – просто панорамированное стерео). Если эффект плохой, не увеличивайте реверберацию; проверьте, применяется ли настоящий HRTF и включено ли отслеживание головы. Проблема почти всегда в цепочке рендеринга, а не в контенте.»

SOFA и AES69: формат файлов, сделавший HRTF переносимыми

Годами каждая база HRTF хранила измерения в собственном формате, и переход на новую базу означал необходимость писать новый парсер. Эта проблема была решена с появлением SOFA – Spatially Oriented Format for Acoustics, стандартизированного формата файлов для HRTF и связанных импульсных характеристик помещения, применяемых в пространственном звуке. SOFA – не продукт конкретной компании, а открытый стандарт, утверждённый Audio Engineering Society под номером AES69, впервые опубликованный как AES69-2015 и позже обновлённый до версий AES69-2020 и AES69-2022 (SOFA Conventions; AES69). Файл SOFA (.sofa) содержит измеренные фильтры вместе с точной геометрией – позициями источников и ориентацией слушателя, – что позволяет любому совместимому инструменту загружать любую базу данных. Если вы оцениваете SDK для пространственного звука, возможность «читать HRTF в формате SOFA / AES69» – это важный критерий, на который стоит обратить внимание: она означает, что в будущем вы сможете использовать более качественные или персонализированные HRTF, не ограничиваясь встроенным набором от вендора.

Ambisonics: хранение целой сферы звука

HRTF отвечает на вопрос: «Что приходит в уши с одного направления?» Но в реальной сцене звук приходит со всех направлений одновременно, а отслеживание движения головы позволяет слушателю поворачивать всю сцену как угодно. Нужен способ хранить всё звуковое поле – целую сферу – в форме, которую легко вращать и легко обрабатывать с помощью HRTF. Такое представление называется ambisonics.

Вот суть простыми словами. Вместо того чтобы говорить «звук в этой колонке и звук в той колонке», ambisonics хранит звуковое поле как набор перекрывающихся направленных паттернов, которые в сумме восстанавливают звуковое давление в центре сферы со всех углов. Представьте, что вы описываете ландшафт не списком отдельных объектов, а гладкой математической поверхностью – несколькими широкими формами, передающими общие черты, и более мелкими – для деталей. Эти формы называются сферическими гармониками, и вам не нужна математика; важно лишь одно следствие: чем больше форм – тем выше пространственная детализация.

Порядок и число каналов: единственная важная формула

Число форм определяет порядок амбисоники. Амбисоника первого порядка использует четыре самых широких паттерна; более высокие порядки добавляют более детализированные. Количество каналов рассчитывается по простой формуле – для порядка N требуется (N + 1)² каналов (RingBuffer, Understanding Ambisonics; стандартные справочники по амбисонике). Подставьте значения – и компромисс становится очевидным:

порядок 1 (FOA):  (1 + 1)² = 4 канала
порядок 2:        (2 + 1)² = 9 каналов
порядок 3 (TOA):  (3 + 1)² = 16 каналов
порядок 7:        (7 + 1)² = 64 канала

Амбисоника первого порядка, сокращённо FOA, – это формат из четырёх каналов: недорогой, повсеместно поддерживаемый и единственный, который YouTube принимает для 360°-видео. Амбисоника третьего порядка, TOA, использует шестнадцать каналов: в четыре раза больше данных и заметно более точная локализация звука. Причина, по которой более высокий порядок даёт преимущество, проста: чем больше паттернов сферических гармоник, тем тоньше угловое разрешение восстановленного звукового поля, а значит, точнее определяется направление звука. Это подтверждается слушательскими исследованиями – точность локализации растёт с увеличением порядка: 1, 3 и 5 (рецензируемые исследования, например работы AES/академии по первому и высшим порядкам). И цена этого преимущества также очевидна: каждый дополнительный порядок требует больше каналов для кодирования, хранения и передачи данных.

ПорядокНазваниеКаналыДетализацияТипичное применение
1FOA4Грубая – широкие направленияYouTube 360°, VR с низким битрейтом
2 – 9ЛучшеFacebook 360 (исторически), средний VR
3TOA16Чёткая локализацияVR высокого класса, иммерсивное производство
7 – 64Эталонное качествоИсследования, студийный мониторинг

Таблица 1. Порядок амбисоники и число каналов по формуле (N+1)². Переход от грубой к чёткой локализации происходит при увеличении числа каналов с 4 до 16. Источники: RingBuffer; стандартные справочники; SSA Plugins о высших порядках.

AmbiX, ACN и SN3D: почему файл вообще играет правильно

Два файла могут быть «амбисоникой первого порядка» и при этом оказаться несовместимыми, поскольку четыре канала могут упорядочиваться и масштабироваться по разным конвенциям. Стандартом, которому стоит следовать, является AmbiX. Он фиксирует два ключевых выбора. Во-первых, порядок каналов определяется по ACN – Ambisonic Channel Numbering – системе, в которой сферические гармоники нумеруются по фиксированной формуле, и четыре канала FOA идут в порядке W, Y, Z, X. Во-вторых, каналы масштабируются с использованием нормировки SN3D (полунормализация Шмидта). Google выбрал SN3D в качестве основы формата YouTube 360, что сделало AmbiX де-факто стандартом обмена данными (Wikipedia, Ambisonic data exchange formats; RingBuffer).

Более старая конвенция FuMa (Furse–Malham) упорядочивает каналы W, X, Y, Z иначе и использует иную нормализацию; её ещё можно встретить в legacy-материалах и некоторых плагинах. Практическое правило: работайте и храните данные в формате AmbiX (ACN/SN3D), а конвертацию в FuMa выполняйте на границе системы. Спецификация пространственного звука YouTube однозначна – она требует AmbiX с порядком каналов ACN и нормализацией SN3D, а также FOA в виде 4-канальной дорожки W, Y, Z, X на частоте 48 кГц или 6 каналов (W, Y, Z, X, L, R), если вы добавляете head-locked стерео для озвучки или музыки, которые не должны вращаться вместе с головой (спецификация пространственного звука YouTube / Google spatial-media, 2024–2025).

«Подводный камень – несовпадение порядка каналов. Подача файла FuMa в декодер AmbiX (или наоборот) не вызывает ошибки – он проигрывается, но звуковое поле оказывается перемешанным: слева становится сверху, фронт – размыт. Если пространственный микс звучит «неправильно, но не сломан», сначала подозревайте несовпадение ACN/FuMa или SN3D/maxN.»

Бинауральный рендеринг: где ambisonics встречается с HRTF

Теперь обе половины соединяются: у вас есть звуковое поле в формате ambisonics и слушатель, чьи уши описаны с помощью HRTF. Бинауральный рендеринг – это процесс, объединяющий их в двухканальный сигнал для воспроизведения на наушниках. Концептуально он работает в два этапа.

Классический и легко представимый метод – подход виртуальных громкоговорителей. Представьте слушателя, окруженного кольцом или сферой воображаемых колонок. Сначала декодируйте амбисоник-поле в эти виртуальные позиции – стандартное амбисоник-декодирование, та же математика, что и для реальных массивов колонок. Затем для каждой виртуальной колонки примените HRTF слушателя в её направлении, отфильтруйте сигнал через него и просуммируйте все результаты в левый и правый каналы. На выходе получаются два канала, несущие пространственные характеристики всего поля. Метод интуитивно понятен и корректен, но требует большого количества свёрток HRTF – по паре на каждую колонку в каждом аудиокадре.

Метод, ставший современным стандартом по умолчанию, пропускает виртуальные колонки и работает напрямую в области сферических гармоник: HRTF заранее сводятся в амбисоник-представление один раз, так что рендеринг всего поля требует столько операций фильтрации, сколько амбисоник-каналов. Доминирующая техника здесь – Magnitude Least Squares, сокращённо MagLS. Амбисоника низкого порядка не может идеально воспроизвести тонкую высокочастотную деталь HRTF, а попытка точно совпасть и по уровню, и по тонкому времени (фазе) на высоких частотах ведёт к уродливым компромиссам. MagLS использует биологический факт: выше примерно 1 500 Гц мозг воспринимает уровень (ILD), а не тонкую фазу. Поэтому MagLS точно совпадает по амплитуде с HRTF и отбрасывает высокочастотную фазу, которую не может воспроизвести, тратя ограниченный бюджет низкого порядка там, где ухо это замечает. MagLS сегодня – де-факто стандарт для бинаурального рендеринга низкого порядка, и активные исследования – masked MagLS, end-to-end MagLS – продолжают его улучшать (arXiv 2501.18224, Ambisonics Binaural Rendering via Masked Magnitude Least Squares, 2025; DAGA 2023; eMagLS, 2024).

Рисунок 2. Два маршрута от амбисоник-поля к наушникам. Путь виртуальных колонок интуитивен; прямой путь MagLS – то, что используется в продакшене. Поворот головы применяется к полю до рендеринга – поэтому он ощущается мгновенным.

Слежение за головой: признак, придающий иллюзии реалистичность

Единственная фича, отделяющая убедительный пространственный звук от трюка, – слежение за головой: поворот звукового поля для компенсации движения слушателя, чтобы источник оставался зафиксированным в комнате, а не приклеенным к голове. Именно здесь ambisonics окупается. Поскольку поле хранится в виде сферических гармоник, поворот всей сцены сводится к одной матричной операции над каналами – быстро, точно и до применения HRTF. Повернули голову на 30° вправо – система поворачивает поле на 30° влево в том же кадре, и голос, который был перед вами, остаётся перед вами.

Слежение за головой важно по двум причинам. Оно значительно улучшает вынос – ощущение, что звук исходит извне головы, – потому что мозг воспринимает источником звука то, что остаётся на месте при движении головы. Кроме того, оно устраняет неопределённость «спереди или сзади», возникающую из-за ITD/ILD: даже небольшое движение головы по-разному изменяет акустические признаки для источников спереди и сзади, и мозг использует эту разницу. Именно так работают AirPods и аналогичные наушники – их датчики отслеживают положение головы, а звук поворачивается вместе с ней, оставаясь привязанным к iPhone или Mac (Apple Support, 2024–2025). Проблема в задержке: чтобы эффект оставался убедительным, реакция звука должна следовать за движением головы в пределах нескольких десятков миллисекунд. В противном случае сама задержка становится признаком искусственности. Поэтому в пространственном звуке слежение за головой направлено на минимизацию задержки «движение–звук» – она должна быть настолько низкой, чтобы оставаться незаметной. Это та же строгая дисциплина, что и в всей цепочке обработки в реальном времени, включая WebRTC аудио-конвейер целиком.

Складываем всё вместе: три реальных стека

Три кирпича сочетаются по-разному в зависимости от продукта. Три конкретных стека охватывают большую часть выпускаемой продукции.

YouTube 360° / VR-видео. Автор создаёт амбисоник-микс первого порядка (AmbiX, ACN/SN3D), при необходимости дополняя его head-locked стереопарой для озвучки. YouTube сохраняет четырёхканальное поле и при воспроизведении поворачивает его в соответствии с ориентацией головы зрителя, применяя бинауральный рендеринг на основе HRTF от Google Resonance Audio – тех же HRTF, что Google открыл для VR (спецификация YouTube; SSA Plugins о Resonance Audio HRTF, 2018). Четыре канала позволяют сохранить скромный битрейт – поэтому FOA и стал выбором для масштабирования в вебе, хотя более высокие порядки обеспечивают лучшую локализацию.

Игра или опыт на VR-гарнитуре. Здесь движок обычно рендерит объекты напрямую в бинауральный звук по источникам или использует амбисонику третьего порядка для фонового слоя, а для ключевых звуков – объектный рендеринг: шестнадцать каналов TOA обеспечивают ту чёткость локализации, которой требует визуал нашлемного дисплея. HRTF по умолчанию универсальный, опция персонализации встречается всё чаще.

Иммерсивные видеоконференции. Пространственная конференция размещает каждого удалённого участника в отдельной виртуальной позиции, чтобы мозг мог различать перекрывающиеся голоса – это и есть эффект «коктейльной вечеринки». Обычно для каждого говорящего рендерится моно-поток через HRTF, соответствующий его «месту», после чего сигналы суммируются в бинауральный звук, а не передаётся полное амбисоник-поле; такой подход проще и лучше интегрируется с реал-тайм обработкой и микшированием, описанными в аудио в SFU, MCU и P2P и групповых звонках в масштабе. Пространственное разнесение голосов заметно повышает разборчивость речи при одновременной речи нескольких человек – что является реальной выгодой для конференц-продуктов.

Разобранный пример: цена перехода с FOA на TOA

Допустим, вы транслируете концерт в формате 360° и выбираете между амбисоникой первого и третьего порядка, обе в кодеке Opus при типичной скорости 64 кбит/с на канал. Количество каналов определяется по формуле (N+1)²:

FOA:  4 канала × 64 кбит/с  =  256 кбит/с
TOA: 16 каналов × 64 кбит/с = 1 024 кбит/с

Это рост битрейта в 4 раза – 256 кбит/с против чуть более 1 Мбит/с – за переход от грубой к чёткой локализации. Для веб-доставки на обычные наушники грубое поле FOA обычно – верный выбор: визуал – звезда, звук его поддерживает, и 256 кбит/с стримятся всем. Для привязанной VR-гарнитуры, где голова пользователя постоянно движется, а звук несёт иммерсивность, лишний мегабит TOA потрачен с толку. Решение не в том, «что лучше» – TOA всегда локализует точнее – а в том, стоит ли выигрыш в локализации того, чтобы потратить вчетверо больше бит на этот продукт и эту сеть. Тот же инженерный компромисс, что рассматривался для мультидорожек в математике хранения и CDN для аудио.

Где здесь Фора Софт

Пространственный звук присутствует во всех продуктах, которые мы создаём. В AR/VR амбисоник-слои с бинауральным рендерингом и отслеживанием положения головы делают сцену живой и естественной, а не просто воспроизведённой. В видеоконференциях и e-learning размещение каждого участника в отдельной виртуальной позиции помогает ориентироваться в перекрывающихся разговорах – тот же эффект разборчивости важен и в телемедицинских консультациях, где в кадре одновременно несколько человек. В OTT и интернет-телевидении бинауральный рендеринг позволяет иммерсивному миксу, созданному для колонок, эффективно восприниматься большинством зрителей, использующих наушники. Во всех этих случаях возникают одни и те же инженерные задачи, которые рассматривает статья: какой порядок амбисоники выбрать, использовать универсальный или персональный HRTF и как поддерживать задержку отслеживания головы на таком уровне, чтобы иллюзия присутствия оставалась убедительной.

Главное

  • У наушников два канала; пространственный звук вычисляет именно те два сигнала, которые услышали бы уши.
  • Мозг определяет местоположение звука по трём признакам: разнице во времени (ITD), разнице в уровне (ILD) и спектральным провалам ушной раковины.
  • HRTF объединяет все три признака в одно направление; персональные HRTF точнее универсальных по высоте и по передне-задней локализации.
  • Ambisonics хранит звуковое поле на всей сфере; для порядка N требуется (N+1)² каналов – 4 для FOA, 16 для TOA.
  • Используйте стандарты AmbiX (порядок ACN, нормализация SN3D) и файлы HRTF в форматах SOFA/AES69.
  • Отслеживание движения головы поворачивает амбисоническое поле до рендеринга – именно это поддерживает иллюзию присутствия.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.