Живое аудио: контрибуционные кодеки, AES67 и SMPTE ST 2110–30

Автор: Николай СапуновОбновлено: август 202611 мин чтения
Содержание статьи +

Коротко

Прежде чем прямой эфир попадёт к зрителю, его звук проходит по двум принципиально разным маршрутам: короткому высококачественному «контрибуционному» участку от площадки до студии и длинному сжатию – «дистрибуционному» пути от студии до аудитории. Внутри вещательного объекта звук передаётся без сжатия по обычным IP-сетям с использованием двух близких стандартов – AES67 и SMPTE ST 2110-30, – при этом оба синхронизированы по общим сетевым часам, чтобы все микрофоны работали в одном ритме. Когда сигнал покидает здание и отправляется через публичный интернет, инженеры переходят на кодеки с минимальной задержкой, такие как AAC-LD или Opus, упакованные в надёжный транспортный протокол вроде SRT. Эта статья объясняет всю цепочку простым языком – с реальными цифрами по пропускной способности и задержке, необходимыми для проектирования живой системы.

Почему это важно

Если вы транслируете живое видео – будь то спорт, концерты, новости, богослужения или эфиры с удалёнными гостями, – именно звуковой тракт превращает «починим потом» в сорванный эфир. Решения, принятые в первые секунды сигнальной цепочки, определяют, останутся ли каналы синхронными, сколько пропускной способности сети потребуется и сколько задержки накопится до того, как зритель услышит первое слово. Статья адресована продакт-менеджерам и инженерам, которым нужно чётко описывать живую систему передачи и общаться с вещательными вендорами без догадок. К концу вы научитесь отличать контрибуцию от дистрибуции, читать спецификации AES67 или ST 2110-30 и выбирать правильный кодек для каждого участка пути.

Две поездки, а не одна: контрибуция и дистрибуция

Главная идея, открывающая всю тему: живой звук проходит два отдельных пути, и у них противоположные приоритеты.

Первая поездка – контрибуция (contribution). Это передача звука от места его записи – стадиона, концертного зала или точки удалённого репортёра – обратно в продакшен-хаб или студию. Контрибуционный звук – это сырой материал. Его ещё предстоит микшировать, выравнивать по громкости, дублировать на другие языки и совмещать с графикой. Поскольку он будет перекодирован позже, его передают в максимально возможном качестве и с минимальной задержкой, чтобы команда продакшена могла оперативно реагировать. Представьте контрибуцию как доставку свежих продуктов на кухню: вы не упаковываете их в вакуум и не замораживаете – ведь шеф-повару ещё предстоит готовить.

Вторая поездка – дистрибуция (distribution). Это процесс доставки готового студийного микса к аудитории – через интернет (HLS, DASH) или эфир. Дистрибуционный звук – это уже готовое блюдо. Его сильно сжимают, ведь он идёт на миллионы устройств, а пропускная способность – главный ресурс, при этом задержка в несколько секунд вполне допустима.

Остальная часть статьи посвящена контрибуционному участку, потому что именно его команды чаще всего недооценивают. Кодеки, тактовые частоты и стандарты здесь совершенно иные, чем на стороне дистрибуции.

Рисунок 1. Две поездки живого звука. Контрибуция ценит качество и низкую задержку; дистрибуция – минимальную полосу пропускания и масштабируемость.

Внутри здания: несжатый звук по IP

Двадцать лет назад звук в студии передавался по выделенным кабелям – по одному физическому проводу на канал, в форматах вроде AES3. Сегодня он передаётся пакетами данных по той же сети Ethernet, что и всё остальное. Этот переход породил потребность в единых правилах, чтобы микрофонный предусилитель одного производителя и микшерный пульт другого могли обмениваться звуком без дополнительной конвертации. На рынке доминируют два таких стандарта, и они намеренно совместимы.

AES67: общий язык для звука по IP

AES67 – стандарт Audio Engineering Society, впервые опубликованный в 2013 году, последняя редакция – AES67-2023. Это не продукт и не сеть, а соглашение о том, как упаковать профессиональный аудиосигнал в сетевые пакеты, чтобы оборудование разных производителей (и конкурирующие экосистемы вроде Dante, Ravenna и Livewire) могли работать совместно.

AES67 передаёт несжатый звук. Здесь нет кодека в привычном смысле – звук представлен в формате линейного PCM, то есть в «сыром» виде «отсчёт за отсчётом», как мы описывали в вводном материале о цифровом звуке. Данные передаются в виде 16-битных (L16) или 24-битных (L24) отсчётов через RTP (Real-time Transport Protocol) поверх UDP. Базовым стандартом является 24-битный звук с частотой дискретизации 48 кГц; также поддерживаются частоты 44,1, 88,2 и 96 кГц.

Ключевая особенность AES67 – способ, которым звук разделяется на пакеты. Звук разбивается на мелкие временные фрагменты, называемые временем пакета (packet time). По умолчанию оно составляет 1 миллисекунду, что при частоте дискретизации 48 кГц соответствует ровно 48 отсчётам на пакет. Уменьшение времени пакета (до 125 микросекунд, или 12 отсчётов) снижает задержку, но увеличивает количество пакетов в секунду и сетевые накладные расходы. Полезная нагрузка RTP ограничена 1460 байтами, чтобы пакет умещался в стандартный кадр Ethernet объёмом 1500 байт без фрагментации.

Общие часы: PTP и почему это решает всё

Вот часть, которая отделяет звук поверх IP от обычной сети. Каждое устройство в сети AES67 синхронизируется с одним общим источником времени – «настенными часами», распространяемыми по сети с помощью протокола точного времени PTP (Precision Time Protocol), определённого в стандарте IEEE 1588-2008. Медиа-часы потока с частотой 48 кГц продвигаются ровно на 48 000 отсчётов за каждую секунду, отсчитываемую этими общими часами.

Почему это так важно? Потому что живой микс объединяет десятки источников. Если микрофон слева и микрофон справа работают на слегка отличающихся часах, их сигналы за минуты начинают расходиться, и микс «размазывается». PTP обеспечивает каждому устройству единый временной ритм, поэтому 48 000 отсчётов везде соответствуют одной и той же секунде. В небольшой гигабитной сети типичная конфигурация AES67 (48 отсчётов на пакет, 24 бита, 48 кГц) обеспечивает сквозную задержку около 2–3 миллисекунд.

«Частая ошибка: забыть про часы. Команды, впервые работающие со звуком поверх IP, приобретают совместимое AES67-оборудование, включают его и сталкиваются с щелчками, пропаданием сигнала или медленным дрейфом. Причина почти всегда в PTP: не выбран ведущий узел (grandmaster), или два устройства одновременно считают себя ведущими, либо коммутатор без поддержки PTP искажает пакеты синхронизации. Совместимость AES67 – это прежде всего вопрос тактирования, а не кодека. Заложите в бюджет коммутаторы с поддержкой PTP и продумайте топологию часов ещё до покупки первого пульта.»

SMPTE ST 2110-30: AES67 с вещательными ограничениями

Если AES67 – общий язык, то SMPTE ST 2110-30 – его вещательный диалект. ST 2110 – это семейство стандартов, предназначенных для передачи отдельных потоков видео, звука и метаданных («эссенций») по IP в профессиональной среде. Его звуковая часть, ST 2110-30, передаёт цифровой звук в формате PCM, опираясь на AES67, но при этом ограничивает возможности, чтобы поведение вещательного оборудования было предсказуемым.

Это достигается с помощью уровней соответствия (conformance levels). Вместо того чтобы оставлять частоту дискретизации и количество каналов полностью открытыми, стандарт ST 2110-30 определяет именованные уровни. Обязательный – Level A: 48 кГц, 16 или 24 бита, от 1 до 8 каналов, длительность пакета – 1 мс. Уровни B и C расширяют возможности уровня A, позволяя передавать больше каналов в одном потоке, а варианты с «X» (AX, BX, CX) обеспечивают более короткое время пакета для снижения задержки. Устройство, поддерживающее Level C, автоматически поддерживает и Level A, поэтому между любыми двумя устройствами всегда существует общая база для отката.

Стоит знать и о смежном стандарте: ST 2110-31 передаёт звук AES3 битово-прозрачно. Это важно, если поток – не чистый PCM, например, сигнал Dolby E или закодированный surround, который должен пройти через систему без изменений. Используйте -30 для PCM; используйте -31, когда нужно «протуннелировать» предварительно закодированный звук, не изменяя его.

СвойствоAES67SMPTE ST 2110-30 (Level A)
Формат звукаНесжатый PCM (L16 / L24)Несжатый PCM (16 / 24 бита)
Частоты дискретизации44,1 / 48 / 88,2 / 96 кГц48 кГц (96 кГц на старших уровнях)
ТранспортRTP поверх UDPRTP поверх UDP (по AES67)
ЧасыPTP (IEEE 1588-2008)PTP (IEEE 1588-2008)
Время пакета125 мкс – 4 мс (по умолч. 1 мс)1 мс (короче в уровнях «X»)
Каналов в потокеГибко1–8 (Level A); больше в B / C
Создан дляСовместимости вендоровПредсказуемого вещательного развёртывания

Практический вывод: AES67 позволяет двум устройствам обмениваться данными; ST 2110-30 обеспечивает единообразное поведение сотен устройств на реальном вещательном объекте. Сегодня большинство профессионального звукового оборудования поддерживает оба стандарта.

Рисунок 2. IP-объект для звука: PTP grandmaster раздаёт общее время; источники и микшер обмениваются потоками ST 2110-30 PCM по одной сети.

Математика полосы: несжатое – тяжёлое

Несжатый звук внутри объекта обходится недорого в гигабитной или 10-гигабитной сети, но цифры стоит посмотреть, чтобы понять, почему его нельзя передавать через открытый интернет. Пропускная способность для сырого PCM – это просто частота дискретизации, умноженная на разрядность и количество каналов:

полоса = частота_дискретизации (Гц) × разрядность (байты) × каналы

Стереопара при 48 кГц, 24 бита (3 байта на отсчёт):

48 000 × 3 × 2 = 288 000 байт/с = 2,304 Мбит/с

8-канальный поток ST 2110-30 того же качества:

48 000 × 3 × 8 = 1 152 000 байт/с = 9,216 Мбит/с

И это без учёта заголовков пакетов. Девять мегабит на восемь каналов звука – мелочь для локальной сети, но через публичный интернет на удалённую площадку такую пропускную способность гарантировать нельзя. Именно поэтому, как только звук покидает здание, правила меняются.

Покидаем здание: контрибуция через публичный интернет

Когда площадка не подключена к вашему объекту проводом – репортёр в другой стране, стадион на другом конце города, гость у себя дома – вы не можете использовать AES67. В публичном интернете отсутствуют общие часы PTP, он теряет пакеты и страдает от колебаний задержки. Контрибуция по IP решает эту проблему двумя компонентами: кодеком с низкой задержкой, чтобы минимизировать звук, и надёжным транспортом, чтобы компенсировать потерю пакетов.

Контрибуционные кодеки с низкой задержкой

Дистрибуционные кодеки, такие как обычный AAC-LC, ориентированы на эффективность и допускают задержку в десятки миллисекунд. Контрибуции требуют противоположного – минимальной задержки, чтобы ведущие и операторы могли взаимодействовать в реальном времени. Кодеки, разработанные для таких задач, жертвуют частью эффективности ради очень низкой задержки.

Семейство AAC-ELD от Fraunhofer – главная вещательная рабочая лошадка. AAC-LD обеспечивает максимальную алгоритмическую задержку около 20 мс; AAC-ELD снижает её примерно до 15 мс при частоте дискретизации 48 кГц, а в режиме минимальной задержки – до 7,5 мс (блок из 240 отсчётов). Opus, открытый кодек, доминирующий в WebRTC, также является сильным выбором для контрибуции: он работает с кадрами длительностью от 2,5 до 60 мс и включает встроенную упреждающую коррекцию ошибок (FEC), позволяющую восстанавливать потерянный кадр на основе данных из следующего пакета. European Broadcasting Union закрепила требования к контрибуционным кодекам в EBU Tech 3326 (стандарт ACIP): G.711, G.722, MPEG Layer 2 и 16-битный PCM – обязательны; AAC и AAC-LD – рекомендованы; Opus – опционален. Этот перечень отражает скорее возраст стандарта (редакция 2014 года), чем современную практику 2026 года, когда для интернет-контрибуции Opus часто выбирают в первую очередь.

Надёжный транспорт: SRT, RIST, Zixi

Кодек с низкой задержкой бесполезен, если сеть теряет 5% пакетов, а у вас нет способа их восстановить. Пересылать всё целиком (как делает TCP) – слишком большая задержка для реального времени. В качестве альтернативы – семейство протоколов на базе UDP, добавляющих автоматический запрос повтора ARQ (Automatic Repeat reQuest): выборочно перезапрашиваются только потерянные пакеты в жёстких временных рамках, плюс шифрование.

Три протокола, которые вы услышите по имени: SRT (Secure Reliable Transport – открытый исходный код, станет выбором по умолчанию в 2026 году, поддерживается OBS, FFmpeg и почти всеми аппаратными энкодерами), RIST (Reliable Internet Stream Transport – открытый протокол с зрелой гибридной схемой FEC и ARQ) и Zixi (коммерческий протокол, заранее передающий часть избыточности, что даёт преимущество в сетях с устойчивыми потерями 3–8%). Для большинства задач одноканальной интернет-контрибуции SRT – оптимальный выбор; звук передаётся в том же SRT-туннеле, что и видео.

Рисунок 3. Интернет-контрибуция: кодирование кодеком с низкой задержкой, защита надёжным транспортом, декодирование и пере-микс в студии.

Где здесь Фора Софт

Фора Софт разрабатывает программное обеспечение для живых и реалтайм-медиа с 2005 года – в сфере видеоконференцсвязи, OTT- и интернет-ТВ-платформ, e-learning и телемедицины. Разделение «контрибуция против дистрибуции» проявляется почти в каждом реальном проекте, над которым мы работаем: функция удалённого гостя на стриминговой платформе – это задача контрибуции (низкая задержка, надёжный транспорт, чистый ремикс), присоединённая к задаче дистрибуции (адаптивный битрейт под аудиторию). Команды, воспринимающие весь конвейер как одну стадию, сталкиваются с рассинхронизацией звука или неприемлемо высокой задержкой; инженерная ценность – в отдельном проектировании двух участков и точной синхронизации временных меток между ними. Это та архитектурная развилка, на которой мы помогаем продуктовым командам принять правильное решение ещё до начала написания кода.

Главное

  • Живой звук – это два этапа: контрибуция (от площадки к студии, высокое качество, минимальная задержка) и дистрибуция (от студии к аудитории, сжатие, масштабирование).
  • AES67 передаёт несжатый PCM по IP и обеспечивает совместимость оборудования разных производителей, синхронизируясь по общим часам PTP.
  • SMPTE ST 2110-30 опирается на AES67 и вводит уровни соответствия (уровень A обязателен: 48 кГц, 1–8 каналов, пакеты по 1 мс) для обеспечения предсказуемости.
  • Восемь каналов несжатого звука 48 кГц / 24 бита занимают около 9,2 Мбит/с – это нормально для локальной сети, но невозможно гарантировать в открытом интернете.
  • Интернет-контрибуция использует кодек с низкой задержкой (AAC-ELD – около 15 мс или Opus с FEC), упакованный в надёжный транспортный протокол (SRT, RIST или Zixi).
  • Проблемы со звуком в IP-сетях внутри объекта почти всегда связаны с синхронизацией (PTP), а не с кодеком.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.