Нормализация громкости: EBU R128, ITU-R BS.1770, ATSC A/85

Автор: Николай СапуновОбновлено: август 202627 мин чтения
Содержание статьи +

Опубликовано: 2026-06-05 · Время чтения: 21 мин · Автор: Николай Сапунов, CEO Фора Софт

Коротко

Нормализация громкости – это практика измерения того, насколько громко звучит контент для человеческого уха, и приведения его к фиксированному уровню, чтобы программы, реклама и платформы не «прыгали» по громкости. Основу задают три документа: ITU-R BS.1770 – это алгоритм измерения, преобразующий аудиодорожку в одно число по шкале LUFS; EBU R128 – европейский свод правил, устанавливающий цель −23 LUFS и порог пикового уровня −1 dBTP; ATSC A/85 – американский аналог, задающий −24 LKFS и обязательный к исполнению по закону через CALM Act. Эти стандарты почти полностью совпадают, поскольку используют один и тот же измерительный движок BS.1770; различия заключаются лишь в целевом значении, обработке диалогов и возможности штрафа за нарушение. Статья объясняет алгоритм простым языком, разбирает арифметику реального измерения и представляет единую таблицу целевых значений, которые вам, скорее всего, потребуются достичь.

Почему это важно

Если вы разрабатываете или поддерживаете сервис, передающий звук – стриминговую платформу, OTT-приложение, видеоконференц-систему, хостинг подкастов или эфирную цепочку вещателя, – кому-то в команде передают спецификацию с пометкой: «−23 LUFS, −1 dBTP, по BS.1770» и ожидают, что он поймёт, что это значит. Эта статья предназначена для продакт-менеджера, основателя или операционного лидера, которому нужно разобраться в этих цифрах настолько, чтобы включить их в договор, отклонить неподходящий контент или объяснить регулятору, почему реклама не громче основного вещания. К концу вы сможете читать любую спецификацию громкости в индустрии, понимать, какой из трёх стандартов действует в вашем регионе, и самостоятельно выполнять расчёты. Каждое число здесь основано на первоисточнике – рекомендациях ITU-R, документах EBU или стандартах ATSC, – а не на блогах производителей.

Какую задачу решает нормализация громкости

Начнём с опыта, знакомого каждому. Вы смотрите спокойный фильм, диалоги тихие, и вдруг – реклама, которая кажется вдвое громче, хотя громкость никто не менял. Вы хватаетесь за пульт. Этот резкий скачок и есть та самая проблема, ради устранения которой и существует всё поле нормализации громкости.

Реклама звучит громче, потому что десятилетиями уровень звука выравнивали по пикам – по максимальному мгновенному отсчёту сигнала. Пиковый измеритель отвечает только на один вопрос: «Не было ли клиппинга?» – и больше ни на что. Две дорожки могут иметь одинаковый пик, но при этом звучать совершенно по-разному, ведь громкость – это не самый громкий момент, а средняя энергия, воспринимаемая ухом во времени. Рекламодатель, сжимающий динамический диапазон – подтягивая тихие участки к громким, – сохраняет тот же пик, но значительно повышает среднюю громкость. Пиковый измеритель говорит, что обе дорожки в норме. А ухо слышит: одна из них кричит.

Нормализация громкости заменяет «выравнивание по пику» на «выравнивание по воспринимаемой громкости». Вместо вопроса «каким был самый громкий миг?» она задаёт вопрос: «насколько громко это в среднем звучало для человека?» – выдаёт одно число на всю программу и подталкивает каждую программу к одному и тому же значению. Как только весь контент нормализован до одной громкости, регулировку можно больше не трогать. Эта одна идея – измерить воспринимаемую громкость и привести всё к единой цели – и лежит в основе трёх стандартов, описанных в этой статье.

«Если термины LUFS, пик, RMS и базовые понятия громкости вам незнакомы, сначала ознакомьтесь с основами: Громкость, peak, RMS, LUFS – как измеряется реальная громкость звука. Эта статья предполагает, что вы понимаете, что такое значение LUFS, и сосредоточена на стандартах, которые его задают и используют в качестве цели.»

Три документа и как они складываются вместе

Про «стандарт громкости» часто говорят как о чём-то одном. На самом деле это три разных вещи, каждая из которых выполняет свою задачу. Их путаница – самая частая ошибка в письмах о доставке, поэтому важно сначала разобраться в сути, прежде чем переходить к цифрам.

Первый документ, ITU-R BS.1770, – это алгоритм измерения. ITU-R – сектор радиосвязи Международного союза электросвязи, глобального органа, стандартизирующего измерение вещательных сигналов. BS.1770 – своего рода рецепт: подайте ему аудиодорожку, и он вернёт одно число, описывающее громкость программы на шкале LUFS – Loudness Units relative to Full Scale, единицы громкости относительно полной шкалы. BS.1770 не указывает, к какому значению нужно стремиться. Это линейка, а не правило.

Второй документ, EBU R128, – это европейский свод норм. EBU – это Европейский вещательный союз, альянс европейских общественных вещателей. R128 берёт стандарт BS.1770 и говорит: измеряйте им, стремитесь к уровню −23 LUFS и никогда не позволяйте истинному пику превышать −1 dBTP. Это правило, основанное на стандарте.

Третий документ, ATSC A/85, – это американский свод целей. ATSC – это Advanced Television Systems Committee, организация, разрабатывающая стандарты цифрового телевидения в США. A/85 также использует шкалу BS.1770, но ориентируется на уровень −24 LKFS и иначе обрабатывает диалог. Этот стандарт строже, поскольку федеральный закон США – CALM Act – делает соответствие A/85 обязательным для телевизионной рекламы, а Федеральная комиссия по связи может оштрафовать вещателя за нарушение.

Так что связь проста: одна линейка (BS.1770) и два региональных правила поверх неё – EBU R128 в Европе и ATSC A/85 в США. Держите эту картину в голове: остальная часть статьи её наполняет.

Рис. 1. Одна линейка, два правила. BS.1770 измеряет; EBU R128 и ATSC A/85 каждый задают цель, которая использует это измерение.

ITU-R BS.1770: стандарт, по которому измеряют всё

BS.1770 – полное название «Algorithms to measure audio programme loudness and true-peak audio level» – это фундамент. Оба региональных свода ссылаются на него, так что понять его один раз – значит разобраться в измерительной части любой спецификации громкости. Текущая редакция – ITU-R BS.1770-5 (ноябрь 2023). Алгоритм состоит из четырёх шагов, и каждый из них можно освоить без специальной инженерной подготовки.

Шаг 1 – K-взвешивание: слышать так, как слышит ухо

Первый шаг корректирует восприятие громкости: мы слышим разные частоты с разной интенсивностью. Всплеск энергии на 3 кГц – примерно на уровне детского плача или звука пожарной сигнализации – кажется нам намного громче, чем такая же энергия на 50 Гц, то есть низком басовом гуле. Микрофон этого не учитывает – он одинаково реагирует на все частоты. Поэтому алгоритм сначала пропускает сигнал через фиксированную пару фильтров, вместе называемых K-взвешиванием, которые усиливают частоты, на которые ухо чувствительно, и ослабляют те, к которым оно нечувствительно. После K-взвешивания значения, с которыми работает алгоритм, соответствуют тому, что человек действительно воспринимает как громкое. Поэтому шкала LUFS в профессиональной среде обозначается как LKFS – Loudness, K-weighted, relative to Full Scale. LUFS и LKFS – это одно и то же число, просто с разными названиями: в Европе используют LUFS, в США – LKFS.

Шаг 2 – среднее квадратов: превратить волну в энергию

Волна тысячи раз в секунду колеблется в плюс и минус; если просто усреднить её, плюсы и минусы почти полностью сократятся. Поэтому алгоритм сначала возводит каждый отсчёт в квадрат – возведение в квадрат делает любое значение положительным и естественным образом соответствует мощности сигнала, то есть скорости передачи энергии. Затем он усредняет эти квадраты. Результат – среднеквадратичная энергия K-взвешенного сигнала: одно положительное число, показывающее, сколько перцептивной энергии содержала дорожка.

Шаг 3 – гейтинг: игнорировать тишину

Вот шаг, в котором BS.1770 отличается от наивного усреднения – и где большинство ошибается. Представьте двухчасовой фильм с долгими тихими сценами: задержка перед репликой, тихая ночная сцена. Если усреднить эти паузы по громкости, фильм с большим количеством тишины покажется искусственно тихим, и вы будете увеличивать громкость, пока громкие моменты не начнут бить по ушам. Гейтинг этому мешает. Алгоритм разбивает аудиосигнал на перекрывающиеся окна – блоки по 400 миллисекунд, каждый перекрывает соседний на 75% – и отбрасывает слишком тихие окна перед тем, как усреднять оставшиеся.

Выбрасывает в два прохода. Абсолютный гейт отбрасывает любой блок тише −70 LUFS – это фактически тишина, и она никогда не учитывается. Затем алгоритм измеряет среднее значение оставшихся блоков и применяет относительный гейт: отбрасывает любой блок, уровень которого ниже первого среднего более чем на 10 LU. (LU, Loudness Units – единица измерения разницы на шкале LUFS; LUFS – абсолютное значение, а LU – разница между двумя значениями.) То, что остаётся – блоки, реально несущие содержание программы, – усредняется в последний раз, и получается интегральная громкость (integrated loudness) – единственное число, характеризующее всю программу. Гейтинг был добавлен в BS.1770-2 (2011); в исходной версии 2006 года его не было – поэтому результаты измерений на старых, до-2011 года, приборах могут отличаться от современных.

Шаг 4 – истинный пик: поймать пик между отсчётами

Четвёртый шаг не связан с громкостью и отвечает на другой вопрос: не исказится ли сигнал при воспроизведении? Обычный пиковый измеритель анализирует цифровые отсчёты и показывает самый высокий из них. Однако реальная аналоговая волна, воспроизводимая динамиком, проходит через эти точки отсчёта и иногда выше них – истинный пик может оказаться выше любого отдельного отсчёта. BS.1770 вычисляет истинный пик (true peak), передискретизируя сигнал (восстанавливая волну с учетверённой частотой) и находя реальный максимум, выражаемый в dBTP – децибелах относительно полной шкалы, истинный пик. Коэффициенты фильтра истинного пика были уточнены в BS.1770-3 (2012). Поэтому спецификация указывает «−1 dBTP», а не «−1 dBFS»: она требует, чтобы истинный межотсчётный пик оставался чуть ниже цифрового потолка, чтобы при аналоговом воспроизведении не происходило клиппирования.

Рис. 2. Конвейер измерения BS.1770: K-взвешивание, возведение в квадрат, гейтинг, интегрирование – плюс отдельная ветвь для измерения истинного пика. На выходе получаются одно значение LUFS и одно значение dBTP.

Разберём арифметику гейта

Шаг гейтинга абстрактен, поэтому приведём расчёт относительного порога на реальных числах. Допустим, абсолютно гейтированное среднее по программе – все блоки выше −70 LUFS, усреднённые – составляет −21 LUFS. Тогда относительный гейт установлен на 10 LU ниже:

порог относительного гейта = абс.-гейт. громкость − 10 LU
порог относительного гейта = −21 LUFS − 10 LU
порог относительного гейта = −31 LUFS

Теперь алгоритм пересчитывает усреднение, оставляя только блоки громче −31 LUFS и отбрасывая всё тише. Допустим, итоговый результат составил −20,4 LUFS. Эти −20,4 LUFS – интегральная громкость программы, то есть величина, которую вы сравниваете с целевой. Поскольку блоки с тихими сценами исключены, эта цифра отражает громкость основного содержания программы, а не её пауз и тишины.

EBU R128: европейский свод правил

EBU R128 – «Loudness normalisation and permitted maximum level of audio signals» – это документ, который с 2010 года превратил нормализацию громкости из теории в европейский вещательный закон по соглашению. Он краткий и предписательный. В нём сформулированы четыре требования, которые важно знать точно.

Первое: цель – −23 LUFS, измеренная по BS.1770. Каждая нормализованная программа стремится к этому единственному числу. Второе: допуск ±0.5 LU для контента, который можно обработать точно (большинство файловой доставки), расширяется до ±1 LU для менее предсказуемого материала вроде живого микса, где громкость нельзя отрепетировать. Третье: истинный пик никогда не превышает −1 dBTP. Четвёртое: R128 вводит спутник-меру, Loudness Range (LRA), диапазон громкости – насколько громкость меняется внутри программы, единое число разброса «тихо–громко» в LU, чтобы спецификация могла требовать динамики, которая не плоская и не дико неровная. LRA задан в EBU Tech 3342.

R128 не переопределяет измерение; он указывает на BS.1770 и добавляет практический каркас, нужный вещателям. Этот каркас живёт в семействе спутниковых документов EBU Tech: Tech 3341 задаёт «EBU Mode»-измеритель с тремя показаниями – Momentary (мгновенный, окно 400 мс, ловит всплески), Short-term (краткосрочный, окно 3 секунды, следит за миксом в работе) и Integrated (интегральное гейтированное число на всю программу, которое должно попасть в −23). Tech 3343 покрывает производственную практику, а Tech 3344 – дистрибуцию, включая то, как передавать метаданные громкости современным иммерсивным кодекам вроде AC-4 и MPEG-H.

Стандарт адаптировался к тому, как люди на самом деле слушают звук. Базовая рекомендация – на версии 5.0 (ноябрь 2023), и теперь она включает четыре дополнения для контекстов, которых не было в исходном вещательном документе 2010 года: R128 s1 – для короткого контента, например рекламы и промо, R128 s2 («Loudness in Streaming», ноябрь 2023) – для on-demand и стриминговой дистрибуции, R128 s3 – для радио и R128 s4 – для кинематографического контента. Дополнение для стриминга особенно важно: прослушивание на телефоне и в наушниках терпит – и зачастую предпочитает – более громкий звук, чем в тихой гостиной, поэтому музыкальные треки в стримингах чаще всего находятся ближе к −14 LUFS, а не к −23. Подробно о целевых значениях на каждой платформе мы рассказываем в LUFS: целевые значения по платформам в 2026.

ATSC A/85 и CALM Act: американский свод с зубами

Американская история – это тот же алгоритм, но с иной целью и иным юридическим механизмом принуждения, отсутствующим в европейской системе соглашений.

ATSC A/85 – «Techniques for Establishing and Maintaining Audio Loudness for Digital Television» – устанавливает целевой уровень громкости цифрового телевидения США на уровне −24 LKFS, что на один децибел тише европейского стандарта −23 LKFS. Действующая версия – A/85:2013 с поправкой № 1 (февраль 2021), измерения проводятся по стандарту BS.1770-3. Разница в один LU между ATSC A/85 и EBU R128 носит исторический и практический характер, а не перцептивный; для любого реального аудиопроцесса уровни −23 и −24 настолько близки, что единый микс под оба стандарта требует лишь снижения громкости на один децибел.

A/85 отличается от R128 в одном существенном аспекте – способе обработки диалога. R128 измеряет громкость всей программы целиком, тогда как A/85 опирается на концепцию Anchor Element (якорного элемента) – части аудиодорожки, по которой слушатель интуитивно оценивает громкость. В большинстве телевизионных программ таким элементом является диалог. A/85 нормализует уровень звука именно по этому якорю, поэтому фильм с громкими экшн-сценами и тихими диалогами выравнивается по уровню диалога – именно на нём зритель сосредоточен в первую очередь. Именно этот подход, ориентированный на диалог, объясняет, почему в американских спецификациях доставки чаще упоминается dialnorm (см. ниже), чем в европейских.

Причина, по которой A/85 весит больше обычной рекомендованной практики, – CALM Act, Commercial Advertisement Loudness Mitigation Act, федеральный закон США, вступивший в силу в декабре 2012 года. CALM Act не устанавливает собственные технические требования – он ссылается на ATSC A/85 и делает соблюдение этого стандарта обязательным для телевизионной рекламы. Контроль за выполнением закона осуществляет Федеральная комиссия по связи (FCC), и вещатель, допустивший, что реклама звучит громче окружающих программ, может столкнуться с жалобами и санкциями. Таким образом, в США нормализация громкости – не просто лучшая практика, которую может выбрать вещатель: для рекламы это закон, а техническое определение «слишком громко» – уровень −24 LKFS из A/85.

Dialnorm: метаданные, содержащие уровень громкости

Один термин постоянно всплывает в американской и Dolby-ориентированной доставке и сбивает с толку всех, кто с ним сталкивается: dialnorm. Это сокращение от dialogue normalization – небольшие метаданные внутри кодеков Dolby (AC-3 и E-AC-3), которые указывают устройству воспроизведения, насколько громко звучит диалог программы, выраженный как положительное число децибел ниже полной шкалы. Если диалог вашей программы измеряется на уровне −24 LKFS и вы передаёте его без изменений, вы устанавливаете dialnorm = 24. Декодер в телевизоре считывает это значение 24 и автоматически ослабляет сигнал так, чтобы диалог каждой программы воспроизводился с одинаковой комфортной громкостью, независимо от того, как она была сведена.

Подводный камень жесток в своей простоте: если значение dialnorm неверно – если оно указывает 24, а диалог на самом деле на уровне −31, – декодер применяет неправильную коррекцию, и программа звучит с неправильной громкостью, нарушая всю систему. Практическую работу с dialnorm, replay gain и нормализацией в кодировщиках мы разбираем в Громкость на практике: dialnorm, normalize, attenuate, replay gain.

Бок о бок: как три стандарта соотносятся

Стандарты в большей степени совпадают, чем различаются, поскольку используют общий измерительный движок BS.1770. Ниже приведена таблица – это основная сравнительная картина, вокруг которой строится спецификация доставки.

АтрибутITU-R BS.1770EBU R128ATSC A/85
Что этоАлгоритм измеренияЕвропейский свод целейАмериканский свод целей
Текущая редакцияBS.1770-5 (ноя 2023)R128 v5.0 (ноя 2023)A/85:2013 + Corr. 1 (фев 2021)
Цель громкостинет – только измеряет−23 LUFS−24 LKFS
Имя единицыLKFS / LUFSLUFSLKFS
Основа измерениясам по себеBS.1770BS.1770-3
Обработка диалогатолько гейтингвся программаAnchor Element (диалог)
Потолок истинного пиказадаёт dBTP−1 dBTP−2 dBTP (рекоменд.)
Допуск – ±0.5 LU (±1 LU live)±2 LU (типичная практика)
Юридическая силанетсоглашение вещателейобязателен для рекламы (CALM Act)

Таблица 1. Три документа по громкости в одном обзоре. Общий стандарт BS.1770 – причина того, что цели находятся на расстоянии одного LU друг от друга, а не в разных системах. Источники: ITU-R BS.1770-5; EBU R128 v5.0; ATSC A/85:2013.

Заметьте, что делает таблицу очевидной: жёсткие различия – это целевое число (−23 против −24), обработка диалога (вся программа против якоря) и юридический статус (соглашение против закона). Всё остальное – общее. Команда, которая это усвоила, перестаёт воспринимать спецификации «EBU» и «ATSC» как чужеродные и начинает видеть в них одно измерение с двумя региональными ручками.

Полная нормализация, от начала до конца

Свяжем всё на полном примере. Вы получаете готовую программу. Ваш измеритель, реализующий BS.1770-5, показывает интегральную громкость −20,4 LUFS и истинный пик −0,3 dBTP. Ваша спецификация доставки – EBU R128: цель −23 LUFS, потолок −1 dBTP.

Сначала коррекция громкости. Вы на 2.6 LU громче, так что убавляете всю программу на эту величину:

требуемое усиление = цель − измеренное
требуемое усиление = −23 LUFS − (−20.4 LUFS)
требуемое усиление = −2.6 LU

Вы применяете усиление −2,6 дБ ко всей программе. Поскольку вы сдвинули весь сигнал на одну и ту же величину, соотношения внутри микса остались неизменными – изменился только общий уровень. Теперь проверьте пик заново. Истинный пик составлял −0,3 дБТП; снижение уровня на 2,6 дБ также снижает и пик:

новый истинный пик = старый истинный пик + усиление
новый истинный пик = −0.3 dBTP + (−2.6 dB)
новый истинный пик = −2.9 dBTP

−2,9 дБТП ниже потолка −1 дБТП, так что программа проходит оба теста: −23 LUFS интегрально и −2,9 дБТП по истинному пику. Обратите внимание: порядок важен. Если бы коррекция громкости была вверх – то есть программа была бы слишком тихой – подъём уровня мог бы вывести истинный пик выше −1 дБТП, и тогда потребовался бы лимитер истинного пика, чтобы вернуть пики обратно, не изменяя интегральную громкость. Эта ловушка порядка – следующий подводный камень.

«Подводный камень – нормализовать громкость и пик в неверном порядке или спутать их. Громкость (LUFS, среднее) и истинный пик (dBTP, максимум) – разные измерения, и оба нужно учитывать. Классическая ошибка – сначала ограничить пики, а потом поднять громкость, из-за чего пики снова выходят за пределы допустимого; или путать значение пика со значением громкости. Правило: сначала приведите интегральную громкость к целевому уровню, затем проверьте истинный пик, и только если он превышает потолок – примените лимитер истинного пика. После этого обязательно перепроверьте громкость, потому что жёсткое лимитирование может её изменить. Подробно о межотсчётных пиках – в Истинный пик, dBTP и проблема межотсчётного пика.»

Второй подводный камень: путаница между −23 и −14

Самое вредное заблуждение в этой области – «−23 LUFS – это тот самый стандарт громкости». Это вещательный стандарт. Целевое значение зависит исключительно от того, где будет воспроизводиться контент. Европейское и американское вещание держится около −23/−24 LUFS, потому что в гостиной с внимательными слушателями низкий фоновый шум и широкая динамика ценятся. Музыкальные стриминговые сервисы нормализуют звук значительно громче – Spotify и другие находятся около −14 LUFS, – поскольку прослушивание в телефоне и наушниках в шумной обстановке требует более плотного, громкого и ровного сигнала. А кино – это снова особый случай: оно калибруется по опорному уровню, а не по цели в LUFS.

Загрузите подкаст, сведённый на −23 LUFS, на платформу, рассчитанную на −16, – и слушатели будут крутить громкость. Именно такое поведение нормализация должна была предотвратить. Стандарты, описанные в этой статье, объясняют как измерять и задают вещательные цели; цели по платформам – в отдельной таблице, и ошибка в ней – частая, но легко предотвратимая оплошность. Полный набор на 2026 год доступен в LUFS: целевые значения по платформам в 2026.

Где здесь Фора Софт

В продуктах OTT, видеостриминга, e-learning, телемедицины и видеоконференций, которые мы разрабатываем с 2005 года, вопрос громкости возникает регулярно: приходит спецификация доставки или партнёрская интеграция с требованиями «−23 LUFS, −1 dBTP, BS.1770», и команде нужно измерение, встроенное в конвейер, а не ручная проверка в конце. Для OTT- и стриминговых клиентов мы интегрируем измерение громкости по стандарту BS.1770 и лимитер истинного пика на этапе транскодирования, чтобы каждый медиаконтент нормализовался до целевых параметров спецификации ещё до попадания в упаковщик. В e-learning и телемедицине, где разборчивость речи – ключевой фактор продукта, мы нормализуем записанный звук к единой цели, чтобы и тихий, и громкий лектор воспринимались слушателем на комфортной громкости. Сам стандарт не меняется – меняется лишь целевое значение громкости и порог истинного пика, требуемые рынком конкретного проекта.

Главное

  • BS.1770 – стандарт измерения; EBU R128 и ATSC A/85 – региональные стандарты.
  • BS.1770 работает в четыре этапа: K-взвешивание, возведение в квадрат, подавление тихих участков, интегрирование.
  • EBU R128 ориентируется на уровень −23 LUFS, истинный пик – не выше −1 dBTP, допустимое отклонение ±0,5 LU по BS.1770.
  • ATSC A/85 устанавливает цель −24 LKFS, использует якорь по диалогу и является обязательным в соответствии с законом CALM Act.
  • Сначала нормализуйте общую громкость, затем проверьте и ограничьте истинный пик.
  • −23 LUFS – цель для вещания; стриминговые платформы и музыкальные релизы используют более высокие уровни, например −14 LUFS.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.