Содержание статьи +
- Коротко
- Почему это важно
- Какую задачу решает нормализация громкости
- Три документа и как они складываются вместе
- ITU-R BS.1770: стандарт, по которому измеряют всё
- EBU R128: европейский свод правил
- ATSC A/85 и CALM Act: американский свод с зубами
- Бок о бок: как три стандарта соотносятся
- Полная нормализация, от начала до конца
- Второй подводный камень: путаница между −23 и −14
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Опубликовано: 2026-06-05 · Время чтения: 21 мин · Автор: Николай Сапунов, CEO Фора Софт
Коротко
Нормализация громкости – это практика измерения того, насколько громко звучит контент для человеческого уха, и приведения его к фиксированному уровню, чтобы программы, реклама и платформы не «прыгали» по громкости. Основу задают три документа: ITU-R BS.1770 – это алгоритм измерения, преобразующий аудиодорожку в одно число по шкале LUFS; EBU R128 – европейский свод правил, устанавливающий цель −23 LUFS и порог пикового уровня −1 dBTP; ATSC A/85 – американский аналог, задающий −24 LKFS и обязательный к исполнению по закону через CALM Act. Эти стандарты почти полностью совпадают, поскольку используют один и тот же измерительный движок BS.1770; различия заключаются лишь в целевом значении, обработке диалогов и возможности штрафа за нарушение. Статья объясняет алгоритм простым языком, разбирает арифметику реального измерения и представляет единую таблицу целевых значений, которые вам, скорее всего, потребуются достичь.
Почему это важно
Если вы разрабатываете или поддерживаете сервис, передающий звук – стриминговую платформу, OTT-приложение, видеоконференц-систему, хостинг подкастов или эфирную цепочку вещателя, – кому-то в команде передают спецификацию с пометкой: «−23 LUFS, −1 dBTP, по BS.1770» и ожидают, что он поймёт, что это значит. Эта статья предназначена для продакт-менеджера, основателя или операционного лидера, которому нужно разобраться в этих цифрах настолько, чтобы включить их в договор, отклонить неподходящий контент или объяснить регулятору, почему реклама не громче основного вещания. К концу вы сможете читать любую спецификацию громкости в индустрии, понимать, какой из трёх стандартов действует в вашем регионе, и самостоятельно выполнять расчёты. Каждое число здесь основано на первоисточнике – рекомендациях ITU-R, документах EBU или стандартах ATSC, – а не на блогах производителей.
Какую задачу решает нормализация громкости
Начнём с опыта, знакомого каждому. Вы смотрите спокойный фильм, диалоги тихие, и вдруг – реклама, которая кажется вдвое громче, хотя громкость никто не менял. Вы хватаетесь за пульт. Этот резкий скачок и есть та самая проблема, ради устранения которой и существует всё поле нормализации громкости.
Реклама звучит громче, потому что десятилетиями уровень звука выравнивали по пикам – по максимальному мгновенному отсчёту сигнала. Пиковый измеритель отвечает только на один вопрос: «Не было ли клиппинга?» – и больше ни на что. Две дорожки могут иметь одинаковый пик, но при этом звучать совершенно по-разному, ведь громкость – это не самый громкий момент, а средняя энергия, воспринимаемая ухом во времени. Рекламодатель, сжимающий динамический диапазон – подтягивая тихие участки к громким, – сохраняет тот же пик, но значительно повышает среднюю громкость. Пиковый измеритель говорит, что обе дорожки в норме. А ухо слышит: одна из них кричит.
Нормализация громкости заменяет «выравнивание по пику» на «выравнивание по воспринимаемой громкости». Вместо вопроса «каким был самый громкий миг?» она задаёт вопрос: «насколько громко это в среднем звучало для человека?» – выдаёт одно число на всю программу и подталкивает каждую программу к одному и тому же значению. Как только весь контент нормализован до одной громкости, регулировку можно больше не трогать. Эта одна идея – измерить воспринимаемую громкость и привести всё к единой цели – и лежит в основе трёх стандартов, описанных в этой статье.
«Если термины LUFS, пик, RMS и базовые понятия громкости вам незнакомы, сначала ознакомьтесь с основами: Громкость, peak, RMS, LUFS – как измеряется реальная громкость звука. Эта статья предполагает, что вы понимаете, что такое значение LUFS, и сосредоточена на стандартах, которые его задают и используют в качестве цели.»
Три документа и как они складываются вместе
Про «стандарт громкости» часто говорят как о чём-то одном. На самом деле это три разных вещи, каждая из которых выполняет свою задачу. Их путаница – самая частая ошибка в письмах о доставке, поэтому важно сначала разобраться в сути, прежде чем переходить к цифрам.
Первый документ, ITU-R BS.1770, – это алгоритм измерения. ITU-R – сектор радиосвязи Международного союза электросвязи, глобального органа, стандартизирующего измерение вещательных сигналов. BS.1770 – своего рода рецепт: подайте ему аудиодорожку, и он вернёт одно число, описывающее громкость программы на шкале LUFS – Loudness Units relative to Full Scale, единицы громкости относительно полной шкалы. BS.1770 не указывает, к какому значению нужно стремиться. Это линейка, а не правило.
Второй документ, EBU R128, – это европейский свод норм. EBU – это Европейский вещательный союз, альянс европейских общественных вещателей. R128 берёт стандарт BS.1770 и говорит: измеряйте им, стремитесь к уровню −23 LUFS и никогда не позволяйте истинному пику превышать −1 dBTP. Это правило, основанное на стандарте.
Третий документ, ATSC A/85, – это американский свод целей. ATSC – это Advanced Television Systems Committee, организация, разрабатывающая стандарты цифрового телевидения в США. A/85 также использует шкалу BS.1770, но ориентируется на уровень −24 LKFS и иначе обрабатывает диалог. Этот стандарт строже, поскольку федеральный закон США – CALM Act – делает соответствие A/85 обязательным для телевизионной рекламы, а Федеральная комиссия по связи может оштрафовать вещателя за нарушение.
Так что связь проста: одна линейка (BS.1770) и два региональных правила поверх неё – EBU R128 в Европе и ATSC A/85 в США. Держите эту картину в голове: остальная часть статьи её наполняет.
ITU-R BS.1770: стандарт, по которому измеряют всё
BS.1770 – полное название «Algorithms to measure audio programme loudness and true-peak audio level» – это фундамент. Оба региональных свода ссылаются на него, так что понять его один раз – значит разобраться в измерительной части любой спецификации громкости. Текущая редакция – ITU-R BS.1770-5 (ноябрь 2023). Алгоритм состоит из четырёх шагов, и каждый из них можно освоить без специальной инженерной подготовки.
Шаг 1 – K-взвешивание: слышать так, как слышит ухо
Первый шаг корректирует восприятие громкости: мы слышим разные частоты с разной интенсивностью. Всплеск энергии на 3 кГц – примерно на уровне детского плача или звука пожарной сигнализации – кажется нам намного громче, чем такая же энергия на 50 Гц, то есть низком басовом гуле. Микрофон этого не учитывает – он одинаково реагирует на все частоты. Поэтому алгоритм сначала пропускает сигнал через фиксированную пару фильтров, вместе называемых K-взвешиванием, которые усиливают частоты, на которые ухо чувствительно, и ослабляют те, к которым оно нечувствительно. После K-взвешивания значения, с которыми работает алгоритм, соответствуют тому, что человек действительно воспринимает как громкое. Поэтому шкала LUFS в профессиональной среде обозначается как LKFS – Loudness, K-weighted, relative to Full Scale. LUFS и LKFS – это одно и то же число, просто с разными названиями: в Европе используют LUFS, в США – LKFS.
Шаг 2 – среднее квадратов: превратить волну в энергию
Волна тысячи раз в секунду колеблется в плюс и минус; если просто усреднить её, плюсы и минусы почти полностью сократятся. Поэтому алгоритм сначала возводит каждый отсчёт в квадрат – возведение в квадрат делает любое значение положительным и естественным образом соответствует мощности сигнала, то есть скорости передачи энергии. Затем он усредняет эти квадраты. Результат – среднеквадратичная энергия K-взвешенного сигнала: одно положительное число, показывающее, сколько перцептивной энергии содержала дорожка.
Шаг 3 – гейтинг: игнорировать тишину
Вот шаг, в котором BS.1770 отличается от наивного усреднения – и где большинство ошибается. Представьте двухчасовой фильм с долгими тихими сценами: задержка перед репликой, тихая ночная сцена. Если усреднить эти паузы по громкости, фильм с большим количеством тишины покажется искусственно тихим, и вы будете увеличивать громкость, пока громкие моменты не начнут бить по ушам. Гейтинг этому мешает. Алгоритм разбивает аудиосигнал на перекрывающиеся окна – блоки по 400 миллисекунд, каждый перекрывает соседний на 75% – и отбрасывает слишком тихие окна перед тем, как усреднять оставшиеся.
Выбрасывает в два прохода. Абсолютный гейт отбрасывает любой блок тише −70 LUFS – это фактически тишина, и она никогда не учитывается. Затем алгоритм измеряет среднее значение оставшихся блоков и применяет относительный гейт: отбрасывает любой блок, уровень которого ниже первого среднего более чем на 10 LU. (LU, Loudness Units – единица измерения разницы на шкале LUFS; LUFS – абсолютное значение, а LU – разница между двумя значениями.) То, что остаётся – блоки, реально несущие содержание программы, – усредняется в последний раз, и получается интегральная громкость (integrated loudness) – единственное число, характеризующее всю программу. Гейтинг был добавлен в BS.1770-2 (2011); в исходной версии 2006 года его не было – поэтому результаты измерений на старых, до-2011 года, приборах могут отличаться от современных.
Шаг 4 – истинный пик: поймать пик между отсчётами
Четвёртый шаг не связан с громкостью и отвечает на другой вопрос: не исказится ли сигнал при воспроизведении? Обычный пиковый измеритель анализирует цифровые отсчёты и показывает самый высокий из них. Однако реальная аналоговая волна, воспроизводимая динамиком, проходит через эти точки отсчёта и иногда выше них – истинный пик может оказаться выше любого отдельного отсчёта. BS.1770 вычисляет истинный пик (true peak), передискретизируя сигнал (восстанавливая волну с учетверённой частотой) и находя реальный максимум, выражаемый в dBTP – децибелах относительно полной шкалы, истинный пик. Коэффициенты фильтра истинного пика были уточнены в BS.1770-3 (2012). Поэтому спецификация указывает «−1 dBTP», а не «−1 dBFS»: она требует, чтобы истинный межотсчётный пик оставался чуть ниже цифрового потолка, чтобы при аналоговом воспроизведении не происходило клиппирования.
Разберём арифметику гейта
Шаг гейтинга абстрактен, поэтому приведём расчёт относительного порога на реальных числах. Допустим, абсолютно гейтированное среднее по программе – все блоки выше −70 LUFS, усреднённые – составляет −21 LUFS. Тогда относительный гейт установлен на 10 LU ниже:
порог относительного гейта = абс.-гейт. громкость − 10 LU
порог относительного гейта = −21 LUFS − 10 LU
порог относительного гейта = −31 LUFSТеперь алгоритм пересчитывает усреднение, оставляя только блоки громче −31 LUFS и отбрасывая всё тише. Допустим, итоговый результат составил −20,4 LUFS. Эти −20,4 LUFS – интегральная громкость программы, то есть величина, которую вы сравниваете с целевой. Поскольку блоки с тихими сценами исключены, эта цифра отражает громкость основного содержания программы, а не её пауз и тишины.
EBU R128: европейский свод правил
EBU R128 – «Loudness normalisation and permitted maximum level of audio signals» – это документ, который с 2010 года превратил нормализацию громкости из теории в европейский вещательный закон по соглашению. Он краткий и предписательный. В нём сформулированы четыре требования, которые важно знать точно.
Первое: цель – −23 LUFS, измеренная по BS.1770. Каждая нормализованная программа стремится к этому единственному числу. Второе: допуск ±0.5 LU для контента, который можно обработать точно (большинство файловой доставки), расширяется до ±1 LU для менее предсказуемого материала вроде живого микса, где громкость нельзя отрепетировать. Третье: истинный пик никогда не превышает −1 dBTP. Четвёртое: R128 вводит спутник-меру, Loudness Range (LRA), диапазон громкости – насколько громкость меняется внутри программы, единое число разброса «тихо–громко» в LU, чтобы спецификация могла требовать динамики, которая не плоская и не дико неровная. LRA задан в EBU Tech 3342.
R128 не переопределяет измерение; он указывает на BS.1770 и добавляет практический каркас, нужный вещателям. Этот каркас живёт в семействе спутниковых документов EBU Tech: Tech 3341 задаёт «EBU Mode»-измеритель с тремя показаниями – Momentary (мгновенный, окно 400 мс, ловит всплески), Short-term (краткосрочный, окно 3 секунды, следит за миксом в работе) и Integrated (интегральное гейтированное число на всю программу, которое должно попасть в −23). Tech 3343 покрывает производственную практику, а Tech 3344 – дистрибуцию, включая то, как передавать метаданные громкости современным иммерсивным кодекам вроде AC-4 и MPEG-H.
Стандарт адаптировался к тому, как люди на самом деле слушают звук. Базовая рекомендация – на версии 5.0 (ноябрь 2023), и теперь она включает четыре дополнения для контекстов, которых не было в исходном вещательном документе 2010 года: R128 s1 – для короткого контента, например рекламы и промо, R128 s2 («Loudness in Streaming», ноябрь 2023) – для on-demand и стриминговой дистрибуции, R128 s3 – для радио и R128 s4 – для кинематографического контента. Дополнение для стриминга особенно важно: прослушивание на телефоне и в наушниках терпит – и зачастую предпочитает – более громкий звук, чем в тихой гостиной, поэтому музыкальные треки в стримингах чаще всего находятся ближе к −14 LUFS, а не к −23. Подробно о целевых значениях на каждой платформе мы рассказываем в LUFS: целевые значения по платформам в 2026.
ATSC A/85 и CALM Act: американский свод с зубами
Американская история – это тот же алгоритм, но с иной целью и иным юридическим механизмом принуждения, отсутствующим в европейской системе соглашений.
ATSC A/85 – «Techniques for Establishing and Maintaining Audio Loudness for Digital Television» – устанавливает целевой уровень громкости цифрового телевидения США на уровне −24 LKFS, что на один децибел тише европейского стандарта −23 LKFS. Действующая версия – A/85:2013 с поправкой № 1 (февраль 2021), измерения проводятся по стандарту BS.1770-3. Разница в один LU между ATSC A/85 и EBU R128 носит исторический и практический характер, а не перцептивный; для любого реального аудиопроцесса уровни −23 и −24 настолько близки, что единый микс под оба стандарта требует лишь снижения громкости на один децибел.
A/85 отличается от R128 в одном существенном аспекте – способе обработки диалога. R128 измеряет громкость всей программы целиком, тогда как A/85 опирается на концепцию Anchor Element (якорного элемента) – части аудиодорожки, по которой слушатель интуитивно оценивает громкость. В большинстве телевизионных программ таким элементом является диалог. A/85 нормализует уровень звука именно по этому якорю, поэтому фильм с громкими экшн-сценами и тихими диалогами выравнивается по уровню диалога – именно на нём зритель сосредоточен в первую очередь. Именно этот подход, ориентированный на диалог, объясняет, почему в американских спецификациях доставки чаще упоминается dialnorm (см. ниже), чем в европейских.
Причина, по которой A/85 весит больше обычной рекомендованной практики, – CALM Act, Commercial Advertisement Loudness Mitigation Act, федеральный закон США, вступивший в силу в декабре 2012 года. CALM Act не устанавливает собственные технические требования – он ссылается на ATSC A/85 и делает соблюдение этого стандарта обязательным для телевизионной рекламы. Контроль за выполнением закона осуществляет Федеральная комиссия по связи (FCC), и вещатель, допустивший, что реклама звучит громче окружающих программ, может столкнуться с жалобами и санкциями. Таким образом, в США нормализация громкости – не просто лучшая практика, которую может выбрать вещатель: для рекламы это закон, а техническое определение «слишком громко» – уровень −24 LKFS из A/85.
Dialnorm: метаданные, содержащие уровень громкости
Один термин постоянно всплывает в американской и Dolby-ориентированной доставке и сбивает с толку всех, кто с ним сталкивается: dialnorm. Это сокращение от dialogue normalization – небольшие метаданные внутри кодеков Dolby (AC-3 и E-AC-3), которые указывают устройству воспроизведения, насколько громко звучит диалог программы, выраженный как положительное число децибел ниже полной шкалы. Если диалог вашей программы измеряется на уровне −24 LKFS и вы передаёте его без изменений, вы устанавливаете dialnorm = 24. Декодер в телевизоре считывает это значение 24 и автоматически ослабляет сигнал так, чтобы диалог каждой программы воспроизводился с одинаковой комфортной громкостью, независимо от того, как она была сведена.
Подводный камень жесток в своей простоте: если значение dialnorm неверно – если оно указывает 24, а диалог на самом деле на уровне −31, – декодер применяет неправильную коррекцию, и программа звучит с неправильной громкостью, нарушая всю систему. Практическую работу с dialnorm, replay gain и нормализацией в кодировщиках мы разбираем в Громкость на практике: dialnorm, normalize, attenuate, replay gain.
Бок о бок: как три стандарта соотносятся
Стандарты в большей степени совпадают, чем различаются, поскольку используют общий измерительный движок BS.1770. Ниже приведена таблица – это основная сравнительная картина, вокруг которой строится спецификация доставки.
| Атрибут | ITU-R BS.1770 | EBU R128 | ATSC A/85 |
|---|---|---|---|
| Что это | Алгоритм измерения | Европейский свод целей | Американский свод целей |
| Текущая редакция | BS.1770-5 (ноя 2023) | R128 v5.0 (ноя 2023) | A/85:2013 + Corr. 1 (фев 2021) |
| Цель громкости | нет – только измеряет | −23 LUFS | −24 LKFS |
| Имя единицы | LKFS / LUFS | LUFS | LKFS |
| Основа измерения | сам по себе | BS.1770 | BS.1770-3 |
| Обработка диалога | только гейтинг | вся программа | Anchor Element (диалог) |
| Потолок истинного пика | задаёт dBTP | −1 dBTP | −2 dBTP (рекоменд.) |
| Допуск | – | ±0.5 LU (±1 LU live) | ±2 LU (типичная практика) |
| Юридическая сила | нет | соглашение вещателей | обязателен для рекламы (CALM Act) |
Таблица 1. Три документа по громкости в одном обзоре. Общий стандарт BS.1770 – причина того, что цели находятся на расстоянии одного LU друг от друга, а не в разных системах. Источники: ITU-R BS.1770-5; EBU R128 v5.0; ATSC A/85:2013.
Заметьте, что делает таблицу очевидной: жёсткие различия – это целевое число (−23 против −24), обработка диалога (вся программа против якоря) и юридический статус (соглашение против закона). Всё остальное – общее. Команда, которая это усвоила, перестаёт воспринимать спецификации «EBU» и «ATSC» как чужеродные и начинает видеть в них одно измерение с двумя региональными ручками.
Полная нормализация, от начала до конца
Свяжем всё на полном примере. Вы получаете готовую программу. Ваш измеритель, реализующий BS.1770-5, показывает интегральную громкость −20,4 LUFS и истинный пик −0,3 dBTP. Ваша спецификация доставки – EBU R128: цель −23 LUFS, потолок −1 dBTP.
Сначала коррекция громкости. Вы на 2.6 LU громче, так что убавляете всю программу на эту величину:
требуемое усиление = цель − измеренное
требуемое усиление = −23 LUFS − (−20.4 LUFS)
требуемое усиление = −2.6 LUВы применяете усиление −2,6 дБ ко всей программе. Поскольку вы сдвинули весь сигнал на одну и ту же величину, соотношения внутри микса остались неизменными – изменился только общий уровень. Теперь проверьте пик заново. Истинный пик составлял −0,3 дБТП; снижение уровня на 2,6 дБ также снижает и пик:
новый истинный пик = старый истинный пик + усиление
новый истинный пик = −0.3 dBTP + (−2.6 dB)
новый истинный пик = −2.9 dBTP−2,9 дБТП ниже потолка −1 дБТП, так что программа проходит оба теста: −23 LUFS интегрально и −2,9 дБТП по истинному пику. Обратите внимание: порядок важен. Если бы коррекция громкости была вверх – то есть программа была бы слишком тихой – подъём уровня мог бы вывести истинный пик выше −1 дБТП, и тогда потребовался бы лимитер истинного пика, чтобы вернуть пики обратно, не изменяя интегральную громкость. Эта ловушка порядка – следующий подводный камень.
«Подводный камень – нормализовать громкость и пик в неверном порядке или спутать их. Громкость (LUFS, среднее) и истинный пик (dBTP, максимум) – разные измерения, и оба нужно учитывать. Классическая ошибка – сначала ограничить пики, а потом поднять громкость, из-за чего пики снова выходят за пределы допустимого; или путать значение пика со значением громкости. Правило: сначала приведите интегральную громкость к целевому уровню, затем проверьте истинный пик, и только если он превышает потолок – примените лимитер истинного пика. После этого обязательно перепроверьте громкость, потому что жёсткое лимитирование может её изменить. Подробно о межотсчётных пиках – в Истинный пик, dBTP и проблема межотсчётного пика.»
Второй подводный камень: путаница между −23 и −14
Самое вредное заблуждение в этой области – «−23 LUFS – это тот самый стандарт громкости». Это вещательный стандарт. Целевое значение зависит исключительно от того, где будет воспроизводиться контент. Европейское и американское вещание держится около −23/−24 LUFS, потому что в гостиной с внимательными слушателями низкий фоновый шум и широкая динамика ценятся. Музыкальные стриминговые сервисы нормализуют звук значительно громче – Spotify и другие находятся около −14 LUFS, – поскольку прослушивание в телефоне и наушниках в шумной обстановке требует более плотного, громкого и ровного сигнала. А кино – это снова особый случай: оно калибруется по опорному уровню, а не по цели в LUFS.
Загрузите подкаст, сведённый на −23 LUFS, на платформу, рассчитанную на −16, – и слушатели будут крутить громкость. Именно такое поведение нормализация должна была предотвратить. Стандарты, описанные в этой статье, объясняют как измерять и задают вещательные цели; цели по платформам – в отдельной таблице, и ошибка в ней – частая, но легко предотвратимая оплошность. Полный набор на 2026 год доступен в LUFS: целевые значения по платформам в 2026.
Где здесь Фора Софт
В продуктах OTT, видеостриминга, e-learning, телемедицины и видеоконференций, которые мы разрабатываем с 2005 года, вопрос громкости возникает регулярно: приходит спецификация доставки или партнёрская интеграция с требованиями «−23 LUFS, −1 dBTP, BS.1770», и команде нужно измерение, встроенное в конвейер, а не ручная проверка в конце. Для OTT- и стриминговых клиентов мы интегрируем измерение громкости по стандарту BS.1770 и лимитер истинного пика на этапе транскодирования, чтобы каждый медиаконтент нормализовался до целевых параметров спецификации ещё до попадания в упаковщик. В e-learning и телемедицине, где разборчивость речи – ключевой фактор продукта, мы нормализуем записанный звук к единой цели, чтобы и тихий, и громкий лектор воспринимались слушателем на комфортной громкости. Сам стандарт не меняется – меняется лишь целевое значение громкости и порог истинного пика, требуемые рынком конкретного проекта.
Главное
- BS.1770 – стандарт измерения; EBU R128 и ATSC A/85 – региональные стандарты.
- BS.1770 работает в четыре этапа: K-взвешивание, возведение в квадрат, подавление тихих участков, интегрирование.
- EBU R128 ориентируется на уровень −23 LUFS, истинный пик – не выше −1 dBTP, допустимое отклонение ±0,5 LU по BS.1770.
- ATSC A/85 устанавливает цель −24 LKFS, использует якорь по диалогу и является обязательным в соответствии с законом CALM Act.
- Сначала нормализуйте общую громкость, затем проверьте и ограничьте истинный пик.
- −23 LUFS – цель для вещания; стриминговые платформы и музыкальные релизы используют более высокие уровни, например −14 LUFS.