Содержание статьи +
- Кратко
- Зачем это нужно
- Сначала о децибелах: это отношение, а не единица громкости
- Peak: самый высокий одиночный сэмпл – и почему он вводит в заблуждение относительно громкости
- RMS: усреднение энергии – ближе, но всё ещё не громкость
- LUFS: громкость, измеренная так, как её воспринимает ухо
- Словарь вокруг LUFS: LU, LKFS, M, S, I
- Loudness Range (LRA): насколько сильно меняется громкость
- True Peak и dBTP: выброс, который обычный пиковый метр пропускает
- Соберём числа вместе: разбор одного показания
- Частая ошибка: «я нормализовал до 0 dB, значит, громче некуда»
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Кратко
Громкость – это то, насколько громким звук воспринимается человеком, и это не то же самое, что исходный электрический уровень, который фиксирует измеритель. Старые измерители показывали peak (самый высокий сэмпл) или RMS (краткосрочное усреднение энергии), но ни один из этих параметров не соответствует тому, что слышит ухо. Поэтому индустрия разработала перцептивный показатель LUFS, определённый стандартом ITU-R BS.1770. LUFS фильтрует звук с учётом того, как ухо воспринимает частоты (K-взвешивание), усредняет энергию и игнорирует паузы тишины (гейтинг) – поэтому два фрагмента с одинаковым peak могут отличаться на 8 LUFS. Эта статья даёт полный словарь терминов – децибел, peak, RMS, LUFS, LU, LKFS, K-взвешивание, Loudness Range и True Peak, – которые все последующие статьи о стриминге и вещании считают уже известными.
Зачем это нужно
Если вы работаете с любым видеопродуктом – стриминговым сервисом, OTT-платформой, приложением для видеосвязи или телемедициной, – самая частая жалоба, которую вы услышите, будет связана с громкостью: реклама, которая кричит; следующая серия, которая едва слышно; один участник на звонке, которого никто не слышит. Чтобы решить эту проблему, сначала нужно правильно измерить громкость, а большинство команд делают это неверно, потому что полагаются на пиковый метр, который не имеет отношения к воспринимаемой громкости. Эта статья – фундамент: она даёт определения всем терминам, которые понадобятся для понимания таблиц целевых значений платформ, стандартов нормализации и правил ограничения true peak в других материалах раздела. Прочитайте её один раз – и фраза «−14 LUFS, −1 dBTP» перестанет быть жаргоном и станет чёткой инструкцией к действию.
Сначала о децибелах: это отношение, а не единица громкости
Почти вся путаница с громкостью связана с децибелом, поэтому начнём с него. Децибел, обозначается dB, – это не фиксированная величина, а способ выразить, во сколько раз одна величина больше другой, в сжатой шкале. Это отношение, как «вдвое больше» или «в десять раз меньше», только выраженное через логарифмы, чтобы очень большие и очень малые соотношения умещались на одной оси.
Логарифм нужен потому, что слух восприятие звука – логарифмическое. Переход от шёпота к обычному голосу и от обычного голоса к крику воспринимается как один и тот же «шаг вверх», хотя второй шаг требует гораздо больше физической энергии. Логарифм превращает эти одинаково воспринимаемые шаги в равные по величине числа – именно этого и требует шкала громкости.
Поскольку децибел – это отношение, ему всегда нужна точка отсчёта: «относительно чего». Суффикс после dB как раз обозначает эту точку. dBFS означает децибелы относительно полной шкалы (full scale): 0 dBFS – это максимально возможный по громкости сэмпл, который может сохранить цифровая система, а любой реальный сигнал находится ниже него и выражается отрицательным числом. Так, −6 dBFS – это половина максимальной амплитуды, −12 dBFS – четверть, и так далее. Вот единственная децибельная арифметика, которую стоит запомнить:
изменение на +6 dB ≈ удвоение амплитуды
изменение на −6 dB ≈ половина амплитуды
изменение на +20 dB = амплитуда в десять раз большеЗапомните две ключевые мысли из этого раздела. Во-первых: децибел описывает отношение, а не абсолютную громкость. Во-вторых: суффикс (FS, TP или семейство LUFS ниже) указывает, относительно чего измеряется это отношение. Каждый термин в статье – это разный ответ на вопрос: «децибелы по сравнению с чем и измеренные как».
Peak: самый высокий одиночный сэмпл – и почему он вводит в заблуждение относительно громкости
Самое простое, что может показать измеритель, – это peak: значение самого громкого сэмпла на отрезке звука, выраженное в dBFS. Peak-метр отвечает на один узкий вопрос – насколько близко сигнал подошёл к цифровому потолку 0 dBFS, за которым сэмплы «клиппируют» и искажаются. Это реальный и полезный вопрос. Просто это не вопрос «насколько это громко».
Peak не подходит в качестве меры громкости, потому что громкость – это устойчивая энергия во времени, а peak – это лишь мгновение. Возьмём два фрагмента. Первый – плотный поп-мастер, который три минуты держится на максимуме шкалы. Второй – разреженная акустическая запись, тихая почти везде, кроме одного резкого удара барабана, который на мгновение достигает того же уровня. Peak-метр покажет для обоих одинаковых значения, потому что оба достигли одного и того же максимального сэмпла. Ухо же подскажет, что первый фрагмент заметно громче, поскольку он содержит гораздо больше энергии на протяжении всей длительности. Peak зафиксировал всплеск, но не измерил устойчивую громкость – ту, которую на самом деле воспринимает ухо.
Есть и более тонкая проблема с peak, которую мы отметим сейчас, а подробно разберём ниже. «Peak», который показывает обычный измеритель, – это самый высокий сохранённый сэмпл. Но когда цифровой сигнал восстанавливается в непрерывную аналоговую волну для динамиков, плавная кривая, проведённая между сэмплами, может подняться выше любого отдельного сэмпла. Этот скрытый выброс называется межсэмпловым пиком (inter-sample peak), а измерение, которое его ловит, – это True Peak, в dBTP. Мы определим его подробнее в разделе про True Peak ниже; пока просто запомните, что даже peak, которому вы доверяете, может недооценивать реальный сигнал.
RMS: усреднение энергии – ближе, но всё ещё не громкость
Если один пик слишком узкий, естественный шаг – усреднить. RMS (от root mean square, среднеквадратичное) – это способ усреднить энергию сигнала по временному окну, а не фиксировать единичный момент. Название отражает суть метода: каждый отсчёт возводится в квадрат (это превращает отрицательные значения в положительные и сильно усиливает влияние больших величин), затем берётся среднее этих квадратов по окну, после чего извлекается корень, чтобы вернуться к исходной шкале. В результате получается число, отражающее устойчивый уровень звука, а не его кратковременные всплески.
RMS – настоящий шаг к измерению громкости. Вернёмся к двум фрагментам: RMS корректно покажет плотный поп-мастер значительно громче разреженной акустики, поскольку измеряет энергию по окну, а не по одному сэмплу. Десятилетиями RMS-метры (индикаторы VU и их потомки) оставались лучшим практическим способом оценки громкости и до сих пор остаются полезными.
Но у RMS есть одно слепое пятно, которого нет у человеческого уха: он считает все частоты одинаково громкими. Слух человека – нет. Мы наиболее чувствительны к средней области – примерно к полосе, где сосредоточена речь, – и намного менее чувствительны к очень низкому басу и очень высоким частотам при той же физической энергии. Трек с тяжёлым суб-басом может нести огромную RMS-энергию внизу, которую вы едва воспринимаете как громкость, а трек с сильным вокалом может казаться громким при меньшем RMS. RMS измеряет энергию честно – просто делает это так, будто ваше ухо плоское, а оно не плоское. Закрыть этот разрыв – и есть задача следующего измерения.
LUFS: громкость, измеренная так, как её воспринимает ухо
Это ключевой термин, на котором построен весь остальной раздел, поэтому определим его чётко и сначала простыми словами. LUFS – это Loudness Units relative to Full Scale, единицы громкости относительно полной шкалы. Это значение на децибельной шкале ниже уровня 0 (поэтому реальные значения отрицательны, например, −23 LUFS или −14 LUFS), рассчитанное так, чтобы отражать воспринимаемую громкость – то есть то, насколько громким звук кажется человеку, – а не его чистую электрическую энергию.
LUFS – не выдумка вендора. Он установлен международным стандартом ITU-R BS.1770, в настоящее время в пятой редакции (опубликована в ноябре 2023 года), под названием Algorithms to measure audio programme loudness and true-peak audio level. Когда стриминговая платформа говорит: «мы нормализуем к −14 LUFS», она ссылается на конкретный воспроизводимый алгоритм из этого документа. У алгоритма три части, и разобраться в каждой из них можно без сложной математики.
Часть первая: K-взвешивание – как ухо фильтрует звук
Перед измерением энергии алгоритм пропускает звук через фиксированный двухступенчатый фильтр под названием K-weighting, который корректирует сигнал, приближая его к частотной чувствительности человеческого уха. Фильтр выполняет две простые операции: он подавляет низкие частоты с помощью фильтра высоких частот (энергия ниже примерно 80 Гц воспринимается как менее громкая и потому считается меньшей) и обеспечивает плавный подъём на +4 дБ для частот выше примерно 2 кГц – так называемую «высокочастотную полку» (high-shelf), имитирующую лёгкий акцент, создаваемый головой и ухом. K-weighting – это шаг, устраняющий слепое пятно RMS: после применения этого фильтра равная измеренная энергия становится гораздо ближе к равной воспринимаемой громкости.
Часть вторая: средняя энергия – усреднение по программе
После K-взвешивания алгоритм измеряет среднюю энергию отфильтрованного сигнала по всему фрагменту – это своего рода степенное усреднение, аналогичное среднеквадратичному. В случае многоканального звука каналы суммируются, и вот важный момент: каналы окружения взвешиваются немного сильнее (коэффициент около 1,41, что соответствует примерно +1,5 дБ на каждый канал), поскольку звук, приходящий сзади, воспринимается человеком как более громкий. А канал низкочастотных эффектов (LFE), то есть «точка один», в итоговую сумму громкости вообще не включается. Полученная взвешенная энергия затем переводится в шкалу LUFS с использованием фиксированного калибровочного смещения, предусмотренного стандартом.
Часть третья: гейтинг – игнорировать тишину
Длинный фильм полон тихих моментов и настоящей тишины. Если усреднить их по уровню громкости, насыщенная диалогами драма с долгими паузами показалась бы искусственно тихой – и вы бы её просто пропустили. Поэтому стандарт BS.1770 использует гейтинг: он измеряет звук короткими перекрывающимися блоками по 400 миллисекунд и отбрасывает те, что ниже двух порогов. Сначала абсолютный гейт отсекает всё, что тише −70 LUFS – настоящую тишину и «комнатный шум». Затем относительный гейт исключает блоки, уровень которых на 10 LU ниже среднего по оставшимся – то есть действительно тихие моменты. Итоговая интегральная громкость – это среднее значение только по тем блокам, которые прошли гейтинг: по тем фрагментам, которые зритель воспринимает как «основное содержание».
Выигрыш от всех трёх шагов в совокупности: два фрагмента с одинаковым пиком и даже похожим RMS могут отличаться на 8 LUFS, и значение LUFS будет соответствовать тому, какой из них воспринимается ухом как более громкий. Именно поэтому весь мир стриминга и вещания стандартизировался на этом показателе.
Словарь вокруг LUFS: LU, LKFS, M, S, I
Вместе с LUFS идут ещё четыре термина, и они сбивают с толку лишь потому, что их никогда не объясняют. Вот они – каждый в отдельной строке.
LKFS (Loudness, K-weighted, relative to Full Scale) – это то же самое, что и LUFS: одна и та же шкала, один и тот же алгоритм. Эти обозначения взаимозаменяемы: североамериканские документы вещания (включая закон США CALM Act) используют термин LKFS, а европейские – LUFS. Если один стандарт указывает −24 LKFS, а другой – −24 LUFS, они означают одно и то же.
LU (Loudness Unit) – относительный аналог LUFS. Один LU равен одному децибелу разницы в громкости. LUFS используется для абсолютного измерения («этот трек – −16 LUFS»), а LU – для обозначения разницы или допуска («уменьшить на 3 LU», «допуск ±1 LU»). Шкала у них одинаковая, но LUFS привязана к полной шкале, а LU отражает разницу между двумя уровнями громкости.
Последние три – это временны́е окна, которые отображает стандартный измеритель, и все три вы видите на реальном loudness-метре. Momentary (M) – моментальная громкость, измеряется за последние 400 мс – это мгновенное ощущение. Short-term (S) – краткосрочная громкость, измеряется за последние 3 секунды – полезна для отслеживания участков, которые уходят в громкость или тишину. Integrated (I) – интегральная громкость – это единственное усреднённое с гейтингом значение по всей программе: именно это число вы сдаёте, именно его платформа проверяет на соответствие.
| Термин | Полное имя | Что измеряет | Когда применять |
|---|---|---|---|
| LUFS | Loudness Units rel. to Full Scale | Абсолютная воспринимаемая громкость | Цели, доставка («−14 LUFS») |
| LKFS | Loudness, K-weighted, rel. to FS | То же, что LUFS | Спеки США / вещания («−24 LKFS») |
| LU | Loudness Unit | Разница громкости (1 LU = 1 dB) | Допуски, правки («±1 LU») |
| Momentary (M) | – | Громкость за последние 400 мс | Живой мониторинг, мгновенно |
| Short-term (S) | – | Громкость за последние 3 с | Отлов перепадов между сценами |
| Integrated (I) | – | Усреднение с гейтом по всей программе | Соответствие, сдаваемое число |
Loudness Range (LRA): насколько сильно меняется громкость
Интегральная громкость даёт одно число на всю программу, но скрывает важное: насколько эта громкость постоянна. Ток-шоу на радио и фильм с шёпотом и взрывами могут иметь одинаковую интегральную LUFS и при этом ощущаться совершенно по-разному. Loudness Range (сокращённо LRA, измеряется в LU) фиксирует этот разброс – он показывает, насколько сильно громкость меняется в программе, от самых тихих до самых громких моментов.
LRA определён в EBU Tech 3342, приложении к рекомендации EBU R128. Метод измеряет краткосрочную громкость на протяжении всей программы, строит статистическое распределение этих значений и определяет разброс между примерно 10-м и 95-м перцентилями (после применения собственного гейтинга). Низкий LRA, например 3–5 LU, указывает на плотно контролируемую, стабильную громкость – типично для мастеринга поп-музыки или подкастов. Высокий LRA, 15 LU и выше, свидетельствует о широком динамическом диапазоне – характерно для киномузыки или классических записей.
Почему это важно: LRA показывает, сможет ли звук выдержать громкую, отвлекающую обстановку. Фильм с диапазоном 20 LU великолепен в тихом кинозале, но становится невыносимым на телефоне в движущемся поезде – тихий диалог просто тонет в шуме. Знание LRA до финальной сдачи помогает понять, нужен ли отдельный, более сжатый микс для мобильных устройств. Это число – инструмент для планирования, а не критерий соответствия.
True Peak и dBTP: выброс, который обычный пиковый метр пропускает
Мы обещали вернуться к этому вопросу – и он действительно заслуживает отдельного раздела. Обычный пиковый метр показывает максимальное сохранённое значение сэмпла. Однако звук не воспроизводится как ступенчатая последовательность дискретных сэмплов – ЦАП восстанавливает плавную непрерывную волну, проходящую через эти точки. Между двумя сэмплами восстановленная кривая может подняться выше любого из них. Этот скрытый выброс называется межсэмпловым пиком (inter-sample peak), и обычный пиковый метр его не фиксирует.
True Peak, измеряемый в dBTP (децибелы истинного пика), – это показатель, который фиксирует реальный максимум сигнала. Метод, описанный в ITU-R BS.1770, заключается в передискретизации (oversample) сигнала – обычно в 4 раза, то есть математически вставляются интерполированные точки между реальными отсчётами, чтобы приблизить непрерывную форму волны. Затем определяется истинный пик этой более плотной кривой. Получаемое значение часто превышает пиковый уровень отсчётов на несколько десятых децибела, а иногда – и более чем на один децибел.
Это не теория. Мастер, который отображается ровно как 0,0 dBFS на сэмпловом пиковом метре, может иметь true peak на уровне +0,7 dBTP и выше. Когда такой файл декодируется – особенно после кодека с потерями, например AAC, который сам по себе добавляет дополнительные выбросы, – эти межсэмпловые пики обрезаются в аналоговом каскаде телефона или наушников, и вы слышите треск. Поэтому стриминговые платформы устанавливают порог True Peak ниже нуля: максимально допустимый уровень по стандарту EBU R128 – −1 dBTP, и большинство стриминговых сервисов также используют −1 dBTP, оставляя запас на те выбросы, которые сэмпловый метр не зафиксировал. (Глубокий разбор межсэмпловых пиков и ограничений – в статье True Peak, dBTP и проблема межсэмплового пика.)
Соберём числа вместе: разбор одного показания
Пусть четыре измерения заговорят вместе на одной воображаемой сцене. Допустим, ваш loudness-метр, прогнанный по готовому 30-секундному ролику, показывает:
Integrated loudness = −18.0 LUFS
Loudness Range (LRA) = 4.0 LU
True Peak (max) = −0.4 dBTP
Sample peak (max) = −1.1 dBFSПрочтите это как фразу. Общая воспринимаемая громкость ролика – −18,0 LUFS, что является умеренной: она выше нормы вещания (−23 LUFS), но ниже цели музыкального стриминга (−14 LUFS). Диапазон громкости – 4,0 LU – узкий, значит, ролик одинаково громкий на всём протяжении, без тихих участков, которые могут потеряться на телефоне. Но обратите внимание на пики: сэмпловый пик комфортный – −1,1 dBFS, а True Peak – −0,4 dBTP. Межсэмпловый выброс добавил 0,7 dB, которые сэмпловый метр не зафиксировал. Если ваша спецификация требует −1 dBTP, этот файл не проходит по true peak, хотя на сэмпловом метре выглядит безопасным. В таком случае вы бы либо убавили громкость, либо применили true-peak лимитер перед сдачей.
Это одно показание – вся статья в миниатюре: peak защищает от клиппинга, True Peak – от скрытого клиппинга, LUFS описывает воспринимаемую громкость, а LRA – насколько она колеблется.
Частая ошибка: «я нормализовал до 0 dB, значит, громче некуда»
Самая частая ошибка в работе с громкостью – путать пиковую нормализацию с нормализацией по громкости. Пиковая нормализация увеличивает уровень сигнала до тех пор, пока самый громкий сэмпл не достигнет 0 dBFS (или установленного потолка). Она гарантирует, что вы используете весь доступный цифровой диапазон, но почти ничего не говорит о том, насколько трека воспринимается на слух. Два файла, пиково нормализованные до 0 dBFS, могут отличаться на 10 LUFS по воспринимаемой громкости: один – плотный и насыщенный, другой – разреженный с одним резким всплеском.
Последствия проявляются, когда ваш звук попадает на современную платформу. Spotify, YouTube, Apple Music и радиостанции не обращают внимания на ваш пик – они измеряют интегральный LUFS и подгоняют весь трек под свою целевую громкость. Трек, который вы «выжали» до 0 dBFS, но который на самом деле имеет уровень −9 LUFS, платформа просто снизит до −14 LUFS, и весь клиппинг, на который вы пошли ради громкости, окажется напрасным. Решение – сведение и мастеринг под целевые значения LUFS и потолок dBTP, а не под пик. Громкость – это цель; пик – лишь страховка.
Где здесь Фора Софт
В продуктах, которые мы строим с 2005 года – видеостриминг и OTT-платформы, e-learning, телемедицина, живая видеосвязь, – громкость редко бывает «приятным дополнением»; именно на ней пользователи замечают швы. В работе над стримингом и OTT мы измеряем интегральную LUFS и True Peak каждого ассета до того, как он попадёт в библиотеку, чтобы серия, реклама и трейлер не скакали по громкости при воспроизведении подряд. В живой видеосвязи и телемедицине тот же словарь управляет ступенями автоматической регулировки усиления и выравнивания, которые держат тихого пациента и громкого врача на комфортном, ровном уровне. Повторяющийся урок везде один – тот же, что учит эта статья: измеряйте воспринимаемую громкость через LUFS и стерегите потолок через dBTP, и тикеты «почему так громко / так тихо» по большей части исчезают.
Главное
- Децибел – это отношение, а не абсолютная громкость; суффикс (FS, TP, LUFS) указывает точку отсчёта.
- Peak показывает самый громкий отдельный сэмпл – полезен для предотвращения клиппинга, но не отражает реальную громкость.
- RMS усредняет энергию сигнала, но при этом считает все частоты равнозначными, в отличие от человеческого уха.
- LUFS (ITU-R BS.1770) учитывает K-весовую коррекцию и гейтинг, чтобы соответствовать воспринимаемой громкости.
- LKFS = LUFS; LU – это разница в громкости; M/S/I – окна по 400 мс / 3 с / всей программы.
- True Peak (dBTP) фиксирует межсэмпловые выбросы, которые обычный сэмпловый метр пропускает – держите значение ≤ −1 dBTP.