Объективные метрики качества аудио: PESQ, POLQA, ViSQOL, AAC-Q

Автор: Николай СапуновОбновлено: август 202625 мин чтения
Содержание статьи +

Коротко

Объективная метрика качества аудио – это программа, которая «слушает» обработанный аудиофайл так, как это сделала бы группа живых слушателей, и выдаёт одно число, предсказывающее их оценку. Это позволяет проверять тысячи файлов за минуты вместо проведения отдельного слухового теста для каждого. Чаще всего упоминаются три метрики: PESQ и POLQA – речевые стандарты Международного союза электросвязи (ITU), и ViSQOL – открытая метрика от Google, работающая как с речью, так и с музыкой. Это аудиоаналог видеопоказателей PSNR и VMAF, которыми видеокоманды оценивают качество кодеков. Подобно этим видеопоказателям, они удобны, автоматизируемы и иногда ошибаются в конкретных случаях – о которых важно знать. В этой статье объясняется, что измеряет каждая метрика, в каких ситуациях она даёт сбой, почему старый фаворит PESQ был исключён из официального каталога ITU в январе 2024 года, но по-прежнему доминирует в научных публикациях, и как интегрировать метрику в процесс сборки, не вводя себя в заблуждение.

Зачем это нужно

Если вы выпускаете продукт со звуком – видеоконференции, стриминг, телемедицину, e-learning – вы постоянно меняете аудиопайплайн: новый кодек, другой битрейт, модель шумоподавления, настройку буфера джиттера. Любое из этих изменений делает звук лучше или хуже, и «хуже» пользователь замечает и обжалует первым. Честный способ узнать – спросить живых слушателей, но полноценный слуховой тест требует недель и денег, так что на каждый pull request его не запустишь. Объективные метрики закрывают этот разрыв: автоматический тест ловит регрессию до того, как она доберётся до клиента. Статья для менеджера продукта или основателя, которому нужно понять, что эти числа могут и не могут обещать, и для инженера, которому придётся выбрать метрику и обосновать выбор. К концу вы будете знать, какая метрика подходит для речи, какая – для музыки, какая бесплатна, какая требует лицензии, и три ошибки, превращающие зелёный дашборд в ложную уверенность.

То, что копирует каждая метрика: Mean Opinion Score

До начала любой программы в комнате сидели люди в наушниках. Стандартный способ оценить качество звука и сегодня – проиграть несколько клипов для панели слушателей и попросить каждого оценить каждый клип по пятибалльной шкале: 5 – отлично, 4 – хорошо, 3 – удовлетворительно, 2 – плохо, 1 – очень плохо. Среднее значение всех оценок по одному клипу называется Mean Opinion Score, обычно сокращают до MOS. Метод был разработан ITU – Международным союзом электросвязи, агентством ООН по стандартизации в области связи, – в рекомендации ITU-T P.800, а сама процедура оценки получила название Absolute Category Rating (ACR), поскольку каждый слушатель оценивает каждый клип независимо, по абсолютной шкале, а не сравнивает два фрагмента между собой.

MOS – это эталонная оценка качества. Он точен, но медленный и дорогой: требуется тихая комната, калиброванные наушники, достаточное количество слушателей, чтобы компенсировать плохой день одного из них, и много их времени. Более новая рекомендация – ITU-T P.808 – расширяет метод за счёт краудсорсинга: множество удалённых участников оценивают аудиоклипы на своих устройствах за небольшую плату. Это ускоряет процесс, но добавляет шум из-за неконтролируемых условий – комнат и техники. В любом случае слуховые тесты проводят несколько раз в год, а не после каждого изменения кода.

Все объективные метрики этой статьи призваны предсказать MOS без участия людей в тестовой комнате. Главная задача метрики – корреляция: если она выдаёт 4,2, реальные слушатели должны в среднем ставить примерно такую же оценку. Поэтому правильный вопрос к любой метрике – не «высокое ли значение?», а «насколько точно это число отражает мнение реальных слушателей для того типа аудио и тех видов искажений, которые меня интересуют?». Держите этот вопрос в голове – он станет ориентиром на всём протяжении дальнейшего изложения.

Рис. 1. Объективные метрики существуют, чтобы предсказать Mean Opinion Score, который даёт панель живых слушателей – достаточно быстро для автоматизации.

Полноэталонные и безэталонные методы: главное различие

Есть два принципиально разных способа оценить клип, и неправильный выбор может стоить недель.

Полноэталонная метрика (full-reference, иногда «intrusive») требует двух файлов: чистый оригинал (эталон) и обработанную версию, которую нужно оценить (искажённый сигнал). Она выравнивает их по времени и измеряет степень отклонения искажённой версии от оригинала. PESQ, POLQA, ViSQOL и PEAQ – все они относятся к полноэталонным. Они точны, потому что знают, как должен звучать звук, но применимы только тогда, когда у вас есть чистый оригинал – а он доступен в лаборатории и на этапе сборки, но отсутствует в реальном звонке.

Без эталона (no-reference, «non-intrusive») метрика оценивает качество одного аудиоклипа без сравнения с оригиналом – как человек замечает, что звонок плох, даже не слыша студийную версию. Такие метрики новее и почти все основаны на машинном обучении. Это единственный вариант для мониторинга живого трафика, где чистый эталон недоступен. К ним мы вернёмся в конце, поскольку именно в этом направлении движется развитие поля в 2026 году.

Правило большого пальца: используйте полноэталонные метрики в сборке и лаборатории, где вы контролируете источник; применяйте метрики без эталона для мониторинга живого продакшена. Большинству команд нужны оба подхода – для решения разных задач.

Рис. 3. Первый вопрос – не какая метрика, а какого типа: у вас есть чистый оригинал для сравнения?

PESQ – телефонная рабочая лошадка, которая не желает умирать

PESQ – Perceptual Evaluation of Speech Quality. Была опубликована ITU в качестве рекомендации ITU-T P.862 в 2001 году и более двух десятилетий оставалась стандартным способом оценки речевых кодеков и телефонных сетей. Если вы когда-либо читали статью с оценкой голосового кодека, она почти наверняка использовала PESQ.

PESQ – полноэталонный метод. Он сравнивает чистый эталонный сигнал и искажённую речь, пропуская оба через модель телефонной линии и человеческого восприятия, выравнивает их по времени и измеряет слышимые искажения. Полученный результат преобразуется в привычную шкалу от 1 до 5 согласно рекомендации P.862.1, что даёт значение MOS-LQO – Mean Opinion Score, Listening Quality, Objective. Приставка «objective» подчёркивает, что этот MOS-LQO предсказан машиной, в отличие от субъективного MOS-ЛКЧ (MOS-ЛКС), полученного на основе оценок людей.

PESQ изначально разрабатывалась для узкополосного телефонного диапазона – примерно 300–3100 Гц, характерного для тонкого звука обычного телефонного звонка. Позже расширение P.862.2 расширило её до широкополосного диапазона (50–7000 Гц) для поддержки HD-Voice, но только для файлов с частотой дискретизации 16 кГц. Здесь есть нюанс, на котором часто спотыкаются: в 2018 году ITU выпустил Corrigendum 2, признав, что коэффициенты широкополосного фильтра были рассчитаны неверно и систематически занижали оценку качества примерно на 0,8 MOS – почти на целый балл из пяти. Однако, поскольку ни одна популярная open-source реализация так и не внедрила это исправление, сообщество продолжало использовать неактуальную версию. Урок жёсткий и конкретный: две статьи, обе упоминающие «PESQ», могут использовать разные версии и давать несравнимые результаты. Всегда указывайте точную версию и используемую реализацию.

Вот главный факт о PESQ в 2026 году – и он странный. ITU отозвал PESQ в 2018 году в пользу преемника POLQA, а 5 января 2024 года формально удалил всё семейство P.862 из каталога. Стандарта официально больше нет. И всё же поиск «PESQ» в Google Scholar возвращает более 4600 статей только за 2024 год против едва сотни для POLQA. PESQ выживает, потому что она бесплатна, имеет множество открытых реализаций и использовалась во всех старых результатах – поэтому новые работы продолжают применять её ради сопоставимости. Вы будете встречать PESQ ещё на протяжении многих лет. Просто знайте, что используете устаревший, удалённый стандарт, и относитесь к его показателям соответственно.

«Ловушка – оптимизация напрямую под PESQ. Поскольку PESQ недорогая, команды обучали модели шумоподавления и улучшения речи с целью максимизации самого показателя PESQ. Это классический пример закона Гудхарта: когда мера становится целью, она перестаёт быть надёжным индикатором. Исследователи создавали модели, повышающие PESQ, в то время как реальные слушатели оценивали результат хуже – модель учится подстраиваться под метрику, а не под восприятие человека. Одно исследование 2024 года (с запоминающимся названием «The PESQetarian») показало, что система, оптимизированная под PESQ, коррелирует с человеческими оценками лишь на ~0,28 – практически бесполезно. Используйте метрику, чтобы выявлять регрессии, но никогда – как цель обучения модели.»

POLQA – официальная замена PESQ

POLQA – Perceptual Objective Listening Quality Analysis – стандарт ITU P.863, разработанный специально для замены PESQ. Это также полноэталонный метод, выдающий MOS-LQO, и предназначенный для той же задачи – оценки качества переданной речи. Однако он устраняет основные недостатки PESQ.

Первое исправление – полоса частот. PESQ работает только в широкополосном диапазоне, тогда как POLQA охватывает весь спектр современного аудио: узкополосный (300–3400 Гц), широкополосный (50–7000 Гц), сверхширокополосный (50–14000 Гц) и даже полнополосный (20–20000 Гц). Разница между сверхширокополосным и полнополосным диапазонами настолько мала, что POLQA считает их эквивалентными. Это означает, что POLQA способен оценить чёткое и широкое аудио современных VoLTE- или VoIP-звонков, в то время как PESQ просто не справляется с такими задачами.

Второе исправление – time-warping, и оно важнее, чем может показаться. Современные кодеки и буферы джиттера намеренно слегка растягивают или сжимают аудио, чтобы компенсировать сетевые сбои – процесс, который мы подробно разбираем в материале про буфер джиттера NetEQ. PESQ воспринимает это безобидное растяжение как повреждение и выдаёт заниженную оценку. POLQA отслеживает warp и оценивает его так, как это слышит человек: изменение скорости на 1–5% неслышимо, и POLQA корректно показывает отсутствие потерь качества, тогда как PESQ оштрафовала бы.

Текущая редакция – POLQA v3 (редакция 2018 года стандарта P.863) – добавила полнополосный анализ и улучшенную обработку задержек для VoLTE, 5G и OTT-звонков. Так почему же, если POLQA лучше во всём, PESQ всё ещё доминирует? Ответ – в одном слове: лицензирование. POLQA запатентована и продаётся по лицензии OPTICOM и её партнёрами; бесплатной референсной реализации, которую можно было бы использовать в хобби-проекте или опубликовать в научной статье, не существует. Именно этот факт объясняет всю странную ситуацию – устаревшая бесплатная метрика обгоняет своего лучшего платного преемника примерно в сорок раз. Если вы – продуктовая команда с финансированием, оценивающая реальный голосовой продукт, лицензия POLQA обычно того стоит. Если же вы публикуете исследование или работаете над сайд-проектом – скорее всего, вы выберете что-то бесплатное.

ViSQOL – открытая метрика для оценки качества речи и музыки

ViSQOL – Virtual Speech Quality Objective Listener – открытая полноэталонная метрика от Google, и для многих команд она становится практичным решением на вопрос: «Мне нужна бесплатная метрика, которая не является удалённым стандартом». Текущий релиз, ViSQOL v3 (2020), поставляется в виде C++-библиотеки с лицензией Apache 2.0 и Python-обёрткой – именно поэтому она активно используется в пайплайнах сборки.

ViSQOL работает иначе, чем PESQ и POLQA, и эту разницу важно понимать – она объясняет как сильные стороны метода, так и его ограничения. Вместо моделирования телефонной трубки ViSQOL преобразует как эталонный, так и искажённый аудиоклип в спектрограмму – визуальное представление звука, где по горизонтали отложено время, а по вертикали – частота, – а затем оценивает степень сходства двух изображений по участкам. Мера этого сходства называется NSIM (Neurogram Similarity Index Measure) и основана на SSIM – индексе структурного сходства, который в мире изображений используется для сравнения двух картинок. Таким образом, ViSQOL оценивает аудио, сводя задачу к сравнению изображений. На заключительном этапе среднее значение сходства преобразуется в MOS-значение по шкале от 1 до 5 – MOS-LQO.

У ViSQOL два режима, и неправильный выбор – к бессмысленным результатам.

  • Речевой режим работает с широкополосным аудиосигналом частотой 16 кГц, определяет наличие речи (детекция голосовой активности), чтобы тишина не учитывалась при оценке, и настроен так, что идеальное совпадение даёт оценку 5,0.
  • Аудиорежим рассчитан на входной сигнал 48 кГц и предназначен для оценки музыки и общего аудио, а не только речи. Именно эта способность отличает ViSQOL – это одна из немногих доступных метрик, способных адекватно оценивать музыку. Google иногда называет эту функцию ViSQOLAudio; в версии v3 оба режима объединены в единый инструмент.

Поскольку метрика основана на сходстве, а не на модели телефона, ViSQOL изящно справляется с time-warping: собственный бенчмарк Google показал, что она плавно деградирует при дрейфе тактовой частоты, где PESQ резко обрывается. Это позволяет использовать её за пределами телефонных звонков – для оценки кодеков, музыкального стриминга и даже как грубый прокси для генеративных аудиомоделей. Её документация честно указывает на ограничения: отдельные оценки шумны, поэтому их нужно усреднять по множеству клипов; модель обучалась на искажённом аудио с битрейтом до ~24 кбит/с и работает плохо при более низких значениях; а также может вводить в заблуждение в сценариях, сильно отличающихся от обучающих данных, например при сильном шумоподавлении.

Рис. 2. PESQ и POLQA моделируют телефон и ухо; ViSQOL превращает звук в картинку и сравнивает картинки. Все три выдают предсказанный MOS по шкале 1–5.

PEAQ и «AAC-Q» – оценка музыкальных кодеков, а не звонков

PESQ, POLQA и ViSQOL появились в телефонии, где основным контентом является речь. Но если ваш продукт транслирует музыку или высококачественное аудио, вас интересует другой вопрос – не «понятен ли этот голос?», а «заметит ли разница между сжатым файлом и оригинальным мастером опытный слушатель?». Это сфера применения PEAQ.

PEAQ – Perceptual Evaluation of Audio Quality – определена стандартом ITU-R BS.1387, впервые опубликованным в 1998 году и последний раз пересмотренным в 2023-м (обратите внимание: ITU-R – сектор радиосвязи, а не ITU-T, сектор электросвязи, которому принадлежат PESQ и POLQA). PEAQ разработана для оценки перцептивных аудиокодеков, таких как MP3 и AAC. Это полноэталонный метод, симулирующий маскирующие свойства человеческого слуха и выдающий оценку Objective Difference Grade (ODG) по шкале от 0 (разница с оригиналом незаметна) до −4 (очень раздражающая разница). PEAQ существует в двух версиях: Basic – достаточно быстрая для мониторинга в реальном времени, и Advanced – более медленная, но надёжная. Это один из ближайших к стандарту инструментов оценки кодеков в области музыки, хотя академический обзор 2022 года («Can we still use PEAQ?») показал, что её точность устарела по сравнению с современными кодеками, и рекомендовал использовать её с осторожностью.

Слово о «AAC-Q» в заголовке статьи – оно заслуживает честности. Не существует единого стандарта ITU или ISO под названием «AAC-Q». На практике это выражение используется условно и означает измерение перцептивного качества для AAC и аналогичных музыкальных кодеков – задачу, которую выполняют такие инструменты, как PEAQ, аудиорежим ViSQOL и проприетарные решения от вендоров (например, AQuA от Fraunhofer). Когда коллега говорит: «прогони AAC-Q на новом энкодере», он на самом деле имеет в виду: «оцени выход AAC по сравнению с оригиналом с помощью перцептивной метрики, способной распознавать музыкальные особенности». Считайте «AAC-Q» не продуктом, а категорией. Реальные инструменты – PEAQ/BS.1387, ViSQOLAudio и лицензируемые анализаторы – выбирайте в зависимости от того, нужен ли вам стандарт (PEAQ), бесплатное решение (аудиорежим ViSQOL) или поддержка вендора (AQuA и аналоги).

Разбор примера: как читать числа

Числа на шкале качества приобретают смысл только после того, как вы их примените на практике. Допустим, вы тестируете новую настройку энкодера Opus для продукта видеоконференций и обрабатываете один и тот же пятисекундный речевой клип тремя разными конфигурациями, оценивая каждую с помощью широкополосной полноэталонной метрики – POLQA в сверхширокополосном режиме. Получаете:

  • Эталон (несжатый): метрика не сравнивается с самим собой; он задаёт верхний предел.
  • Конфиг A – Opus 32 кбит/с: MOS-LQO 4,3
  • Конфиг B – Opus 16 кбит/с: MOS-LQO 3,8
  • Конфиг C – Opus 16 кбит/с с 5% смоделированных потерь пакетов: MOS-LQO 3,1

Как это читать? Начните со шкалы: разница MOS около 0,2 – примерно наименьший разрыв, надёжно различимый слушателями. Значит, разница между 4,3 и 3,8 (разрыв 0,5) реальна и слышна – снижение битрейта вдвое стоило вам половины балла. Падение с 3,8 до 3,1 при потере пакетов (разрыв 0,7) ещё значительнее – это говорит о том, что здесь ключевым фактором качества является не битрейт, а сокрытие потерь пакетов. Стоит ознакомиться с нашим материалом про сокрытие потерь пакетов (PLC).

Теперь арифметика, которая помогает оставаться честным. Оценка одного клипа слишком шумная, поэтому никогда не делайте выводы на основе одного числа. Допустим, вы провели тест на 40 клипах, и Конфиг B в среднем показывает 3,80 со стандартным отклонением 0,40 по клипам. Стандартная ошибка среднего – это стандартное отклонение, делённое на квадратный корень из числа наблюдений:

стандартная ошибка = 0,40 ÷ √40 стандартная ошибка = 0,40 ÷ 6,32 стандартная ошибка = 0,063

То есть среднее значение для Конфига B – 3,80 ± около 0,13 при доверительном уровне около 95% (две стандартные ошибки). Конфиг A со значением 4,30 находится далеко за этой границей, так что можно быть уверенным, что A действительно лучше B. Если бы две конфигурации имели значения 3,80 и 3,85, разница в 0,05 оказалась бы в пределах погрешности, и вы ничего бы не доказали. Метрика даёт число; статистика говорит, имеет ли это число значение. Усредняйте, оценивайте погрешность и доверяйте только тем различиям, которые превышают её.

Таблица сравнения

Таблица ниже – сводка на один экран. Подсвеченный столбец выделяет метрику, к которой мы чаще всего обращаемся в первую очередь в общем видеопродуктовом пайплайне, где обрабатываются и речь, и музыка.

КритерийPESQ (P.862)POLQA (P.863)ViSQOL v3PEAQ (BS.1387)
Орган стандартизацииITU-TITU-TGoogle (открыто)ITU-R
Статус в 2026Отозван 2018, удалён 01.2024АктуаленАктивно поддерживаетсяАктуален (ред. 2023)
Тип эталонаПолноэталоннаяПолноэталоннаяПолноэталоннаяПолноэталонная
Для чегоРечь / телефонияРечь / телефонияРечь и музыкаМузыкальные кодеки
Диапазон частотNB–WB (≤7 кГц)NB–полнополосный (≤20 кГц)Речь WB / аудио 48 кГцПолнополосный
ВыходMOS-LQO 1–5MOS-LQO 1–5MOS-LQO 1–5ODG от 0 до −4
Устойчивость к time-warpНетДаДаН/п
СтоимостьБесплатноПо лицензии (OPTICOM)Бесплатно (Apache 2.0)Стандарт; реализации разные
Готовность для CIДа (обёртки Python)Нужна лицензияДа (C++/Python)Возможна

Как использовать метрику в CI, не обманывая себя

Смысл объективной метрики – автоматически выявлять регрессию. Вот дисциплина, обеспечивающая её надёжность, в порядке следования.

Первое: выберите метрику под ваш контент. Чисто речевой продукт (звонки, телемедицина): POLQA, если можно получить лицензию, иначе – речевой режим ViSQOL. Музыка или смешанный контент (стриминг): аудиорежим ViSQOL или PEAQ. Оценивать музыку узкополосной речевой метрикой – категориальная ошибка, дающая однозначно неверные результаты; а если вы сравниваете кодеки, начать стоит с нашей таблицы сравнения аудиокодеков 2026.

Второе: зафиксируйте тестовый набор, который модель никогда не видела. Соберите 30–50 эталонных клипов, отражающих ваш реальный контент – с разными дикторами, языками, музыкальными жанрами и уровнями фонового шума. Пропускайте каждую сборку-кандидата через пайплайн, оценивайте каждый клип относительно эталона и сохраняйте оценки по каждому клипу, а не только среднее значение.

Третье: выбирайте порог на основе статистики, а не визуально. Рассчитывайте среднее значение и стандартную ошибку, как показано выше. Настройте CI-гейт так, чтобы он срабатывал только тогда, когда среднее значение новой сборки падает ниже среднего старой более чем на суммарную погрешность – то есть только на такие изменения, которые метрика действительно способна различить. Гейт, реагирующий на колебания в 0,03, отключат через неделю – и он окажется хуже, чем его полное отсутствие.

Четвёртое: никогда не обучайте на метрике. Это ловушка Гудхарта, о которой говорилось в предупреждении про PESQ, и она применима ко всем метрикам здесь. Как только ваша функция потерь становится оценкой качества, модель начинает учиться обманывать эту оценку. Обучайте на реальных целях – измеряйте качество с помощью метрик.

Пятое: регулярно проверяйте метрику с помощью слуховых тестов. Объективные метрики перестают отражать человеческое восприятие именно тогда, когда ваш пайплайн внедряет что-то новое – например, новый нейрокодек или агрессивный денойзер. Раз в год проводите небольшой краудсорсинговый тест по стандарту P.808 (подробно разобран в сопутствующем материале про субъективное тестирование – MUSHRA, MOS, A/B, ABX), чтобы убедиться, что метрика по-прежнему корректно отражает качество для вашего контента. Если возникает расхождение между метрикой и мнением людей – правы люди.

Сдвиг 2026 года: метрики без эталона на основе машинного обучения

Всё выше – полноэталонные методы: требуется чистый оригинал. В лаборатории это нормально, а на реальном звонке бесполезно, потому что у слушателя никогда не было доступа к чистому оригиналу. Быстро растущая часть поля в 2026 году – метрики без эталона на основе глубокого обучения, оценивающие один аудиоклип вообще без оригинала.

Две модели стоит знать по имени. DNSMOS P.835 от Microsoft создана для оценки шумоподавителей и выдаёт три отдельные метрики – SIG (насколько чисто звучит речь), BAK (насколько эффективно удалён фоновый шум) и OVRL (общее качество), – что гораздо информативнее одной цифры, поскольку показывает, не повредил ли ваш денойзер голос, устраняя шум. NISQA – открытая модель глубокого обучения, предсказывающая общее качество речи и четыре аспекта: шумность, окраску, прерывистость и громкость, – так что низкая оценка сопровождается подсказкой почему. Обе обучены на крупных краудсорсинговых наборах, оценённых по стандарту ITU-T P.808, и обе способны работать с одним аудиоклипом без эталона – именно это делает их пригодными для мониторинга реального трафика в продакшене.

Траектория ясна: полноэталонные метрики вроде ViSQOL и POLQA остаются в пайплайне сборки, где есть эталон, тогда как обученные метрики без эталона всё чаще применяются в реальных системах. Глубже о волне обученных моделей – в ИИ в аудио для видео и нейросетевых аудиокодеках.

Где здесь Фора Софт

Мы строим видеоконференции, телемедицину, e-learning, OTT-стриминг и видеонаблюдение, и в каждом из них качество звука – то, что пользователь судит первым: клиницисту нужно чётко слышать пациента, студенту – каждое слово лекции. Мы используем объективные метрики так, как описывает эта статья: полноэталонные вроде ViSQOL в пайплайне сборки, чтобы ловить регрессии кодеков и пайплайна до релиза, оценки без эталона для наблюдения за качеством на живом трафике и периодические человеческие слуховые тесты, чтобы держать автоматические числа честными. Дисциплина важнее метрики: гейт качества надёжен ровно настолько, насколько надёжны статистика и человеческие проверки за ним.

Главное

  • Объективные метрики позволяют предсказать Mean Opinion Score, оценённый человеческой панелью, и подходят для быстрой автоматизации.
  • Полноэталонные метрики (PESQ, POLQA, ViSQOL, PEAQ) требуют наличия чистого оригинала; метрики без эталона оценивают качество одного аудиофрагмента.
  • POLQA – официальная и лучшая замена PESQ, однако PESQ остаётся популярной, поскольку бесплатна, в отличие от POLQA, распространяемой по лицензии.
  • ViSQOL – открытая и бесплатная метрика, применимая как к речи, так и к музыке; PEAQ оценивает качество музыкальных кодеков с помощью ODG.
  • Никогда не обучайте модель на основе самой метрики – закон Гудхарта превращает измеряемый показатель в цель, подверженную манипуляциям.
  • Усредняйте результаты по множеству клипов и проверяйте статистическую значимость; доверяйте только тем различиям, которые превышают уровень шумов метрики.

Что почитать дальше

CTA

  • Поговорить с инженером по стримингу – обсудить интеграцию гейтов качества аудио в ваш пайплайн.
  • Посмотреть кейсы – примеры реал-тайм и стриминговых продуктов, которые мы разрабатываем с 2005 года.
  • Скачать памятку по метрикам качества аудио – одностраничный лист выбора PESQ / POLQA / ViSQOL / PEAQ.

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.