Содержание статьи +
- Кратко
- Почему это важно
- Что такое кодек и чем нейросетевой отличается
- Одна идея, которая всё решила: остаточное векторное квантование
- Три кодека, построившие поле
- Цифры, которые решают: битрейт, качество и нагрузка на процессор
- Где нейрокодеки реально работают в 2026: как рот и уши голосового ИИ
- Что дальше
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Кратко
Нейросетевой аудиокодек – это программа сжатия, в которой вместо ручного алгоритма используется нейросеть, обученная на данных: она сама учится упаковывать звук в компактный поток чисел и убедительно его восстанавливать. С 2021 года лучшие из таких кодеков обеспечивают качество, сравнимое со старыми решениями, при в три–четыре раза меньшем битрейте. В этом направлении выделились три системы: SoundStream от Google ввёл ключевой подход – обученный энкодер в связке с остаточным векторным квантованием; Lyra v2 от Google превратила эту идею в рабочий продукт, реально функционирующий на телефонах и в голосовых звонках; а EnCodec от Meta поднял качество настолько высоко, что стал справляться не только с речью, но и с музыкой.
Тот же формат сжатых токенов, который используют кодеки, оказался удобным способом «подать» звук большой языковой модели – и теперь нейрокодеки стали тихим двигателем голосового ИИ. Вопрос «что дальше» больше не сводится к экономии полосы пропускания, а заключается в том, чтобы сделать звук тем, с чем софт может «думать».
Статья простым языком объясняет, как работают эти кодеки, приводит реальные цифры 2026 года по битрейту, качеству и нагрузке на процессор и честно рассказывает, почему пятнадцатилетний Opus по-прежнему выигрывает почти в любом реальном сценарии реального времени.
Почему это важно
Если вы работаете со звуком – будь то конференц-приложение, стриминг, телемедицина или голосовой ассистент – вы наверняка слышали, что «нейрокодеки вот-вот всё изменят». И вам важно понять, действительно ли это применимо к вашему продукту или это просто громкое заявление с конференции. Честный ответ в 2026 году состоит из двух частей.
Для обычных звонков в реальном времени пятнадцатилетний кодек Opus по-прежнему остаётся лучшим выбором по умолчанию, а нейрокодеки – это скорее строка в исследовательском бюджете, чем готовое решение для запуска.
Но всё, что связано с голосовым ИИ – модели, которые слушают и отвечают, автоматический дубляж, генерация речи на устройстве, – уже строится на нейрокодеках, потому что именно они эффективно преобразуют звук в данные для модели и обратно.
Эта статья предназначена для продакт-менеджеров, основателей и инженеров, которым нужно чётко различать эти сценарии: что делают эти системы, во сколько обходятся, где реально работают и какие перспективы ждут нас в ближайшие три года. Это углублённое продолжение нашего обзора ИИ в аудио для видео, где нейрокодеки были одним из четырёх направлений; здесь мы раскрываем тему подробнее.
Что такое кодек и чем нейросетевой отличается
Начнём с простого. Кодек (от «кодер-декодер») – это программа, которая сжимает звуковой сигнал, уменьшая количество бит, чтобы его можно было передать или сохранить, а затем восстанавливать обратно. Любой звонок и любой стриминг используют кодек. Около сорока лет кодеки разрабатывали вручную: инженеры изучали особенности слуха, замечали, что тихий тон сразу после громкого мы не слышим, и создавали алгоритмы, которые отбрасывают то, что ухо не уловит. Это семейство породило такие форматы, как MP3, AAC и Opus; подробнее о принципах работы сжатия звука – в статье как работает сжатие звука. Это блестящая инженерия, созданная вручную, кирпич за кирпичом, людьми.
Нейросетевой аудиокодек заменяет людей-проектировщиков процессом обучения. Вместо того чтобы инженер сам решал, какие части звука сохранять, используют нейросеть – математическую модель с миллионами настраиваемых параметров – и показывают ей огромные объёмы аудиоданных, пока она не научится эффективно сжимать звук и восстанавливать его. Правила никто не задаёт: модель сама их выявляет из данных. В результате кодек достигает битрейтов, недоступных традиционным, при том же качестве, поскольку сеть находит в реальном звуке закономерности, которые человек не смог бы закодировать вручную.
Аналогия, которую стоит держать в голове: традиционный кодек – это переводчик, выучивший грамматику по учебнику, а нейрокодек – тот, кто вырос двуязычным. Переводчик по учебнику быстр, предсказуем и дёшев. Двуязычный – свободнее, ловит нюансы, которых нет в правилах, – и куда дороже в обучении и в работе. Именно эта разница в цене, как мы увидим, и есть вся история о том, почему нейрокодеки ещё не вытеснили остальных.
Одна идея, которая всё решила: остаточное векторное квантование
Почти каждый нейрокодек, о котором вы прочитаете – SoundStream, Lyra, EnCodec, новейшие исследования, – построен по одной и той же трёхкомпонентной схеме, и одна из этих трёх частей – та самая хитрость, что сделала эту область практичной. Пройдёмся по ней шаг за шагом: усвоив её, вы поймёте, что любой кодек в этой статье – лишь её вариация.
Сначала энкодер: нейросеть, которая берёт звуковую волну и сжимает её в компактный поток чисел, называемый латентным представлением. Считайте это личной стенограммой сети для «что это за звук». В конце декодер: зеркальная сеть, которая берёт стенограмму и восстанавливает волну, которую можно проиграть. Энкодер и декодер обучают вместе, сквозным образом, так что стенограмма, которую пишет энкодер, – ровно та, которую умеет читать декодер.
Сложность – и хитрость – в середине. Стенограмма энкодера состоит из непрерывных чисел вроде 0,3719 или −1,882, а числа бесконечной точности по сети не передать. Их нужно округлить до фиксированного набора допустимых значений – это квантование. Загвоздка в том, что для передачи богатого, качественного звука потребовалось бы меню из миллионов значений, а такое меню слишком дорого по памяти и вычислениям.
Прорыв, представленный в SoundStream в 2021 году, называется остаточным векторным квантованием, или RVQ, и работает по принципу сдачи монетами. Допустим, вы должны 8,37, а в первой «банке монет» только рубли. Вы платите 8 и остаётесь с остатком 0,37, который не смогли покрыть. Идёте ко второй банке с гривенниками, платите три (0,30) – остаток уменьшается до 0,07. Третья банка с копейками добирает остальное. Каждая банка мала и дёшева, но сложенные слоями они точно представляют любую сумму. RVQ делает ровно то же самое со звуком: первый квантователь берёт грубую форму, второй – ошибку, оставленную первым, третий – ошибку после второго, и так далее через стек слоёв. Горстка маленьких квантов, сложенных вместе, выполняет работу одного невероятно большого.
У RVQ есть второе преимущество, которое на практике оказывается очень важным. Поскольку слои постепенно уточняют звук, можно просто остановиться раньше. Используешь все слои – получаешь максимальное качество при высоком битрейте; отбрасываешь нижние – получаешь более низкое качество при меньшем битрейте, всё из той же модели, и решение можно принимать на ходу. Поэтому один нейрокодек может поддерживать несколько битрейтов, не требуя создания нескольких моделей. Авторы SoundStream обучили одну модель, работающую в диапазоне от 3 до 18 кбит/с почти без потерь – в отличие от моделей, обученных под каждый битрейт отдельно. Запомните это свойство: именно оно позволяет таким кодекам гибко адаптироваться к плохой сети.
Ещё одна деталь – она объясняет, почему восстановленный звук звучит убедительно, а не глухо. Ранние попытки восстановить аудио по крошечному представлению давали тусклые и размытые результаты. Нейрокодеки решили эту проблему, позаимствовав подход из генерации изображений – состязательное обучение: вместе с декодером обучают вторую сеть – дискриминатор, чья единственная задача – отличать настоящие записи от реконструкций декодера. Декодер, в свою очередь, подталкивают к тому, чтобы обмануть дискриминатор. Две сети гоняются друг за другом, и декодер учится выдавать звук настолько чёткий, что он становится неотличим от настоящего. Именно этот состязательный механизм отличает нейрокодеки 2021 года и позже от мутных автоэнкодеров, существовавших до них.
Три кодека, построившие поле
SoundStream – тот, что начал
SoundStream, представленный исследователями Google в 2021 году, – фундамент, на котором строится всё остальное. Это был первый сквозной нейрокодек, объединивший три ключевые идеи: обученный свёрточный энкодер-декодер, остаточное векторное квантование и состязательное обучение – в единую систему, которая явно превзошла традиционные, разработанные вручную кодеки. Основной результат, который цитируют повсеместно: в слепых тестах SoundStream при 3 кбит/с превзошёл Opus при 12 кбит/с и приблизился по качеству к речевому кодеку EVS при 9,6 кбит/с, расходуя в три–четыре раза меньше бит при том же воспринимаемом качестве. Кроме того, он работал в реальном времени на процессоре смартфона и мог интегрировать шумоподавление в тот же проход, очищая звук «бесплатно» в процессе сжатия.
Как потребительский продукт SoundStream под этим именем не выходил. Его значение – в роли прототипа: RVQ для аудио стало его главным вкладом, и все последующие кодеки от него произошли.
Lyra v2 – тот, что реально работает
Lyra v2 – продакшен-кодек речи от Google, практически реализованная версия SoundStream. Выпущенный в сентябре 2022 года, он основан на архитектуре SoundStream и использует остаточный квантователь по обе стороны канала передачи. Кодек поддерживает три битрейта – 3,2, 6 и 9,2 кбит/с – и переключение между ними возможно прямо во время звонка путём изменения числа слоёв квантования: именно свойство RVQ, описанное выше, обеспечивает такую гибкость в реальном продукте.
Цифры качества конкретны и говорят сами за себя. В слепых тестах Google Lyra v2 при скоростях 3,2, 6 и 9,2 кбит/с показала качество, сопоставимое с Opus при 10, 13 и 14 кбит/с соответственно. Иными словами, Lyra обеспечивает качество речи на уровне Opus, используя примерно половину или шестьдесят процентов полосы пропускания. По сравнению с телефонными кодеками, на смену которым она приходит, Lyra превосходит EVS и AMR-WB, достигая сопоставимого качества при значительно меньшей скорости передачи данных.
Но число, объясняющее, почему Lyra важна, вовсе не про битрейт – оно про скорость. На телефоне Pixel 6 Pro Lyra v2 кодирует и декодирует 20-миллисекундный кадр звука за 0,57 миллисекунды, то есть примерно в 35 раз быстрее реального времени, а её алгоритмическая задержка – 20 миллисекунд, сопоставима с Opus. Google создала Lyra именно так, чтобы нейрокодек работал на обычном телефоне, не сажая батарею и не добавляя лага. Эта инженерия – а не качество исследования – и позволила ей попасть в звонковые продукты Google для пользователей в слабых сетях. Lyra – доказательство того, что нейрокодек может быть продуктом. И она же, показательно, остаётся исключением, а не правилом.
EnCodec – тот, что справляется с музыкой
EnCodec от Meta, октябрь 2022 года, взял за основу архитектуру SoundStream и значительно повысил качество, особенно в воспроизведении музыки. В то время как SoundStream и Lyra ориентированы на речь, EnCodec рассчитан на весь диапазон – от монофонической речи с частотой дискретизации 24 кГц на нижнем конце до стереофонической музыки с частотой 48 кГц на верхнем, при битрейтах от 1,5 до 24 кбит/с. В тестах MUSHRA – стандартном методе субъективного тестирования качества звука – EnCodec показал результаты выше, чем у SoundStream при одинаковом битрейте, а при 3 кбит/с превзошёл Lyra v2 на 6 кбит/с и Opus на 12 кбит/с.
EnCodec добавил два важных уточнения. Для упрощения и ускорения обучения использовался один многомасштабный спектрограммный дискриминатор, а также «балансировщик потерь», обеспечивавший стабильность процесса обучения. Кроме того, было показано, что поверх выходных данных кодека можно применить небольшую модель на основе Transformer и дополнительно сжать битовый поток на 25–40 процентов – например, сократить поток с 3 кбит/с до примерно 1,9 кбит/с – при этом сохраняя производительность выше реального времени. Этот последний приём стал указанием на дальнейшее развитие направления: рассматривать выход кодека не как финальный битовый поток, а как язык, который другая модель может сжимать и предсказывать.
Цифры, которые решают: битрейт, качество и нагрузка на процессор
С нейрокодеками возникает соблазн увидеть экономию битрейта и сделать вывод, что они, очевидно, лучше. Дисциплина – сразу вынести на стол все три цены, потому что экономия полосы пропускания реальна, но платится она по другой оси.
Вот сравнение, важное для реального продуктового решения, с цифрами, соответствующими качеству, под которое спроектирован каждый кодек.
| Кодек | Год | Диапазон битрейта | Эталон равного качества | Тип звука | Цена процессора | В проде? |
|---|---|---|---|---|---|---|
| Opus | 2012 | 6–510 кбит/с | база, с которой все сравнивают | речь + музыка | очень низкая (микросекунды) | да – основа WebRTC |
| SoundStream | 2021 | 3–18 кбит/с | 3 кбит/с ≈ Opus 12 | речь + общий | средняя (тянет телефон) | нет – чертёж |
| Lyra v2 | 2022 | 3,2 / 6 / 9,2 | 9,2 кбит/с ≈ Opus 14 | речь | низкая–средняя (0,57 мс/кадр на телефоне) | да – звонки Google |
| EnCodec | 2022 | 1,5–24 кбит/с | 3 кбит/с > Opus 12 | речь + музыка | высокая | нет – топливо для моделей |
| Mimi | 2024 | ~1,1 кбит/с | токенайзер речевых LLM, не hi-fi | речь | высокая | да – внутри голосовых ИИ |
Прочтите таблицу дважды. Левые столбцы – триумф: нейрокодеки достигают качества Opus при трети–четверти битрейта, а новейшие речевые LLM-кодеки работают на уровне около 1 кбит/с. Правые столбцы – загвоздка. Opus декодируется за микросекунды на любом устройстве этого века; нейрокодекам же приходится прогонять нейросеть на каждом кадре – это требует на порядки больше процессорного времени, расходует больше батареи, а для тяжёлых моделей нужен мощный телефон или GPU. Lyra – единственный кодек, спроектированный достаточно жёстко, чтобы обойти эту проблему на обычном смартфоне, и даже он – речевой, а не универсальный.
Посчитаем экономию, чтобы она стала конкретной. Пусть на встрече с 50 участниками стримится звук, и каждый говорящий использует Opus со скоростью 12 кбит/с:
50 говорящих × 12 кбит/с = 600 кбит/с звука
Подставим нейрокодек при одинаковом качестве и 3 кбит/с на одного говорящего:
50 говорящих × 3 кбит/с = 150 кбит/с звука
Это сокращение полосы звука в 4 раза, и оно работает там, где пропускная способность ограничена – например, у пациента на сельском мобильном интернете во время телемедицинского звонка или у студента в перегруженной сети кампуса. Экономия реальная. Однако причина, по которой эту технологию пока нельзя внедрить повсеместно, – в крайнем правом столбце: обработка сигнала на каждом устройстве и каждом кадре обходится дороже, чем экономия полосы, если только устройства и запас батареи не справятся с такой нагрузкой.
«Подводный камень – «обгоняет Opus» почти никогда не значит «замени Opus». Почти каждая статья о нейрокодеке сообщает, что он превосходит Opus на низком битрейте, и при условиях эксперимента это действительно так. Но для реального продукта это почти не имеет значения, потому что главное преимущество Opus – не эффективность сжатия, а то, что он бесплатно декодируется на любом устройстве, не требует лицензии и встроен в стандарт WebRTC. Прежде чем использовать результат вроде «3 кбит/с обгоняет Opus на 12» как повод к переходу, задайте три вопроса, которые автор статьи не задал: во что это обойдётся на самом слабом устройстве клиента, как повлияет на батарею и какова задержка. Для большинства голосовых звонков в 2026 году эти ответы всё ещё говорят в пользу Opus. Используйте нейрокодек там, где сеть – жёсткое ограничение, а вычислительные ресурсы доступны, а не по умолчанию.»
Где нейрокодеки реально работают в 2026: как рот и уши голосового ИИ
Вот поворот, удививший специалистов, – и это важнейшее, что нужно понять: нейрокодеки значимы, даже если Opus по-прежнему выигрывает в живых звонках.
Большая языковая модель предсказывает следующий токен в последовательности. Для текста это просто – токенайзер разбивает письмо на несколько тысяч возможных кусочков-слов, и модель предсказывает их по одному. Звук куда сложнее: сырое аудио – это десятки тысяч чисел в секунду; модель, пытающаяся предсказывать его отсчёт за отсчётом, тонет. То, что нейрокодеки дали миру ИИ почти как побочный эффект, – это способ превратить секунду звука в короткую последовательность дискретных токенов – индексов квантователей из стека RVQ – которые языковая модель предсказывает ровно так же, как предсказывает слова. Кодек стал токенайзером для аудио. Энкодер – это уши модели; декодер – её рот.
Это кардинально меняет подход. EnCodec был интегрирован в MusicGen от Meta в качестве аудио-токенайзера. Открытый Descript Audio Codec (2023), сжимающий звук с частотой 44,1 кГц примерно в 90 раз, стал идеальным «топливом» для аудио-языковых моделей. А самый яркий пример нового подхода – Mimi, кодек, разработанный Kyutai для речевой модели Moshi в 2024 году. Mimi работает на скорости ~1,1 кбит/с и всего с 12,5 кадрами в секунду, и делает то, чего не удавалось ранним кодекам: разделяет токены на два типа. Первый поток – семантический: он получен дистилляцией из модели распознавания речи и несёт что именно говорится, как текст, без привязки к голосу. Остальные потоки – акустические: они передают как это звучит – тембр, высоту тона, эмоциональную окраску. Разделяя смысл и голос, Mimi позволяет языковой модели анализировать содержание и подачу как две независимые составляющие – именно то, что необходимо системе, чтобы естественно воспринимать и воспроизводить речь. На его основе построен Moshi, способный одновременно слушать и говорить с задержкой около 200 миллисекунд.
Так что продакшен-ответ в 2026 году чётко раздваивается. Чтобы передавать знакомый голос по сети в реальном времени, Opus – выбор по умолчанию, а нейрокодек редко окупает свои вычислительные затраты. Чтобы генерировать или понимать речь с помощью модели – голосовые ассистенты, ИИ-дубляж, локальный TTS, перевод в реальном времени – нейрокодек уже не опция; он становится тем, что позволяет модели слышать и говорить. Тот же стек RVQ, что сжимает аудиозвонок, токенизирует звук для LLM. Одна технология – два будущих.
Что дальше
Три направления определяют ближайшие годы, и ни одно из них – не «нейрокодеки наконец обходят Opus на телефоне для обычных звонков». Эта гонка по большей части завершена: Opus остаётся кодеком по умолчанию для обычного транспорта, а форк под названием AOMedia Open Audio Codec (OAC) – начатый в начале 2026 года на основе исходников Opus – представляет собой ставку индустрии на следующий традиционный кодек, цель которого – превзойти Opus в его собственной области, а не заменить его нейросетевым решением.
Первый настоящий рубеж – сделать нейрокодеки достаточно дешёвыми для развёртывания на краю сети. Теперь всё поле считает главной проблемой не качество, а цену процессора. Исследовательские конкурсы 2025 года прямо нацелены на кодеки, способные работать при жёстких ограничениях по вычислениям, задержке и битрейту на обычных устройствах в шумных реальных условиях – именно эти ограничения отличают победителя бенчмарка от продукта, пригодного для выпуска. Lyra показала, что это возможно для речи на хорошем телефоне; теперь задача – сделать это реальностью для большего числа устройств, типов звука и при меньшей вычислительной мощности.
Второй рубеж – линия «кодек как токенайзер» взрослеет в инфраструктуру. По мере того как голосовые ИИ-модели выходят из лабораторий в реальные продукты – ассистенты, распознающие интонацию, дубляж в реальном времени с сохранением манеры речи, перевод, сохраняющий ваш голос, – нейрокодек под ними становится частью «водопровода», такой же стандартной, как видеокодек сегодня. Открытые вопросы остаются вокруг устройства токенов: как чётко разделить семантику и акустику, сколько токенов в секунду нужно модели, и сохранят ли следующие системы вообще дискретные токены – некоторые исследования 2025 года генерируют звук из непрерывных представлений, полностью обходя квантование.
Третий – тот, за которым стоит следить ради собственной дорожной карты: граница между «кодеком» и «генератором» стирается. Нейрокодек, способный восстановить голос по 1,1 кбит/с токенов, технически почти неотличим от модели, которая может сгенерировать этот голос с нуля. Та же архитектура, что восстанавливает потерянный пакет, предсказывая недостающий звук (см. восстановление при потере пакетов), – та же, что и клонирует голос. Как мы отмечали в обзоре ИИ в аудио, именно на этом сближении строятся вопросы согласия, образа и раскрытия – и они возникают не только через инструменты дубляжа, но и через слой кодека. Когда сжатие и синтез реализованы одной и той же сетью, вопрос «реален ли этот звук» перестаёт быть тем, на который кодек может ответить за вас.
Где здесь Фора Софт
Мы разрабатываем решения для конференций, телемедицины, e-learning, OTT-стриминга и видеонаблюдения, и наш подход к нейрокодекам намеренно консервативен: для передачи живого звука в реальном времени в 2026 году мы выбираем Opus – и делаем это первым. Причина проста: его почти нулевая стоимость декодирования, отсутствие лицензионных отчислений и обязательная поддержка в WebRTC перевешивают экономию битрейта, которой большинству клиентов не нужно, а большинство устройств не способны обеспечить.
Там, где мы действительно следим за нейрокодеками, – это уровень искусственного интеллекта: когда продукту требуется модель для распознавания или генерации голоса, кодек перестаёт быть просто средством сжатия и превращается в фундамент всей системы. Правильно построить вокруг него аудио-конвейер WebRTC – с учётом бюджета задержки, нагрузки на клиентское устройство и возможности отката к Opus – и есть настоящая инженерия, определяющая, будет ли функция работать на практике.
Правильный вопрос для клиента почти никогда не «стоит ли переходить на нейрокодек?», а «где в нашем конвейере обученная модель оправдывает затраты на процессор?» – и год за годом ответ смещается от «нигде» к использованию ИИ-функций на периферии системы.
Главное
- Нейрокодек позволяет сети выучить сжатие на основе данных, а не по заранее заданным правилам.
- Остаточное векторное квантование – уточнение звука слоями – стало ключевой идеей, которая всё изменила.
- SoundStream задал основу; Lyra v2 адаптировала её для телефонов; EnCodec распространил подход на музыку.
- Нейрокодеки обеспечивают качество Opus при в 3–4 раза меньшем битрейте, но требуют больше ресурсов CPU и быстрее разряжают батарею.
- Для голосовых звонков в 2026 году Opus остаётся оптимальным выбором по умолчанию; нейрокодеки редко его превосходят.
- Их настоящая ниша в 2026 году – голосовой ИИ: кодек преобразует звук в токены, которые предсказывает LLM.