Глава 3 из 10

Глава 3. Звук и речь: распознавание, синтез, шумоподавление

Десять статей по порядку – 4 часа 29 минут чтения. Ниже маршрут главы: высота каждого шага соответствует времени чтения.

Глава 3 из 10дальше: Мультимодальные модели: от CLIP до видео-VLM

Речь в видеопродукте от распознавания до синтеза: потоковый ASR, диаризация, клонирование голоса и согласие по NO FAKES Act, TTS, шумо- и эхоподавление, перевод речи в реальном времени. Здесь же цены поставщиков, из которых складывается стоимость минуты.

Маршрут главы

10 статей · 4 ч 29 мин
3.1Streaming ASR в проде – Whisper, Deepgram и AssemblyAI в 2026Потоковое распознавание речи (streaming ASR) – это преобразование живого аудио в текст в режиме реального времени, пока…28 мин·от начала главы 0 ч 0 мин3.2WhisperX подробно – диаризация и пословные таймкодыWhisperX – это бесплатный open-source инструмент, который берёт речевую модель OpenAI Whisper и закрывает две её главные…29 мин·от начала главы 0 ч 28 мин3.3Диаризация дикторов с Pyannote в рабочей системеPyannote – это открытый инструмент, отвечающий на вопрос, который другие речевые системы игнорируют: не *что* было…35 мин·от начала главы 0 ч 57 мин3.4Цены ElevenLabs, клонирование голоса и инженерия согласия по NO FAKES ActElevenLabs – самый популярный коммерческий сервис синтеза речи и клонирования голоса. Цены 2026 года варьируются от…19 мин·от начала главы 1 ч 32 мин3.5Потоковый TTS – Kokoro, ElevenLabs Turbo, Cartesia и OpenAI TTSПотоковый синтез речи превращает текст в звук, который начинает воспроизводиться ещё до завершения полной обработки…17 мин·от начала главы 1 ч 51 мин3.6Шумоподавление в реальном времени в проде – Krisp, RNNoise и DeepFilterNetШумоподавление в реальном времени – это программное обеспечение, которое удаляет фоновый шум (стук клавиш, лай собаки,…18 мин·от начала главы 2 ч 8 мин3.7Эхоподавление – классический AEC + ИИ-гибридЭхоподавление – это программа, которая не даёт собеседнику слышать собственный голос, возвращающийся обратно: так…31 мин·от начала главы 2 ч 26 мин3.8Speech-to-speech – Realtime API, Gemini Live, SeamlessM4TSpeech-to-speech – это система, которая воспринимает устную речь и отвечает голосом, при этом ей не нужен промежуточный…32 мин·от начала главы 2 ч 57 мин3.9Многоязычный перевод речи в реальном времени в звонкахПеревод речи в реальном времени позволяет двум людям, говорящим на разных языках, понимать друг друга прямо во время…31 мин·от начала главы 3 ч 29 мин3.10Whisper Flow / Whisper App – разбор инженерии приложения для диктовкиПриложение для диктовки вроде Wispr Flow позволяет нажать одну клавишу, говорить и наблюдать, как чистый текст…29 мин·от начала главы 4 ч 0 мин

Строите такую систему?

Поможем выбрать кодек и собрать пайплайн под ваши объёмы – 20 лет в видеоразработке, 250+ проектов.