Содержание статьи +
- Кратко
- Почему это важно
- Что на самом деле значит «ИИ в видеоконференцсвязи»
- Меню функций, сгруппированное по задачам
- Решение, проходящее сквозь каждую функцию: где оно реализуется?
- Денежные функции вблизи: ИИ-ноутейкер и ИИ-ассистент встречаются
- Бюджет задержки – чтобы дедлайны перестали быть абстрактными
- Сколько это стоит и арифметика «строить или покупать»
- То, что превращает функцию в юридическую обязанность: согласие
- Плейбук: короткий путь от списка желаний к работающей функции
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Добавить ИИ в продукт для видеозвонков – это не одна функция, а набор возможностей, разделённых на четыре задачи: улучшить качество звонка, сделать его понятным, сохранить информацию и помогать участникам в реальном времени. Главный инженерный вопрос – не «какую функцию выбрать?», а «где именно она будет выполняться?», потому что каждая ИИ-функция может работать в одном из трёх мест: на устройстве пользователя, на вашем медиасервере или в облачном API. Именно этот выбор сильнее всего влияет на задержку, стоимость и уровень приватности – больше, чем выбор самой модели. Коммерчески значимые функции, такие как ИИ-ассистент встреч и ИИ-ноутейкер, которые напрямую привлекают покупателей, можно приобрести готовыми, подключить как отдельного бота или встроить нативно в собственный real-time-конвейер. Только третий вариант позволяет хранить транскрипцию и резюме внутри вашего продукта. Этот гайд даёт продукт-менеджеру и инженеру единую карту: меню функций, выбор места выполнения из трёх уровней, анализ «разрабатывать или покупать» для ассистента, бюджет задержки, который легко оценить на пальцах, и правила согласия, превращающие функцию в юридическую обязанность.
Почему это важно
Каждый видеопродукт сегодня конкурирует за счёт возможностей искусственного интеллекта, и конференцсвязь – это поле, где борьба особенно ожесточённая: рынок ИИ-ассистентов для встреч оценивался в $3,5 млрд в 2025 году и растёт примерно на 26% в год. Опросы показывают, что 62% пользователей экономят около четырёх часов в неделю, как только в их встречах появляется ассистент. Если вы разрабатываете или владеете продуктом для конференцсвязи, телемедицины, онлайн-обучения или звонков отдела продаж, в вашей дорожной карте теперь два ключевых вопроса: «какие ИИ-функции добавить и в каком порядке?» и «покупать готовое решение или интегрировать эту возможность в собственное приложение?». Этот плейбук отвечает на оба вопроса именно для сферы конференцсвязи. Он написан так, чтобы продакт-менеджер мог спланировать набор функций и обеспечить приватность без инженерного образования, а инженер – увидеть, где выполняется каждая функция и сколько она стоит. Это карта отрасли; более глубокие уроки из раздела Phase 6 – это пофункциональные инженерные руководства, на которые он ссылается.
Что на самом деле значит «ИИ в видеоконференцсвязи»
Уберите маркетинг – и видеозвонок окажется просто потоком аудио и видео, передающимся в реальном времени между людьми. «ИИ в видеоконференцсвязи» означает вставить модель куда-то в этот поток – чтобы изменить медиа, прочитать его или на основе него что-то сделать – достаточно быстро, чтобы звонок всё ещё ощущался живым.
В этом и заключается суть: три глагола делают остальной плейбук понятным. Модель может изменить медиа: убрать фоновый шум, размыть фон, заменить его, выровнять освещение. Модель может прочитать медиа: преобразовать речь в субтитры, перевести её, определить, кто говорит, составить краткое содержание. Или модель может действовать на основе прочитанного: предложить ответ прямо во время звонка, набросать письмо с продолжением диалога, обновить CRM. Почти любая ИИ-функция в конференцсвязях на рынке – это один из трёх глаголов, применённый к живому потоку.
Для планирования это важно, потому что у трёх глаголов – «изменить», «прочитать» и «действовать» – очень разная инженерная цена. Изменение медиа должно происходить заметно быстрее десятой доли секунды – иначе звонок будет казаться сломанным. Чтение медиа может немного отставать: субтитры, опоздавшие на четверть секунды, не вызывают дискомфорта. А действия по медиа могут занимать целые секунды – ведь человек сам их инициировал и готов ждать паузу. Сортируйте список задач сначала по глаголу – и дедлайны выстроятся сами собой.
Меню функций, сгруппированное по задачам
Покупатели думают в терминах функций, а инженеру следует думать в терминах задач. Четыре ключевые задачи охватывают практически всё, что предлагает продукт для конференцсвязи, и группировка по задачам – а не по вендору – делает дорожную карту объективной.
Первая задача – очистить звонок: шумоподавление, убирающее стук клавиатуры и лай собак, эхоподавление, предотвращающее петлю обратной связи, когда кто-то сидит рядом с динамиками, размытие и замена фона ради приватности, авто-кадрирование, которое держит лицо в центре. Эти операции выполняются для каждого кадра и каждого аудиопакета, поэтому они работают под самым жёстким дедлайном во всём продукте. Современное шумоподавление снижает фоновый шум на 10–20 децибел – децибел – это стандартная единица громкости звука, и 10 децибел примерно соответствуют «вдвое тише» по восприятию человеческого уха – при этом речь остаётся разборчивой.
Вторая задача – сделать звонок понятным: живые субтитры, перевод в реальном времени и метки говорящих. Субтитры создаются с помощью автоматического распознавания речи (ASR) – это программное обеспечение, превращающее произнесённые звуки в текст. На чистом английском языке современные системы ошибаются менее чем в 5% слов; на шумных звонках с несколькими участниками точность падает ниже 10%. Перевод добавляет дополнительный этап и немного увеличивает задержку – в Google Meet на базе Gemini субтитры доступны на 60+ языках, а частичный перевод обычно появляется менее чем за полсекунды.
Третья задача – сохранить знания, и здесь деньги. ИИ-ноутейкер и ИИ-ассистент встреч по сути выполняют одну и ту же работу: ведут транскрипт разговора с возможностью поиска и составляют краткое резюме с выделенными пунктами действий. Эти функции действительно востребованы – только запрос «ai notetaker» собирает тысячи поисковых запросов в месяц – и именно ради них создан этот урок. Им посвящён отдельный подробный раздел ниже.
Четвёртая задача – помогать людям вживую: копилот, отвечающий на вопрос прямо во время звонка, формирующий follow-up, пока разговор ещё идёт, или обновляющий запись в CRM без единого нажатия. Это самая новая и наименее зрелая группа, и поскольку человек явно её просит и ждёт ответа, она может занять секунду-другую, не ощущаясь сломанной.
Решение, проходящее сквозь каждую функцию: где оно реализуется?
Вот вопрос, который важнее любого выбора модели: для каждой функции – какая машина выполняет вычисления? Ответов всего три, и каждая ИИ-функция конференцсвязи работает на одной из них.
Первое место – собственное устройство пользователя: его браузер или приложение, на процессоре или графическом чипе ноутбука. Размытие фона и шумоподавление обычно считаются здесь. Выигрыш в том, что аудио и видео не покидают машину пользователя ради очистки, поэтому задержка почти нулевая, а приватность отличная. Подвох в том, что вы зависите от того железа, что есть у пользователя, и работа делается по разу на человека, а не один раз на комнату.
Второе место – ваш медиасервер: та инфраструктура, что и так находится в центре каждого группового звонка. В WebRTC – открытом стандарте, на котором браузеры строят real-time-звонки, – эта центральная точка обычно представляет собой Selective Forwarding Unit, или SFU: сервер, принимающий аудио и видео от всех участников и пересылающий нужные потоки нужным людям. Поскольку SFU уже получает звук от всех, это естественное место для однократной транскрипции и рассылки субтитров всем – паттерн субтитров на стороне SFU – а также естественное место для записи и транскодирования. Выигрыш – одна транскрипция на всю комнату, полностью под вашим контролем. Цена – вы сами запускаете и оплачиваете эти вычисления, а аудиоданные проходят через ваши серверы.
Третье место – облачный AI-API: сервис вроде хостингового распознавания речи или языковой модели, куда вы отправляете аудио или текст и получаете результат. Тяжёлая транскрипция, перевод, резюме и живой копилот обычно относятся к этой категории, потому что качество здесь максимально высокое, а модели не нужно держать у себя. Оплата – по минутам, есть дополнительный сетевой круг, и данные покидают ваш периметр – а это, как мы увидим, как раз там, где начинаются юридические вопросы.
Почти ни один реальный продукт не ограничивается одним ярусом. Типичное приложение для видеоконференций размывает фон на устройстве, транскрибирует на SFU или в облачной ASR-системе и генерирует резюме с помощью облачной языковой модели. Ключевое мастерство – правильно распределить каждую функцию по ярусу. Правило можно вывести из глаголов выше: функции изменения медиа лучше выполнять на устройстве, функции чтения медиа – на SFU или в облаке, а функции действия по медиа – исключительно в облаке.
Денежные функции вблизи: ИИ-ноутейкер и ИИ-ассистент встречаются
Ноутейкер и ассистент встреч – функции, которые называют ваши покупатели, поэтому точность здесь важна. В повседневной речи эти термины часто смешиваются, но различие между ними полезно. Ноутейкер – более узкая задача: записать разговор, транскрибировать его и подготовить заметки с резюме после встречи; результатом становится документ. Ассистент встреч – более широкая роль: всё, что делает ноутейкер, плюс поддержка в реальном времени во время звонка и действия после – например, черновик follow-up или синхронизация с CRM; результатом становятся документ и выполненные действия. Каждый ноутейкер – часть ассистента встреч; но не каждый ассистент ограничивается только заметками.
Для продукта конференцсвязи есть три способа дать эту способность пользователям, и они чисто ложатся на то, где происходит захват.
Первый путь – использовать встроенный ассистент платформы. У Zoom есть AI Companion, у Microsoft Teams – Copilot, а у Google Meet – функция «take notes for me» на базе Gemini. Ассистент Zoom транскрибирует и переводит на 30+ языках и доступен в платных тарифах; ассистент Google автоматически создаёт структурированные заметки прямо в Google Doc. Это подходящий вариант, если ваша команда просто встречается на одной из этих платформ и хочет получать заметки. Это не подходит, если вы разрабатываете продукт, потому что ассистент привязан к платформе, а его результаты никогда не попадают внутрь вашего приложения.
Второй путь – подключить внешнего бота. Инструменты вроде Otter, Fireflies и Fathom, а также инфраструктурные API, такие как Recall.ai, на основе которых можно строить собственные решения, добавляют в звонок программного участника. Под капотом такой «бот» – как правило, headless-браузер: полноценный веб-браузер на сервере без графического интерфейса, который подключается к встрече по ссылке через WebRTC так же, как обычный пользователь. Это быстро интегрируется и работает на всех платформах, но бот виден в списке участников, а аудиопоток проходит через третью сторону. Полная функциональная реализация таких ботов – тема отдельного разбора, см. разбор Otter / Fireflies / Fathom и ландшафт инструментов транскрипции – и эта граница становится важной для клиентов, сталкивающихся с тем, что индустрия теперь называет «усталостью от ботов» – измеримой реакцией против заметных ботов-ноутейкеров в чувствительных звонках.
Третий путь – и единственный, при котором способность становится частью вашего продукта, – встроить её в собственный real-time-конвейер. Когда встреча уже проходит внутри вашего приложения, боту не нужно подключаться извне – ваш сервер уже в звонке. Вы добавляете тихого участника, который слушает, транскрибирует и резюмирует, а затем отображаете результат на собственной панели. В 2026 году стандартный подход – LiveKit-агент: LiveKit – это open-source WebRTC-фреймворк, на котором работает real-time-аудио в продуктах вроде голосового режима ChatGPT, а его agents-фреймворк позволяет программе на Python или Node.js подключиться к звонку как полноценному участнику. Агент транскрибирует с помощью потокового ASR-движка, резюмирует с помощью языковой модели и отправляет данные обратно в ваше приложение – полная сборка ноутейкера – отдельный разбор. Этот путь требует наибольших инженерных усилий и минимального места, оставляет данные внутри периметра и позволяет заложить согласие с самого первого спринта.
Бюджет задержки – чтобы дедлайны перестали быть абстрактными
«Реальное время» – это число, а не настроение, и самый дешёвый способ не построить что-то сломанное – заранее сложить миллисекунды, прежде чем писать код. Вот бюджет для живого субтитра: звук покидает рот говорящего, а слова должны появиться на экранах всех, прежде чем задержка начнёт раздражать.
Пройдём по этому пути с приведённой арифметикой. Захват и кодирование звука на устройстве занимают около 30 миллисекунд – миллисекунда – это одна тысячная секунды. Сетевой переход от устройства до вашего медиасервера добавляет ещё около 40 миллисекунд. Движку распознавания речи требуется примерно 150 миллисекунд, чтобы выдать первый частичный субтитр. Передача субтитра обратно каждому участнику занимает ещё 40 миллисекунд, а отображение текста на каждом экране – около 20.
Сложим: 30 + 40 + 150 + 40 + 20 = 280 миллисекунд. Линия комфорта для живых субтитров – около 300 миллисекунд, так что бюджет умещается – впритык. Обратите внимание на рычаг: самая крупная статья расходов – 150 миллисекунд на распознавание. Если бы вместо этого вы отправили звук в далёкий облачный ASR с задержкой туда-обратно в 120 миллисекунд, итоговая задержка составила бы 400 миллисекунд, и субтитры ощущались бы тормозными. Вот почему вопрос «где это выполняется» – ключевое решение: перенос распознавания с удалённого облака на ваш сервер или на само устройство – это разница между функцией, которая работает «живо», и той, которая – нет. Та же дисциплина управления задержкой применима к любой real-time-функции; полный метод – в уроке про бюджет задержки до 100 миллисекунд.
Сколько это стоит и арифметика «строить или покупать»
Стоимость ИИ в конференцсвязи проявляется в двух формах, и путаница между ними может привести к перерасходу бюджета. Купленные инструменты тарифицируются по месту: фиксированная плата за пользователя в месяц – она предсказуема и доступна для небольшой команды, но становится дорогой в крупных организациях, где многие лицензированные места используются редко. Встроенная функциональность тарифицируется по времени использования: вы платите облачному провайдеру за транскрибирование звука и генерацию токенов моделью – это обходится в ноль при простое и растёт пропорционально реальному потреблению.
Таблица привязывает формы к конкретным цифрам на 2026 год; перед фиксацией проверьте актуальные данные, так как эта категория часто переоценивается.
| Подход | За что платите | Хорош, когда | Подвох |
|---|---|---|---|
| Встроенный в платформу (Zoom / Teams / Meet) | Включено в план, который вы и так берёте | Встречаетесь на одной платформе и хотите заметки | Привязка к платформе; в ваш продукт ничего не попадает |
| Внешний бот (Otter / Fireflies / Fathom) | ~$8–19 за пользователя в месяц | Маленькая команда, много платформ, быстрый старт | Видимый бот; данные через третью сторону; цена за места растёт |
| Build-it API захвата (Recall.ai) | ~$0,50 за час записи + ~$0,15/ч транскрипции | Продукт, который транскрибирует, только когда есть звонки | Резюме, хранение и UI вы всё равно строите |
| Нативный конвейер (ваш SFU + LiveKit-агент) | Ваш облачный ASR + LLM + инфраструктура | Встреча и есть ваш продукт; данные должны остаться внутри | Больше всего инженерии вперёд; вы это эксплуатируете |
Считайте числа «строить или покупать», а не угадывайте их. Допустим, продукт для продаж, чьи клиенты в сумме проводят 10 000 часов записанных звонков в месяц, использует API захвата по примерно $0,50 за час захвата плюс $0,15 за час транскрипции. Это 10 000 × ($0,50 + $0,15) = 10 000 × $0,65 = $6 500 в месяц на захват и транскрипцию – до обработки моделью резюме и хранения. Соответствует ли это стоимости лицензий на места, зависит от того, сколько пользователей представляют эти 10 000 часов – именно поэтому нужна точная математика, а не приблизительные оценки. Полная модель стоимости, включая расчёт токенов модели, – в уроке про реальную стоимость ИИ в видеопродуктах.
«Частая ошибка: считать ИИ-ассистента функцией, которую включают, а не системой, которую эксплуатируют. Команды задают задачу ноутейкеру: «добавить транскрипцию и резюме» – и запускают продукт, а потом обнаруживают, что настоящая работа была повсюду: обработать звонок, где двое говорят одновременно, правильно определить, кто из них говорит, хранить транскрипты в соответствии с политикой хранения данных и – что особенно болезненно – собрать согласие пользователей. На чистом звуке все ASR-движки отличаются друг от друга всего на пару процентов, поэтому демо всегда выглядит отлично. Проблемы возникают на шумных, многоязычных звонках и при юридической проверке. Бюджетируйте систему вокруг модели, а не только саму модель.»
То, что превращает функцию в юридическую обязанность: согласие
Здесь дорожная карта конференцсвязи постепенно превращается в юридическую реальность, и 2026 год повышает ставки. Далее – инженерно-полезный контекст, а не юридическая консультация: уточняйте детали у квалифицированного юриста в рамках вашей юрисдикции.
Запись разговора регулируется законом. В США правила различаются по штатам: 39 штатов плюс округ Колумбия допускают согласие одной стороны – достаточно, чтобы один из участников дал согласие на запись, – тогда как в 11 штатах, включая Калифорнию, Иллинойс и Пенсильванию, требуется согласие всех сторон, то есть согласие должно быть получено от каждого участника. Согласно европейскому GDPR, запись чьего-либо голоса возможна только при наличии законного основания и ясного, информированного согласия. Распространённая ошибка команд: просто присутствие бота в списке участников не является юридическим согласием. Ни одна крупная юрисдикция не признаёт аргумент «они видели Notetaker» достаточным для информированного согласия, которое требует закон.
Два новых риска требуют особого внимания у тех, кто внедряет такие технологии. Первый – голосовые отпечатки являются биометрией: процесс распознавания говорящих, лежащий в основе определения «кто что сказал», формирует голосовую подпись. К 2026 году эта подпись всё чаще будет признаваться защищённым биометрическим идентификатором по законам вроде иллинойсского BIPA, что может повлечь необходимость получения явного согласия (opt-in). Второй – растёт судебная активность: коллективные иски, поданные в конце 2025 года – Brewer v. Otter.ai в Калифорнии и Cruz v. Fireflies. AI в Иллинойсе – как раз утверждают эти нарушения: боты перехватывали коммуникации и собирали голосовые данные без согласия всех участников. Как бы ни завершился процесс, он уже заставил корпоративных юристов действовать осторожнее. Именно поэтому встроенное согласие в собственной системе стало не просто мерой защиты, а ключевым аргументом при продажах.
Если вы встраиваете ассистента в продукт, закладывайте согласие с самого начала: раскройте ИИ до того, как он включится, соберите согласие и дайте пользователям реальный способ отказаться. В ЕС статья 50 EU AI Act делает это раскрытие обязанностью прозрачности, а не любезностью – та же дисциплина в уроке про инженерию раскрытия и в уроке про регуляторику EU AI Act. Нативная сборка – путь, позволяющий выполнить эти обязанности чисто, потому что запрос согласия – часть вашего продуктового потока, а не внешнего бота.
Плейбук: короткий путь от списка желаний к работающей функции
Соберите кусочки – и дорожная карта ИИ в конференцсвязи сводится к четырём вопросам, которые задаются по порядку для каждой функции.
Сначала – какая это задача: очистить, понять, сохранить или помогать? Задача задаёт дедлайн задержки, а дедлайн отсекает ярусы, которые его не вытянут. Второе – где это выполнять: если дедлайн меньше примерно десятой доли секунды, работа на устройстве; если небольшая задержка допустима и всей комнате нужен один результат – медиасервер; если работа тяжёлая и пауза допустима – облачный API. Третье – строить или покупать: если результат должен жить внутри вашего продукта, стройте нативно в свой конвейер; если способность нужна лишь рядом с встречами – купите инструмент или прикрутите бота. Четвёртое, и без исключений, – ворота согласия: раскройте ИИ, соберите согласие и соблюдите штаты с согласием всех сторон, GDPR и EU AI Act до того, как функция уйдёт в релиз. Каждая функция проходит эти ворота; ни одна их не минует.
В этом и заключается суть плейбука. Уроки Phase 6 этого раздела – подробные руководства по каждому квадрату: размытие фона, шумоподавление, живые субтитры, перевод в реальном времени и паттерны интеграции WebRTC с ИИ – а сам плейбук служит указателем, подсказывающим, какой из них открыть и в каком порядке.
Где здесь Фора Софт
Мы разрабатываем продукты для конференцсвязи, в которых реализованы эти ИИ-функции – видеоплатформы для встреч, приложения телемедицины, онлайн-обучение и инструменты для продажных звонков. Поэтому регулярно применяем этот плейбук с клиентами. Если функции нужны только как дополнение к встречам клиента, мы помогаем выбрать подходящий инструмент и уровень интеграции. А если они должны быть встроены в продукт – например, заметка визита телездоровья, сгенерированная прямо на платформе, живые субтитры, автоматически раздаваемые каждому студенту на вебинаре, или резюме продаж, отображаемое на собственной панели клиента, – мы реализуем их на real-time-конвейере WebRTC, обычно с использованием LiveKit-агента в роли «тихого участника». Это обеспечивает нативный захват данных в приложении, а не через внешний бот, при этом согласие пользователей и прозрачность раскрытия информации закладываются уже с первого спринта. Эти четыре вопроса из плейбука – те же самые, что мы обсуждаем на скоуп-звонках, когда клиент решает: купить готовое решение или развивать собственную способность.
Ключевые выводы
- Функции ИИ в конференцсвязях решают четыре задачи: очистить, понять, сохранить, помочь – у каждой свой срок выполнения.
- Ключевой выбор – где реализована каждая функция: на устройстве, медиасервере или в облаке.
- ИИ-ноутейкер и ассистент встреч можно приобрести, подключить через бота или разработать нативно.
- Только нативная реализация позволяет хранить транскрипты, резюме и данные внутри вашего продукта.
- Накапливайте миллисекунды до запуска кода: именно суммарная задержка определяет, будет ли функция ощущаться живой.
- Видимый бот – не повод для согласия; действуют законы о согласии сторон, GDPR и статья 50 EU AI Act.