ИИ-ассистент встреч на LiveKit в реальном времени – архитектура и цены

Автор: Николай СапуновОбновлено: август 202619 мин чтения
Содержание статьи +

Кратко

LiveKit – это open-source софт, который обеспечивает передачу живого аудио и видео между людьми, а его фреймворк Agents позволяет подключить к звонку ИИ-участника, который слушает, расшифровывает речь, делает краткое содержание и при необходимости вступает в разговор. ИИ-ассистент для встреч работает так: в комнату запускается небольшая программа, которая подключается к звонку как обычный участник, получает аудио всех собеседников и выполняет цикл: speech-to-text → языковая модель → text-to-speech. LiveKit Cloud тарифицирует использование по слоям – бесплатный уровень Build, уровень Ship за $50 в месяц и Scale за $500 в месяц – с отдельной оплатой минут подключения, минут работы ИИ-агента и трафика, тогда как open-source сервер остаётся бесплатным для самостийного размещения. Эта статья объясняет архитектуру простыми словами, приводит реальные цены 2026 года с расчётами и показывает, когда стоит использовать LiveKit, а когда лучше выбрать готовый сервис.

Почему это важно

Если вы продакт-менеджер, основатель или техлид и задумываетесь о добавлении в продукт ИИ-ноутейкера, копилота для встреч или голосового агента, первое имя, которое вы услышите, – это LiveKit. На нём работает голосовой режим ChatGPT от OpenAI и четверть звонков 911 в США, а в начале 2026 года компания привлекла инвестиции по оценке в миллиард долларов. Эта популярность делает LiveKit простым в интеграции, но и повышает риск ошибочной оценки его возможностей. Архитектура определяет, что может делать ассистент, а цены – окупится ли функция при масштабировании. Эта статья объясняет и то, и другое – без предположения, что вы когда-либо писали код на WebRTC, – чтобы вы приняли решение «сделать или купить» до вложений, а не после.

Сначала: что такое LiveKit

LiveKit – это три разных компонента под одним названием, и путаница между ними – самая частая ошибка. Когда их чётко разграничить, всё остальное становится понятным.

Первое – медиасервер с открытым кодом. Медиасервер – это программа, находящаяся в центре группового звонка и раздающая аудио и видео каждого участника всем остальным. Сервер LiveKit бесплатен, опубликован под разрешительной лицензией Apache 2.0, написан на языке Go и может быть запущен самостоятельно – на одной машине, в Docker или в кластере. Технически это Selective Forwarding Unit, или SFU – маршрутизатор, который получает поток от каждого участника один раз и пересылает копии остальным, не смешивая их. Почему SFU – стандартная архитектура для групповых звонков, мы подробно разбираем в сравнении video SDK и WebRTC AI; здесь важно лишь одно – это бесплатное открытое ядро.

Второе – фреймворк Agents. Это отдельный open-source инструментарий, тоже бесплатный, который позволяет написать программу – «агента», – входящего в комнату LiveKit и ведущего себя как участник, только это софт. Фреймворк берёт на себя сложную real-time-инженерию, чтобы ваш код мог сосредоточиться только на том, что агенту слышать, обдумывать и говорить. Именно эта часть превращает обычный звонок в звонок с ИИ внутри.

Третье – LiveKit Cloud. Это платная хостинговая версия сервера, которую предоставляет сама компания, чтобы вам не пришлось заниматься инфраструктурой. Вы пишете тот же код, но глобальную сеть медиасерверов поддерживает LiveKit и берёт плату за использование. Cloud – это опция: сервер и фреймворк Agents полностью открыты и работают на вашей инфраструктуре без лицензионных платежей.

Всё это построено на WebRTC. WebRTC – сокращение от Web Real-Time Communication – это открытый стандарт, позволяющий браузерам и приложениям обмениваться аудио, видео и данными с минимальной задержкой. Он достиг финальной стадии стандартизации, когда World Wide Web Consortium – организация, отвечающая за стандартизацию веб-технологий, – опубликовал WebRTC как полную Recommendation 13 марта 2025 года. Все продукты, описанные в этой статье, используют этот общий язык; различаются лишь те его возможности, которые каждый из них предоставляет пользователю.

LiveKit в 2026: компания и новости

Поскольку «livekit news» – одно из самых частых запросов перед внедрением, вот актуальная картина с датой, чтобы вы могли оценить её свежесть.

LiveKit был основан в 2021 году Рассом д’Са, одним из первых инженеров Twitter, и Дэвидом Чжао, бывшим директором по инженерии в Motorola. Проект стартовал как open-source-инициатива на фоне пандемийного роста видеозвонков; штаб-квартира компании находится в Сан-Хосе, Калифорния. Бесплатный сервер достиг версии 1.0 в мае 2022 года, после чего вокруг него начал развиваться бизнес.

Главная новость – финансирование и охват. 22 января 2026 года LiveKit объявил о закрытии раунда Series C на $100 млн по оценке в $1 млрд. Раунд возглавил Index Ventures при участии прежних инвесторов – Altimeter, Hanabi Capital и Redpoint Ventures. Это произошло примерно через десять месяцев после раунда Series B на $45 млн, проведённого в апреле 2025 года.

Клиентская база привлекает инвесторов: на LiveKit работает голосовой режим ChatGPT от OpenAI, а среди других пользователей – xAI, Salesforce, Tesla, Spotify, Meta, Microsoft и Character AI. По данным самой компании, её технология лежит в основе примерно четверти экстренных вызовов 911 в США.

На стороне open source репозиторий ядра набрал около 19 000 звёзд на GitHub, а фреймворк Agents – около 10 800. При этом платформа заявляет о более чем 100 000 разработчиках, использующих её инструменты.

Практический вывод для покупателя: LiveKit больше не является небольшим проектом – это инфраструктурный слой по умолчанию, на котором уже работает значительная часть индустрии голосового ИИ. Это снижает риски при построении решений на его основе и повышает ценность понимания его устройства.

Что такое «ИИ-ассистент встреч»

ИИ-ассистент встреч – это программа, которая подключается к живому звонку, чтобы выполнять полезные задачи: записывать всё сказанное, определять, кто что говорил, составлять краткое резюме, выписывать задачи, отвечать на вопросы, а в некоторых случаях – даже участвовать в разговоре. Его также называют ИИ-ноутейкером, если основная функция – расшифровка и составление отчёта, или копилотом встреч, если он может активно действовать во время звонка.

Важна простая модель в голове. Ассистент – не просто фича, прикрученная к экрану одного человека, а полноценный участник процесса. Когда вы планируете звонок и «ноутейкер подключается», технически происходит следующее: программа присоединяется к той же комнате, что и люди, слушает общее аудио и выдаёт результат – в виде текста, записи или речи. Написали вы эту программу сами или арендовали – вот и вопрос «build или buy», которым заканчивается статья. В любом случае форма остаётся одной: участник, сделанный из кода.

Эта рамка объясняет и силу, и границы. Поскольку ассистент – полноценный участник, он воспринимает каждого собеседника с той же точностью, что и человек. Но раз он участник, он использует те же ресурсы подключения, что и человек, и – как покажет раздел о ценах – вы платите за его время в комнате так же, как за время всех остальных.

Как ИИ-агент входит во встречу: архитектура диспатча

Первый настоящий архитектурный вопрос – как программа попадает именно в этот звонок. В LiveKit это называется диспатч (dispatch) – процесс назначения агента в комнату. Один проход по нему снимает большую часть загадки.

Начнём с деталей. Комната – это один звонок, именованное пространство, к которому подключаются участники. Участник – любой, кто подключён к комнате, будь то человек или агент. Сам агент работает внутри агент-сервера – долгоживущего процесса, который LiveKit называет AgentServer; он простаивает в ожидании работы и запускает нового агента для каждого звонка, в котором возникает необходимость. Важно: агент каждого звонка работает в отдельном процессе операционной системы, поэтому сбой одного агента не повлияет на другие на той же машине.

Когда звонку требуется ассистент, агент-сервер запускает задание (job). Точка входа этого задания – функция в вашем коде под названием entrypoint; воспринимайте её как парадную дверь, через которую фреймворк передаёт управление вашему коду – почти так же, как веб-сервер передаёт запрос обработчику. Внутри entrypoint ваш код подключается к комнате, подписывается на аудиодорожки участников (дорожка, или track, – это один поток медиа, например, микрофон одного человека) и начинает работу. Задание продолжает выполняться, пока все участники не покинут комнату или пока вы его не остановите.

Способов запустить диспатч три, и разница между ними важна для продуктов с встречами. Явный (explicit) диспатч – рекомендуемый вариант по умолчанию: ваш бэкенд просит LiveKit отправить агента в конкретную комнату и может передать дополнительные данные – например, какую встречу представляет эта комната и кто ведущий – в виде метаданных. Диспатч по токену встраивается в токен доступа, который пользователь и так предоставляет при входе: вы указываете агента в токене, и когда первый участник создаёт комнату, агент автоматически подключается. Подвох в том, что диспатч по токену срабатывает только при первом создании комнаты; если комната уже существует, инструкция игнорируется. Автоматический диспатч отправляет агента в каждую новую комнату без исключений – LiveKit не рекомендует этот способ для большинства продуктов, так как он тратит ресурсы и не передаёт метаданные.

LiveKit утверждает, что данный путь диспатча рассчитан на масштаб – обычно он поддерживает сотни тысяч новых подключений в секунду при времени установки агента в комнату менее ~150 миллисекунд. Для видеосервисов это означает, что ассистент появляется в комнате практически мгновенно после начала звонка, а не с заметной задержкой.

Рисунок 1. ИИ-ассистент встреч – это программа, диспатченная в звонок как дополнительный участник. Она подписывается на аудио всех, крутит речевой конвейер и публикует результат обратно в комнату.

Внутри агента: речевой конвейер

Как только агент находится в комнате и слышит аудио, возникает второй архитектурный вопрос – что с этим аудио происходит дальше. Фреймворк Agents предлагает три внутренних механизма, и выбор между ними является самым важным решением, определяющим, как будет восприниматься ассистент и каковы будут затраты на его работу.

Устройство по умолчанию – это конвейер STT-LLM-TTS, представляющий собой трёхэтапную передачу данных. Аудиосигнал последовательно проходит все этапы. Сначала speech-to-text (STT), или автоматическое распознавание речи (ASR), преобразует произнесённую речь в текст – подробнее о продакшен-решениях мы рассказываем в глубоком обзоре потокового ASR. Затем большая языковая модель (LLM) – тип ИИ, способный читать текст и генерировать на его основе ответ – формирует реплику. И, наконец, text-to-speech (TTS) превращает этот текстовый ответ обратно в речь – эту тему мы разбираем в сравнении потокового TTS. Чёткие границы между этапами позволяют заменять одну модель на другую, не затрагивая остальные. Собственная рекомендация LiveKit: для большинства продакшен-агентов трёхэтапный конвейер – оптимальный выбор по умолчанию.

Второе устройство – это модель в реальном времени, иногда называемая speech-to-speech. Здесь одна модель, например, realtime-модель от OpenAI или Gemini Live от Google, принимает аудио на вход и выдаёт аудио на выходе напрямую, минуя промежуточные текстовые этапы. Такой подход ощущается наиболее естественным и отзывчивым, поскольку нет задержек при передаче данных между этапами. Подробно эту категорию мы рассматриваем в статье о speech-to-speech-моделях. У неё есть одна ловушка для продуктов для встреч – о ней рассказано в выноске ниже.

Третье устройство – half-cascade: модель в реальном времени распознаёт речь и генерирует текстовый ответ, а отдельный этап text-to-speech озвучивает его. Такой подход сочетает высокую точность распознавания речи с гибким контролем над этапом синтеза речи.

Вокруг всех трёх устройств расположены два меньших компонента. Детекция голосовой активности, или VAD, – это лёгкая модель (LiveKit предоставляет одну, например, от Silero), которая определяет, говорит ли человек в данный момент, и не позволяет агенту тратить ресурсы на обработку тишины. А детекция конца реплики (turn detection) – трансформерная модель, оценивающая, действительно ли говорящий завершил мысль, а не просто сделал паузу, – предотвращает перебивания со стороны ассистента. Оба компонента необходимы, чтобы взаимодействие ощущалось естественным. Заявленная цель LiveKit – поддерживать сквозную задержку ответа ниже одной секунды, что является порогом, при котором устный диалог воспринимается как естественный; полный анализ бюджета задержки приведён в нашей статье о задержке до 100 мс.

Рисунок 2. Три способа построить «мозг» агента. Трёхэтапный конвейер обеспечивает максимальный контроль и даёт живые транскрипты; realtime-модель воспринимается как наиболее естественная, но не генерирует промежуточный текст; half-cascade – это компромисс между двумя подходами.
«Частая ловушка: команды, создающие ноутейкер, стремятся использовать модель реального времени для преобразования речи в речь, потому что она кажется самой передовой, но потом обнаруживают, что она не выдаёт промежуточные транскрипты – текущий текст по словам, на котором строится функция субтитров или конспектирования. Для ассистента, чья основная задача – именно транскрипция, такой выбор становится ошибкой по умолчанию. Либо используйте конвейер STT-LLM-TTS, где текст появляется на первом этапе, либо подключите отдельный STT-плагин параллельно с моделью реального времени, чтобы слова всё же фиксировались. Выбирать архитектуру по тому, насколько впечатляюще она звучит, а не по реальным потребностям функции – самая дорогостоящая ошибка на раннем этапе.»

Как именно строить ассистента для встреч

Общий конвейер – для агентов, ведущих диалог. У ассистента задача уже и полезнее, а строительные блоки LiveKit напрямую на неё накладываются.

Ядро – расшифровка всех, а не одного говорящего. Во фреймворке есть паттерн многопользовательского транскрайбера – агент, который выдаёт транскрипты от всех участников комнаты сразу, и это ровно хребет ноутейкера. Поскольку аудио каждого участника приходит отдельной дорожкой, ассистент расшифровывает их независимо и может приписывать реплики нужному человеку; объединение этого с распознаванием говорящих – задача диаризации диктора. Сами логи задания фиксируют транскрипт пользователя и данные детекции реплик в структурированном JSON, так что запись у вас есть без лишней обвязки.

Большинству ассистентов на встречах лучше слушать, чем говорить. Фреймворк поддерживает режим «только слушать» и текстовый режим, в котором тот же код агента работает, не озвучивая ни слова – просто обрабатывает аудио и выдаёт текст. Это делает ассистента ненавязчивым и, как покажет цена, более дешёвым, поскольку полностью исключается этап text-to-speech. А когда нужно, чтобы ассистент отвечал вслух – например, копилота, к которому можно обратиться посреди звонка: «Что мы решили по бюджету?» – можно включить этап TTS или использовать в паре с отдельным транскрайбером realtime-модель.

Запись – отдельная задача со своим инструментом. LiveKit Egress – компонент, который записывает или транслирует комнату в реальном времени и может экспортировать дорожку каждого участника по отдельности. Ноутейкер, которому нужно сохранить аудио или видео для последующего использования – например, для соблюдения нормативных требований или анализа встречи, – использует Egress, а не пытается перехватывать медиа внутри агента. Разделение записи и живой расшифровки на разные задачи делает архитектуру чище и соответствует модели ценообразования.

Ещё два элемента дополняют настоящего ассистента. Вызов инструментов (tool calling) позволяет языковой модели выполнять действия – создавать записи в календаре, добавлять задачи, искать информацию – по мере необходимости в ходе диалога, включая использование Model Context Protocol, который стандартизирует доступ моделей к внешним инструментам. А если продукту нужно помечать недопустимый контент в ходе встречи, это место – проход модерации в реальном времени, а не встраивание в ноутейкер.

Цены LiveKit в 2026: как устроена модель

Теперь вторая часть решения. Цены на LiveKit Cloud на первый взгляд кажутся запутанными, потому что учитываются несколько компонентов отдельно, но в основе – несколько ключевых принципов. Полезнее разобраться в логике подсчёта, чем запоминать цифры: они меняются, всё ниже взято со страницы цен LiveKit от 2 июня 2026 года и требует проверки перед покупкой.

Опубликовано четыре тарифных плана. Build – бесплатный, $0 в месяц, карта не требуется. Ship – от $50 в месяц. Scale – от $500 в месяц. Enterprise – по индивидуальной цене. Каждый план включает определённую квоту по каждому измеряемому ресурсу, а за превышение квоты взимается дополнительная плата.

Для ассистента важны три счётчика. Первый – минуты WebRTC: время подключения каждого участника (человека или агента) в минуту. В тарифе Build включено 5 000 таких минут; в Ship – 150 000, далее по $0,0005 за минуту; в Scale – 1,5 млн, далее по $0,0004 за минуту.

Второй счётчик – минуты сессии агента: время, которое ИИ-агент проводит в звонках, считается отдельно от времени подключения. В Build включено 1 000 минут агента; в Ship – 5 000, далее по $0,01 за минуту; в Scale – 50 000, далее по $0,01 за минуту.

Третий – исходящий трафик: объём передаваемой участникам полосы в гигабайтах. В Build включено 50 ГБ; в Ship – 250 ГБ, далее по $0,12 за ГБ; в Scale – 3 ТБ, далее по $0,10 за ГБ.

Несколько лимитов определяют, какой план вам действительно нужен. Одновременные сессии агентов – то есть сколько звонков может обслуживать ассистент одновременно – ограничены: 5 на Build, 20 на Ship и до 600 на Scale. Максимальное количество одновременных подключений – 100, 1 000 и 5 000 в зависимости от уровня. Таким образом, выбор плана чаще всего определяется числом одновременных звонков, а не общим количеством минут.

И ещё – стоимость самих ИИ-моделей. Этапы преобразования речи в текст, работы языковой модели и синтеза речи не бесплатны: их обеспечивают провайдеры вроде Deepgram, OpenAI или Cartesia. LiveKit может выступать брокером через функцию Inference и включает небольшую квоту кредитов в каждый тарифный план (около $2,50 на Build, $5 на Ship, $50 на Scale), а далее вы платите по поминутным тарифам моделей. Можно также подключить собственные аккаунты провайдеров. В любом случае, стоимость моделей – это отдельная статья расходов помимо счётчиков подключений и агентов.

Рисунок 3. Уровни LiveKit Cloud 2026 рядом. Выбирайте уровень сначала по потолку одновременности, затем проверяйте, покрывают ли включённые минуты ваш объём до начала перерасхода.

Разбор на цифрах: сколько на самом деле стоит ИИ-ноутейкер

Числа делают модель конкретной. Допустим, ваш продукт – это ИИ-ноутейкер, подключающийся к встречам из средней по размеру клиентской базы. Возьмём 2 000 встреч в месяц, каждая длится 45 минут, в каждой участвуют пять человек и один агент.

Начнём с минут подключения, ведь каждый участник – включая агента – оплачивается за время пребывания в комнате. Сначала посчитаем, кто присутствует на встрече:

5 человек + 1 агент = 6 участников на встречу

Теперь суммарное время подключения за месяц:

2 000 встреч
× 45 минут
× 6 участников
= 540 000 участнико-минут WebRTC / месяц

Дальше – собственное время сессии агента, которое рассчитывается отдельно и только для него.

2 000 встреч
× 45 минут
× 1 агент
= 90 000 минут сессии агента / месяц

На тарифе Scale обе величины укладываются в включённые квоты: 540 000 минут подключения меньше включённых 1,5 млн, а 90 000 минут работы агента превышают включённые 50 000, поэтому 40 000 минут тарифицируются по $0,01:

40 000 минут агента сверх квоты
× $0,01
= $400
+ $500 месячная база
= $900 / месяц до стоимости моделей и трафика

Стоимость моделей – то, о чём часто забывают, и она обычно доминирует. Ноутейкеру, которому нужно «только слушать», нужен speech-to-text, но не text-to-speech, поэтому возьмём типичный потоковый тариф STT – около $0,006 за минуту аудио. Агент расшифровывает речь с 45-минутной встречи за один звонок:

2 000 встреч
× 45 минут
× $0,006
= $540 / месяц на speech-to-text

Сложим – и ноутбук обходится примерно в $1 440 в месяц плюс трафик, а стоимость урока рассчитывается пропорционально, а не итогово. Минуты подключения внутри квоты Scale оказались фактически бесплатными; рост счёта обусловлен перерасходом агента и поминутной стоимостью модели. Поэтому ассистент «только слушать» без text-to-speech намного дешевле говорящего копилота: типичный тариф TTS в $0,03 за минуту сам по себе добавил бы около $2 700 в месяц, почти утроив общую стоимость. Эту юнит-экономику по функциям мы разбираем в реальной стоимости ИИ в видеопродуктах.

LiveKit публикует поминутную разбивку стоимости для нового типа агента – голосового агента для телефонии, – и делает прозрачными все составляющие: около $0,01 за сессию агента, $0,01 за использование телефонии, $0,0077 за языковую модель, $0,0058 за распознавание речи (speech-to-text), $0,03 за синтез речи (text-to-speech) и $0,01 за мониторинг, итого примерно $0,0735 за минуту. Ваши цифры будут отличаться в зависимости от моделей и того, говорит ли агент, но структура – стопка из отдельно тарифицируемых слоёв – остаётся неизменной.

Рисунок 4. Куда уходят деньги в минуту. Text-to-speech – самый тяжёлый слой; ноутбук «только слушать», отбросив его, стоит примерно вдвое дешевле говорящего копилота.

Строить на LiveKit или купить готовый сервис?

LiveKit – это фреймворк, а не готовый продукт. В этом и заключается его сила, и именно поэтому стоит повременить с выбором. Честное решение – три варианта, а не два.

Первый вариант – использовать LiveKit Cloud. Вы разрабатываете агента, LiveKit обеспечивает инфраструктуру, а вы получаете полный контроль над поведением ассистента: что он распознаёт, как суммирует, какие модели применяет и какие действия может выполнять – при этом платите только за фактическое использование. Такой подход подходит командам, для которых интеллект встреч является ключевым продуктом, или тем, кто хочет интегрировать ассистента в уже существующую контролируемую систему.

Второй вариант – развертывание собственного open-source-сервера и фреймворка Agents. Программное обеспечение свободно распространяется под лицензией Apache 2.0, поэтому вы платите только за серверы и трафик, а ваши медиафайлы остаются в инфраструктуре, которую вы контролируете – это особенно важно для здравоохранения, обороны или при строгих требованиях к локализации данных. Стоимость здесь операционная: вы сами отвечаете за эксплуатацию, масштабирование и защиту медиасерверов. Такой подход подходит командам с собственными инфраструктурными мощностями и высокими требованиями к конфиденциальности.

Третий вариант – купить готовый сервис бота для встреч и вовсе не заниматься разработкой. Сервисы вроде Recall.ai предлагают уже готового бота, который подключается к Zoom, Google Meet или Teams и возвращает транскрипции и записи через API по цене около $0,50 за час записи – без необходимости заниматься медиаинженерией с вашей стороны. Фреймворки вроде Pipecat от Daily или хостинговые платформы голосовых агентов, такие как Vapi и Retell AI, находятся где-то посередине между «сделай сам» в LiveKit и полностью готовым решением. Обычный компромисс: чем более готовый продукт вы покупаете, тем дешевле старт и тем меньше возможностей у вас остаётся для кастомизации.

Правило решения то же, что управляет любым «build против buy» в real-time-видео. Если ассистент – товар широкого потребления («дайте пользователям транскрипт»), купить готового бота почти всегда быстрее и дешевле для запуска. Если ассистент и есть продукт или должен работать внутри медиа, которым вы владеете, строить на LiveKit (Cloud или self-host) даёт потолок для дифференциации. Решите, что из этого у вас, до сравнения цен, ведь самый дешёвый путь, который не может сделать нужное продукту, – самый дорогой выбор.

ВариантЧто получаетеФорма цены, 2026Когда лучше
LiveKit CloudПолный контроль, хостингПо счётчикам: WebRTC + мин. агента + трафик + тарифы моделейАссистент – ваш продукт
LiveKit self-hostПолный контроль, свои серверыБесплатный софт (Apache 2.0) + своя инфраструктураСтрогая приватность / место данных
Recall.ai (бот-SaaS)Готовый бот в Zoom/Meet/Teams~$0,50 / час записиТранскрипт – рядовая функция
Pipecat / Vapi / RetellФреймворки и платформы голосовых агентовПлата платформы + тарифы моделейГолосовые агенты, средний контроль

Где здесь Фора Софт

Мы разрабатываем продукты для живого видео с 2005 года – видеоконференции, e-learning, телемедицину и инструменты для совместной работы в реальном времени, – и вопрос об ассистенте встреч теперь возникает почти в каждом проекте, связанном с конференциями и телемедициной, который мы анализируем. На старте мы использовали управляемые платформы, когда ключевым было быстрое внедрение, и открытые фреймворки вроде LiveKit, когда ценность продукта заключалась в ИИ-функционале внутри звонка – например, в агентах, присоединяющихся как участники, чтобы расшифровывать и резюмировать разговор. В телемедицине этот подход превращается в ИИ-скрайба, автоматически составляющего заметку о приёме; в e-learning – в конспект урока; в конференциях – в ноутейкера, которого пользователи уже давно ждут. Наша задача – подобрать подходящую архитектуру и ценовую модель под нужный тип ассистента, чтобы «только слушающий» ноутейкер не строился и не оплачивался как полноценный говорящий копилот.

Главное

  • LiveKit – это open-source WebRTC-сервер, фреймворк для агентов и опциональный платный Cloud.
  • ИИ-ассистент встреч – программа, подключённая к звонку как дополнительный участник.
  • Конвейер выбирают в зависимости от задач: трёхэтапный – для транскриптов, real-time – для естественной речи.
  • Realtime speech-to-speech-модели пропускают промежуточные транскрипты – плохой вариант по умолчанию для ноутейкера.
  • Cloud учитывает отдельно минуты подключения, минуты работы агента и трафик, плюс стоимость моделей.
  • Text-to-speech – самый затратный компонент; ноутейкер «только слушать» обходится значительно дешевле.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.