Содержание статьи +
- Кратко
- Почему это важно
- Анатомия, общая для любого meeting-бота
- Otter – собственный движок речи, теперь в суде
- Fireflies – ассистент сверху и проблема голосового отпечатка
- Fathom – «сначала бесплатно» как инженерная и ростовая стратегия
- Supernormal – тот, что умеет обходиться без бота
- Четыре продукта рядом
- Как встроить это в свой продукт
- Слой согласия – это инженерное требование, а не юридическая запоздалость
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Кратко
Otter, Fireflies, Fathom и Supernormal на страницах с фичами выглядят почти одинаково, но под капотом делают разные инженерные ставки: как бот подключается к звонку, как он определяет, кто говорит, и как превращает звук в резюме. Бот, который вы видите в списке участников, – это обычно настоящий веб-браузер на сервере без экрана: он открывает ссылку на встречу и подключается по той же технологии реального времени, что и ваш браузер, а затем передаёт аудио в сервис распознавания. Трое из четырёх отличаются в основном бизнес-моделью и слоем над этой общей механикой; Supernormal – исключение, потому что позволяет вообще обойтись без бота и записывать звук прямо на вашем устройстве. Этот урок разбирает каждый продукт по частям, показывает, что на самом деле делает его бот, и описывает три конкретных способа внедрить такую же возможность в свой продукт – арендовать API захвата, использовать новый нативный стриминговый API платформы или расширить реал-тайм-пайплайн, которым вы уже владеете.
Почему это важно
Если вы выбираете инструмент для заметок по встречам, маркетинговые страницы не скажут вам, что вы на самом деле покупаете, потому что у всех продуктов одинаковый набор функций – резюме, пункты действий, синхронизация с CRM, чат по итогам встречи. Это важное решение – архитектурное, и его не увидеть в прайс-листе. А если вы разрабатываете софт – платформу продаж, телемедицинское приложение или рекрутинговый продукт, – перед вами стоит более насущный вопрос: продолжать платить сторонним сервисам за каждого пользователя или встроить транскрипцию прямо в свой продукт. У этого выбора есть чёткая цена и инженерная реализация, как только вы поймёте, как устроены боты.
Этот урок – инженерное продолжение нашего обзора ландшафта транскрипции встреч: в обзорной части мы разобрали рынок на четыре паттерна, а здесь вскрываем четыре самых популярных типа ботов и пути их сборки. Текст написан так, чтобы продакт-лид прошёл каждый шаг, а старший инженер при этом доверял каждому утверждению.
Анатомия, общая для любого meeting-бота
Прежде чем разбирать четыре продукта, полезно взглянуть на общий конвейер, который они все запускают: различия становятся понятными только на фоне общей структуры. Meeting-бот последовательно выполняет пять действий, и их названия помогают сделать урок более конкретным.
Сначала он входит во встречу. Большинство ботов делают это как человек: программа открывает ссылку на встречу в веб-браузере и жмёт «присоединиться». Подвох в том, что у браузера нет экрана, мыши и человека – это так называемый headless-браузер, настоящий браузерный движок на сервере, которым управляет код, а не руки. Для встречи это выглядит как ещё один гость, выключивший камеру; поэтому один и тот же бот заходит в Zoom, Google Meet и Microsoft Teams без отдельной доработки под каждый.
Во-вторых, он захватывает звук. Оказавшись в звонке, бот получает аудиопоток с микрофонов всех участников через WebRTC – технологию реального времени для передачи аудио и видео, которую браузеры используют для видеозвонков и стандартизировал W3C. Полезная деталь: WebRTC помечает звук каждого участника уникальным идентификатором потока, поэтому хорошо написанный бот может различать, кто именно говорит – Мария или Сэм, – а не получать одну общую смешанную дорожку. Именно это разделение по дикторам делает возможным точное определение говорящих на последующих этапах.
В-третьих, он запускает распознавание речи – процесс, превращающий звуковые сигналы в текстовый поток. Технический термин – automatic speech recognition, или ASR. Сегодня это уже стандартный продукт: под большинством решений на рынке лежат одни и те же движки, поэтому ни один из этих четырёх вариантов не выделяется по чистой точности. Подробно о самих движках – в уроке про потоковый ASR.
В-четвёртых, он добавляет понимание – два дополнительных слоя поверх текста. Первый – диаризация, громоздкое слово, означающее разметку «кто что сказал». Второй – резюме: большая языковая модель анализирует весь транскрипт и составляет краткое изложение вместе со списком задач. Когда на странице продукта говорят «ИИ-резюме встречи», имеют в виду именно этот слой.
В-пятых, он доставляет результат – отправляет транскрипт, резюме и задачи в те инструменты, которыми уже пользуется ваша команда: CRM вроде Salesforce или HubSpot, документооборот вроде Notion, мессенджеры вроде Slack. А для «строящихся» продуктов ещё и отправляет webhook – автоматическое сообщение, которое говорит вашему софту: «встреча закончилась, вот данные».
Помните о пяти стадиях. Каждый продукт ниже – это разные наборы решений для одних и тех же пяти шагов.
Otter – собственный движок речи, теперь в суде
Otter – гигант по объёму поискового спроса и самый вертикально интегрированный из четырёх. В то время как большинство разработчиков ноутеков арендуют распознавание речи у сторонних провайдеров, Otter создал собственный ASR-движок, обучил его на обширном корпусе аудиоданных, собранных за годы, и интегрировал с собственным слоем обработки естественного языка для создания сводок и ассистента «OtterPilot». На практике это означает, что Otter контролирует большую часть пятиступенчатого конвейера, чем конкуренты: захват, распознавание и понимание – в основном его собственный код, а не тонкая обёртка вокруг чужого API.
Механически Otter следует стандартному паттерну бота: автозаходит на встречи из подключённого календаря в Zoom, Google Meet и Microsoft Teams, расшифровывает в реальном времени с живыми метками говорящих и таймкодами, захватывает показанные слайды и выдаёт резюме после звонка. Его режим реального времени – настоящая сила: транскрипт прокручивается, пока люди говорят, а не появляется только после звонка.
Цены Otter в 2026 году представлены в четырёх уровнях. Basic – бесплатный тариф с 300 минутами расшифровки в месяц и лимитом 90 минут на одну беседу. Pro стоит 16,99 доллара в месяц или 8,33 доллара при оплате за год вперёд и увеличивает лимит до 1200 минут в месяц. Business – 20 долларов с пользователя в месяц при годовой оплате (или 30 долларов помесячно), снимает лимит на продолжительность встречи, позволяет одновременно расшифровывать до трёх встреч и добавляет командные рабочие пространства и административный контроль. Enterprise – по индивидуальной цене, и это единственный тариф, дающий доступ к API, единому входу (SSO), сертификации безопасности SOC 2 и OtterPilot for Sales. Заметим закономерность: ключевая возможность для разработчиков – доступ к API – доступна только на самом дорогом уровне.
Otter ведёт этот урок не только из-за масштаба. В 2026 году он стал юридическим прецедентом для всей категории. Коллективный иск Brewer v. Otter.ai (Северный округ Калифорнии, подан в августе 2025) утверждает, что бот Otter подключается к встречам и записывает участников без их согласия, а также создаёт голосовые отпечатки с помощью технологии распознавания говорящего без разрешения. Четыре связанных иска были объединены в октябре 2025 года (консолидированное дело In re Otter.AI Privacy Litigation, 5:25-cv-06911, под председательством судьи Eumi K. Lee), и претензии основаны на федеральном законе о прослушке (ECPA), калифорнийском Законе о вторжении в частную жизнь (Invasion of Privacy Act) и иллинойсском Законе о защите биометрической информации (Biometric Information Privacy Act). Как бы ни завершился процесс, он уже изменил подход компаний к оценке каждого бота из этого урока – поэтому раздел о согласии ниже не является сноской, а представляет собой ключевую инженерную задачу.
Fireflies – ассистент сверху и проблема голосового отпечатка
Fireflies делает противоположную Otter ставку на интеграцию: вместо того чтобы разрабатывать собственный движок распознавания речи, компания сосредотачивает инженерные усилия на слоях над транскрипцией – например, на разговорном ассистенте по имени Fred (вы можете спрашивать о своих встречах через «AskFred»), анализе разговоров (таких как доли времени речи) и глубокой автоматизации бизнес-процессов в CRM. Его бот, отображающийся в списке участников как «Fireflies.ai Notetaker», подключается к тем же платформам и работает по стандартному паттерну headless-браузера.
Две инженерные особенности делают Fireflies уникальным. Первая – модель ИИ-кредитов. На платных тарифах бесплатны простая расшифровка и письма с пересказом, но более ценные ИИ-функции – запросы AskFred, создание кастомных резюме, автозаполнение CRM, инструменты Sales Assist и Voice Agent – расходуют пул кредитов. У тарифов Free и Pro – одноразовый пул около 20 кредитов, у Business – 30, у Enterprise – 50, при этом доступны дополнительные наборы. Покупателю это важно, потому что заголовочное «безлимитно» относится только к расшифровке, а не к ИИ-функциям, ради которых люди и выбирают этот инструмент. Для строителя продукта это полезный урок по ценообразованию: дешёвый, уже ставший товаром шаг (расшифровка) включён в пакет, а дорогой этап (инференс LLM) – тарифицируется отдельно.
Вторая деталь – та, что сейчас тянет за собой иск. Функция Fireflies «Speaker Recognition», которая и даёт чистые метки по дикторам, работает, строя голосовой отпечаток – математический слепок голоса человека. В декабре 2025 года иск Cruz v. Fireflies.AI был подан в Иллинойсе (3:25-cv-03399, Северный округ Иллинойса) от имени человека, который никогда не был клиентом Fireflies: она вошла на встречу, где хост включил бота, и иск утверждает, что бот сгенерировал её голосовой отпечаток без согласия, нарушив иллинойсский закон о биометрической приватности. Механизм, на который нацелен иск, – диаризация через голосовой отпечаток – это тот же механизм, на который опирается почти каждый продукт из этого урока. Это и есть самый важный инженерный вывод всей статьи, и мы вернёмся к нему ниже.
Цены Fireflies в 2026 году: Free ($0, с 800 минутами хранения и пулом из 20 кредитов), Pro по $10 за пользователя в месяц при годовой оплате ($18 помесячно) с безлимитной расшифровкой и 8 000 минут хранения на место, Business по $19 с синхронизацией CRM и аналитикой разговоров и Enterprise по $39. Интеграции с CRM, которые нужны большинству команд, – Salesforce, HubSpot – начинаются с уровня Pro.
Fathom – «сначала бесплатно» как инженерная и ростовая стратегия
Определяющий выбор Fathom – его бизнес-модель, и именно она определяет подход к инженерии. В то время как Otter и Fireflies тарифицируют минуты на бесплатных тарифах, Fathom предлагает безлимитную запись и хранение навсегда, ограничивая вместо этого возможности искусственного интеллекта: бесплатный план включает лишь пять ИИ-резюме в месяц. Запись и транскрипция бесплатны – платите вы за понимание.
Это сознательная инверсия структуры затрат. Захват и хранение данных становятся всё дешевле; а вот ИИ-резюме стоят реальных денег за звонок, поскольку каждый запрос – это инференс к большой модели. Отдавая дешёвую часть бесплатно и взимая плату за дорогую, Fathom привлекает пользователей почти с нулевой предельной стоимостью и монетизирует только ценное действие. Подписка Premium стоит $19 в месяц (около $15 при годовой оплате) и включает безлимитные резюме, задачи и письма-фоллоуапы; Team Edition добавляет административный контроль, общие клипы и аналитику – от $29 в месяц (около $19 при годовой оплате), выше – Team Edition Pro; уровень Business (около $25 за пользователя) добавляет синхронизацию с CRM.
Функционально Fathom подключается к Zoom, Google Meet и Teams как бот: записывает и расшифровывает встречи, а затем предлагает чат по их содержанию в стиле ChatGPT и более пятнадцати шаблонов резюме под конкретные бизнес-процессы – включая фреймворки продаж, такие как BANT и Sandler. Его интеграции работают со Slack, Salesforce, HubSpot, Notion и Asana. Для разработчика Fathom – самый яркий пример урока о том, что транскрипт – это товар, а резюме – это продукт, – именно этот аспект мы разбираем в уроке про реальную стоимость ИИ в видеопродуктах.
Supernormal – тот, что умеет обходиться без бота
Supernormal – архитектурное исключение и «золотой» ключ этого урока: высокий интент, низкая конкуренция. Его отличительная инженерная особенность – гибкость захвата: вместо того чтобы внедрять бота в каждый звонок, платформа предлагает три режима – обычный meeting-бот, расширение для Chrome и десктопное приложение без бота, которое записывает звук с компьютера, не появляясь в списке участников. Последний режим – это паттерн «без бота», который мы разбираем в обзорном уроке. Наличие всех трёх вариантов позволяет клиенту выбирать уровень видимости под конкретную встречу, а не под продукт в целом.
На уровне понимания Supernormal использует гибридную систему: фронтирную модель (GPT-4o) и собственные проприетарные модели, чтобы генерировать резюме под брендом «The Gist». Это типичный паттерн 2026 года: мощная универсальная модель обеспечивает плавность работы, а более лёгкие внутренние модели выполняют дешёвую и повторяющуюся классификацию. В 2026 году Supernormal также сместило фокус с «записывалки встреч» на «ИИ-агента для агентств», используя транскрипты как контекст для реальной работы – создания презентаций, таблиц и исследовательских отчётов на основе обсуждений. Дополнительно появилась функция Memory, сохраняющая контекст между встречами с одними и теми же людьми.
Его цены – самые доступные из четырёх: Free покрывает 15 встреч в месяц, Starter – $16 в месяц, Pro – $25 в месяц, Enterprise – по запросу (примерно $40 за пользователя), со скидкой около 20% при годовой оплате. По комплаенсу он силён для своего размера – сертификат SOC 2, соответствие HIPAA с доступным Business Associate Agreement и согласованность с GDPR, – что делает его достоверным выбором для здравоохранения и других регулируемых сфер, где более крупные имена требуют корпоративного контракта, чтобы дать то же самое.
Четыре продукта рядом
Таблица ниже – данные на 2026 год. Анализируйте её по архитектуре и модели, а не по галочкам функций, которые у всех четырёх почти одинаковы. Перед принятием решения сверяйтесь с актуальными цифрами – эта категория часто переоценивается.
| Продукт | Спрос (KD) | Метод захвата | Ставка на движок речи | Сигнатурный слой | Платный вход (год) | Заметный инженерный факт |
|---|---|---|---|---|---|---|
| Otter | otter ai 141K (KD 67) | Облачный бот, реал-тайм | Свой ASR | OtterPilot, живой транскрипт | $8.33/польз./мес (Pro) | API только на Enterprise; главный ответчик в иске о прослушке 2026 |
| Fireflies | fireflies ai 21K (KD 49) | Облачный бот | Сторонний ASR + свои слои | AskFred + учёт ИИ-кредитов | $10/польз./мес (Pro) | Диаризация по голосовому отпечатку в центре иллинойсского иска BIPA |
| Fathom | fathom ai 11K (KD 42) | Облачный бот | Сторонний ASR | Беспл. безлимитная запись, платные резюме | ~$15/польз./мес (Premium) | Инвертирует модель затрат: отдаёт захват, берёт за ИИ |
| Supernormal | supernormal ai 200 (KD 9) | Бот или без бота или расширение | GPT-4o + проприетарный гибрид | Агентский вывод + Memory | $16/мес (Starter) | Единственный из четырёх, кто умеет захват без бота |
Бросаются в глаза две закономерности. Первая: поисковый спрос и инженерная глубина не связаны – у Otter в 700 раз больше поискового объёма, чем у Supernormal, но именно Supernormal обладает гибкостью захвата и самой низкой сложностью ранжирования. Вторая: реальные различия проявляются на двух концах конвейера – на этапе захвата данных (стадия один) и на этапе упаковки и тарификации результата (стадия пять) – ровно так, как предсказывал Рисунок 1.
Как встроить это в свой продукт
Вот вопрос, который реально окупается. Если вы выпускаете софт, где происходят встречи – инструмент продаж, телемедицинскую платформу, рекрутинговый продукт, – вы можете отказаться от оплаты за каждое подключение и встроить транскрипцию прямо в своё приложение. Существует три инженерных подхода, и все они предсказуемо обменивают контроль на усилия.
Путь первый – арендовать API захвата. Самый быстрый способ – вообще не создавать бота. Инфраструктурный провайдер вроде Recall.ai предоставляет один API, который запускает meeting-бота (или desktop-записывалку без бота) в Zoom, Teams, Google Meet, Webex и других сервисах и передаёт вашему продукту звук, видео и транскрипт через webhook. Вам не нужно поддерживать парк headless-браузеров, разбираться с особенностями каждой платформы и отслеживать изменения в их интерфейсах. На 2026 год Recall.ai берёт $0.50 за час записи – как для API-бота, так и для desktop-SDK (цена снижена с $0.70 ранее в году) – плюс $0.15 за час встроенной расшифровки. Интеграция с календарём бесплатна, ежемесячная плата за платформу отсутствует.
Вот этот расчёт предметно. Допустим, пользователи вашего продукта суммарно проводят 8 000 часов записанных звонков в месяц. Захват: 8 000 × $0.50 = $4 000. Добавьте расшифровку: 8 000 × $0.15 = $1 200. Ваш месячный счёт за захват и расшифровку – $4 000 + $1 200 = $5 200, поверх чего вы добавляете стоимость своей модели резюме и хранения. Побьёт ли это инструменты «за место», полностью зависит от того, сколько мест представляют эти 8 000 часов, – а это и есть причина считать, а не гадать.
Путь второй – использовать нативный стриминговый API платформы. В 2026 году платформы для проведения встреч начали предлагать более чистую альтернативу ботам. Zoom Real-Time Media Streams (RTMS) теперь общедоступен: он передаёт живой звук, видео и транскрипт прямо в ваше приложение без добавления лишнего участника в звонок и с задержкой в миллисекунды. Google Meet Media API обеспечивает аналогичный нативный доступ к потокам в реальном времени через WebRTC. Подвох в том, что такие решения привязаны к платформе и требуют контроля: RTMS работает только в Zoom и активен лишь при включённой опции со стороны организации-хоста; Meet API доступен только для Google и пока находится в превью-режиме; а у Microsoft Teams нет прямого аналога – его реал-тайм-медиаплатформа пока поддерживает только media-ботов с собственным хостингом, написанных на C#/.NET. Так что нативный API – это вариант с минимальной задержкой и без бота для одной платформы, но вам всё равно понадобится запасной путь (обычно арендованный бот) для платформ, где такого API нет.
Путь третий – расширить реал-тайм-пайплайн, которым вы уже владеете. Если встреча и есть ваш продукт – конференц- или телемедицинское приложение, которое вы уже запускаете на WebRTC, – вам не нужен бот, заходящий снаружи, потому что ваш медиасервер уже участвует в звонке. Можно расшифровывать речь централизованно на сервере и раздавать субтитры всем (паттерн ASR на стороне SFU), запустить LiveKit-агента как молчаливого участника, который выдаёт тот же результат ноутейкера, что и предлагают эти продукты, или перенести распознавание прямо в браузер. У этого подхода нет платы за встречу и полный контроль над данными, но он применим только в том случае, если звонок полностью ваш.
Выбор между тремя – не про то, какой «лучше», а про то, где живёт встреча. Если ваши пользователи встречаются на платформах, которыми вы не владеете, – арендуете API бота (и при желании докладываете нативные API там, где они есть). Если встреча происходит внутри вашего приложения – расширяете свой пайплайн. Большинству продуктов, которым нужно широкое покрытие, разумно начать с аренды, а затем добавлять нативные API и свой пайплайн по мере того, как объём оправдывает инженерные затраты.
Слой согласия – это инженерное требование, а не юридическая запоздалость
Каждый из описанных путей сборки разделяет одно и то же обязательство, которое иски 2026 года превратили из «было бы неплохо» в «блокер релиза». Воспринимайте далее изложенное как инженерно-релевантный контекст, а не юридический совет – конкретику уточняйте у квалифицированного юриста в вашей юрисдикции.
Сталкиваются два факта. Первый: закон о записи разговоров в США различается по штатам – 39 штатов плюс округ Колумбия разрешают запись при согласии одной стороны (то есть если вы участвуете в разговоре, вы можете его записывать), но 11 штатов – включая Калифорнию, Иллинойс и Пенсильванию – требуют согласия всех участников. В соответствии с европейским GDPR для записи чьего-либо голоса необходимо законное основание и информированное согласие. Второй факт, который часто упускают из виду инженеры: функция диаризации, обеспечивающая точную идентификацию говорящих, работает за счёт создания голосового отпечатка, который всё чаще признаётся защищённым биометрическим идентификатором – именно на этой основе строятся иллинойсские иски против Otter и Fireflies. Функция, делающая транскрипт читаемым, одновременно создаёт и юридический риск.
«Частая ошибка: считать, что видимый бот – это согласие. Бот с именем «Notetaker» в списке участников сам по себе не является тем информированным согласием, которое требует закон – ни одна крупная юрисдикция не считает «они же видели» достаточным основанием для согласия. Режим захвата без бота тише, но не безопаснее: убирая видимого участника, вы теряете социальный сигнал, но при этом увеличиваете свою ответственность за раскрытие, а не уменьшаете её. Если вы реализуете любой из трёх описанных подходов, согласование нужно проектировать с самого первого спринта: раскрывайте использование ИИ до его активации, фиксируйте явное согласие (особенно в штатах с требованием согласия всех сторон и при работе с голосовыми отпечатками или диаризацией), предоставляйте участникам реальную возможность отказаться и ведите учёт сроков хранения и удаления данных. Статья 50 EU AI Act делает раскрытие до начала работы жёстким продуктовым требованием в ЕС. Это та же дисциплина раскрытия, которую мы разбираем в уроке про EU AI Act и инженерию раскрытия.»
Где здесь Фора Софт
Мы создаём видеопродукты, в которых реализованы функции транскрипции – конференц-платформы, телемедицинские приложения, инструменты для e-learning и системы видеонаблюдения. Поэтому регулярно сталкиваемся с инженерным выбором: «купить или построить». Если клиенту нужны лишь заметки к встречам, мы помогаем подобрать подходящий инструмент и аккуратно интегрировать его. А если транскрипция должна быть встроена в продукт – например, заметки по телемедицинскому приёму, генерируемые прямо на платформе, живые субтитры для всех участников вебинара, резюме продаж, отображаемое на дашборде клиента, – мы строим её на основе реал-тайм-пайплайна WebRTC. Это позволяет сделать захват аудио нативной частью приложения, а не внешним ботом, требующим согласия, раскрытия данных и графика удаления – всё это закладываем с самого первого спринта. Три пути реализации, которые мы выводим из этого опыта, – те же, что обсуждаем с клиентами, когда они решают: продолжать арендовать ноутейкер или взять контроль над возможностью в свои руки.
Главное
- Все четыре бота проходят пять стадий; они различаются тем, как подключаются и как тарифицируют результат.
- Otter использует собственный движок распознавания речи; Fireflies, Fathom и Supernormal полагаются на сторонние решения для транскрипции.
- Модель «бесплатная безлимитная запись» у Fathom означает: захват данных обходится дёшево, а генерация ИИ-резюме – реальная статья расходов.
- Supernormal – единственный из четырёх, кто поддерживает запись звонков без участия бота.
- Реализуйте запись тремя способами: арендуйте API захвата, используйте нативный стриминг платформы или интегрируйте в свой пайплайн.
- Диаризация создаёт голосовой отпечаток; этот биометрический этап станет центром юридических споров 2026 года, поэтому заранее предусмотрите согласие пользователей.