Claude Code, Manus AI, Operator, Perplexity Comet и Apple Intelligence – computer-use агенты

Автор: Николай СапуновОбновлено: август 202640 мин чтения
Содержание статьи +

TL;DR

Агент для работы с компьютером – это ИИ, который взаимодействует с программами так же, как человек: смотрит на экран, решает, куда кликнуть или что ввести, выполняет действие, снова смотрит – и повторяет цикл, пока задача не будет выполнена. Пять продуктов задают тон в 2026 году: Claude Code пишет и коммитит код по описанию на естественном языке; Operator от OpenAI (теперь интегрирован в режим агента ChatGPT) управляет браузером, доводя задачи до конца; Manus AI самостоятельно выполняет длинные многошаговые задания; Comet от Perplexity – это браузер, который берёт на себя рутину; а Apple Intelligence внедряет упрощённую версию той же идеи прямо в ваш телефон.

Этот урок объясняет, что делает каждый из них, как устроен реальный цикл «посмотреть – решить – сделать», где агенты действительно полезны, а где пока ошибаются, и – что большинство статей упускают – как команде видеопродукта использовать их для ускорения разработки и встраивания в собственный продукт.

К концу вы сможете объяснить коллеге, чем каждый из этих агентов занимается, и определите, где какой из них уместен в вашем roadmap, не переплачивая за демонстрацию, которая не выдерживает контакта с реальными пользователями.

Почему это важно

«Computer-use агент» за 2026 год прошёл путь от исследовательского курьёза до строки в планёрке и теперь фигурирует в пяти разных продуктах, выполняющих схожие, но не идентичные задачи. Если вы работаете над видео-продуктом – будь то инструмент для конференций, OTT-платформа, дашборд видеонаблюдения или телемедицинское приложение – вам задают два вопроса, которые звучат одинаково, но имеют разный смысл.

Первый: «Должны ли наши разработчики использовать Claude Code или Cursor, чтобы быстрее писать код?» Второй: «Нужен ли в нашем продукте агент, который будет управлять интерфейсом от имени пользователя?»

Это принципиально разные решения с различной стоимостью и рисками. Их смешение – самый быстрый путь к провалу квартала.

Этот урок адресован продакт-менеджеру, основателю или техлиду, который должен принять решение по обоим вопросам, не имея опыта в машинном обучении. Он опирается на урок про закрытые frontier-модели и урок про агентный и генеративный ИИ. Если термин «vision-language модель» вам незнаком, сначала прочитайте урок про video-VLM.

Что такое «computer-use агент» на самом деле

Начнём с простого определения – маркетинг его запутал. Computer-Use агент – это программа на основе ИИ, которая работает с другими программами так же, как человек: смотрит на экран, двигает курсор, кликает и печатает, – а не подключается к ним через заранее предусмотренные специальные интерфейсы. Главная особенность: она управляет визуальным интерфейсом – теми же кнопками и меню, что видит пользователь, – а не через специальный «чёрный ход», созданный для неё заранее.

Бытовая аналогия – новый стажёр в первый рабочий день. Вы не перестраиваете свою бухгалтерскую систему под него: вы садите его за компьютер, показываете экран, и он сам разбирается, куда кликать. Он смотрит, действует, снова смотрит, что получилось, и продолжает, пока задача не будет выполнена. Агент для работы с компьютером действует по тем же принципам. Именно это и отличает его от старой автоматизации, для которой требовался программист, чтобы заранее соединить каждую систему с каждой.

Это важно, потому что у большинства программ в мире нет удобного «чёрного хода». Ваш сайт бронирования, внутренний дашборд, старая система медкарт – всё это создано для работы с человеческими глазами и руками. Агент, способный видеть экран и управлять им, в принципе может работать с любой из них, и при этом не требуется создавать специальную интеграцию. Именно эта универсальность и составляет главное обещание. Подвох, к которому мы вернёмся с цифрами, в том, что «в принципе» и «надёжно» в 2026 году всё ещё далеки друг от друга.

Ещё одно понятие, которое определим перед использованием. На протяжении всего урока «мозг» этих агентов – это vision-language модель, искусственный интеллект, обученный на изображениях и тексте, благодаря чему он может проанализировать скриншот и описать его словами. Подробно семейство таких моделей мы рассмотрели в уроке про video-VLM; здесь достаточно краткого определения: vision-language модель – это система, способная посмотреть на изображение экрана, понять, что на нём изображено, и предложить, что делать дальше.

Цикл, который питает всех

Любой агент, использующий компьютер, независимо от марки, выполняет один и тот же цикл из четырёх шагов. Понять этот цикл – самое полезное, что можно вынести из этого урока: увидев его, вы сможете объяснить, почему агенты работают медленно, почему стоят так дорого и почему иногда зависают.

Первый шаг – наблюдение. Агент делает скриншот текущего экрана – картинку, такую, какую увидел бы человек. Второй шаг – рассуждение. Этот скриншот вместе с поставленной целью («забронируй самый дешёвый рейс в Берлин на следующий вторник») поступает в vision-language модель, которая решает, что делать дальше: «вижу поле поиска; нужно кликнуть и ввести пункт назначения». Третий шаг – действие. Агент выполняет одно конкретное действие – перемещает курсор к нужным координатам, кликает, вводит нужные символы, нажимает Enter. Четвёртый шаг – снова наблюдение: он делает новый скриншот, чтобы увидеть, что изменилось, и цикл повторяется. Посмотреть, подумать, сделать, снова посмотреть – раз за разом, по одному маленькому действию, пока цель не будет достигнута или агент не сдастся.

Рисунок 1. Цикл «наблюдение – рассуждение – действие – наблюдение». Каждый продукт в этом уроке его выполняет; различия – в том, каким экраном он управляет, какая модель рассуждает и сколько автономии вы ему даёте.

Поле делят два подхода к устройству агентов. Одни выполняют весь цикл внутри одной модели – скриншот поступает на вход, а на выходе получается следующее действие, без выделения отдельных компонентов. Исследователи называют их end-to-end агентами. Другие разбивают цикл на стадии, за которые отвечают разные компоненты: одна часть распознаёт на экране кнопки и поля ввода, другая определяет, что с ними делать. Это – composed агенты. Вам не нужно запоминать, какой продукт к какой категории относится; важно понимать, что у обоих подходов одна и та же трудная нерешённая задача. И у неё есть имя.

Почему «кликнуть в нужный пиксель» – это незаметное узкое место

Шаг, на котором агент переводит команду «кликни кнопку Submit» в точные экранные координаты, называется GUI grounding – привязка абстрактного намерения к конкретным пикселям интерфейса. Звучит тривиально, но это не так. Человек бросает взгляд на экран – и кнопка Submit просто вот она; модель же должна по плоской картинке предсказать точные координаты x и y на экранах, которых она никогда не видела, с кнопками любого размера, темы и языка. Промахнись чуть-чуть – и агент кликнет в пустоту или по неправильному элементу, и вся задача сходит с рельсов. Бóльшая часть видимого прогресса агентов в использовании компьютера между 2024 и 2026 годами была связана именно с улучшением grounding – чтобы клик попадал туда, куда нужно. Когда в демонстрации агент уверенно делает что-то не то, причина обычно – ошибка в grounding.

Два семейства – и почему вы на самом деле задаёте два вопроса

Пять продуктов из заголовка этого урока не являются прямыми конкурентами. Они чётко делятся на два семейства, что напрямую отвечает на два вопроса, заданные в начале урока. Мы называем их Track A и Track B – те же два трека, которые проходят через весь курс.

Агенты Track B помогают создавать продукт. Они работают с инструментами разработчика – редактором кода, терминалом, браузером, – чтобы ускорить разработку программного обеспечения. Claude Code – яркий пример: вы описываете новую функцию, а он пишет код сразу в нескольких файлах, запускает тесты и фиксирует изменения. Для команды видеоагент Track B сокращает путь от идеи «нам нужно переключение adaptive bitrate» до готового рабочего кода. Он никогда не взаимодействует с конечным пользователем – он работает с клавиатурами ваших инженеров.

Агенты Track A работают внутри продукта, от имени пользователя. Operator, Manus, Comet и Siri в составе Apple Intelligence делают задачи за конечного пользователя – бронируют, ищут, заполняют формы, управляют приложениями. Если вы встраиваете такой агент или строите похожий, пользователь делегирует рутину, и агент её выполняет. Профиль риска совсем другой: ошибка Track B – это плохой коммит, который инженер ловит на ревью; ошибка Track A – это агент, который забронировал не тот рейс на реальную карту реального пользователя.

Рисунок 2. Пять продуктов – это не одна гонка. Инструменты Track B ускоряют процесс создания продукта; агенты Track A действуют от имени пользователя внутри продукта. Эти решения независимы.

С циклом и двумя семействами в руках – вот каждый продукт простыми словами.

Claude Code – агент, который пишет ваш код

Claude Code от Anthropic – это агентная система для работы с кодом: вы описываете обычными словами, что хотите построить, протестировать или исправить, – и она выполняет всю работу в рамках вашего проекта. Слово агентный стоит пояснить, потому что именно в этом заключается ключевое отличие. Обычный инструмент автодополнения подсказывает следующую строку, пока разработчик печатает – это автокомплит. Claude Code работает на уровне всего проекта: он анализирует весь код, чтобы понять, как файлы связаны между собой, планирует подход, пишет и редактирует код сразу в нескольких файлах, запускает тесты, читает сообщения об ошибках, если они возникают, исправляет их и фиксирует результат. Разработчик формулирует задачу и проверяет итоговый результат перед отправкой в продакшн; всё, что происходит между этими этапами, система делает самостоятельно.

Причина, по которой этот продукт удерживает внимание на протяжении всего урока, – его масштаб. Anthropic заявляет, что большая часть кода внутри самой компании теперь пишется с помощью Claude Code, а инженеры всё больше сосредоточены на архитектуре и управлении несколькими агентами параллельно, а не на написании каждой строки вручную. Опубликованные корпоративные результаты настолько конкретны, что могут служить основой для планирования, а не просто маркетинговым ходом. Stripe внедрил Claude Code для 1370 инженеров; одна команда завершила миграцию 10 000 строк кода с Scala на Java за четыре дня – работу, которую изначально оценивали в десять инженеро-недель. Wiz перенёс библиотеку объёмом 50 000 строк с Python на Go примерно за двадцать часов активной работы вместо двух-трёх месяцев ручного труда. Rakuten сократил среднее время доставки новой функции с двадцати четырёх рабочих дней до пяти. Ramp снизил время расследования инцидентов на восемьдесят процентов и позволил неинженерам запрашивать данные из хранилищ простым языком, минуя написание SQL-запросов.

Заметьте, что у этих цифр есть общее: самые большие выигрыши – на крупной, механической, хорошо описанной работе – миграции, рефакторинги, повторяющиеся правки, – где цель ясна, а тесты показывают, когда работа завершена. Это как раз тот тип задач, с которым Track B-агент справляется на раз-два. И это же объясняет, почему фраза «бóльшая часть нашего кода написана ИИ» не означает «мы уволили инженеров»: в каждом из этих случаев человек отвечает за архитектуру и утверждает коммит.

Для видео-команды самый показательный сигнал 2026 года – это то, что вендоры инструментов начинают идти навстречу агентам. NVIDIA DeepStream 9 – платформа, на которой многие команды строят пайплайны видеоаналитики, – представила интеграцию, позволяющую разработчику описать многокамерный пайплайн простыми словами («приём RTSP-потоков с камер, обработка каждого кадра через vision-language модель, отправка сводок в нашу шину сообщений») и получить от Claude Code или его главного конкурента Cursor готовый к продакшену код пайплайна с мониторингом и обвязкой для деплоя. Это Track B, применённый непосредственно к видеоинженерии, а не общий демо-код.

Пара слов о конкуренте – вы обязательно услышите его в той же фразе. Cursor – это редактор кода с аналогичными агентными возможностями, и к началу 2026 года он, по сообщениям, достиг двух миллиардов долларов годовой выручки, став самым широко распространённым среди профессиональных разработчиков. Многие команды используют оба инструмента: Cursor – как повседневный редактор, а Claude Code – для крупных задач «отдай целиком» и ревью pull request’ов. Ключевой запрос, который привёл вас сюда – claude code – с большим отрывом опережает остальные четыре продукта этого урока, и это наглядно показывает, насколько центральным стал этот инструмент в современной разработке ПО, включая видео-софт.

OpenAI Operator – агент, управляющий браузером, ставший режимом «agent mode»

Operator стал первым потребительским агентом для работы с компьютером от OpenAI, запущенным в начале 2025 года. За ним стояла модель, которую OpenAI назвала Computer-Using Agent (CUA) – тот самый цикл «наблюдение – рассуждение – действие» из Рисунка 1, ориентированный на веб-браузер. Вы задавали цель, он делал скриншоты экрана, определял, куда кликнуть и что ввести, и выполнял веб-задачи: заказы продуктов, заполнение форм, бронирование.

Важный факт 2026 года – отдельного продукта как такового больше не существует. 17 июля 2025 года OpenAI интегрировал Operator прямо в ChatGPT в виде «agent mode» – теперь эту функцию можно использовать, просто переключив ChatGPT в режим агента, без необходимости заходить на отдельный сайт Operator, который был закрыт. Если кто-то в команде скажет: «давайте оценим Operator», – на деле в 2026 году он откроет режим агента ChatGPT. Базовую модель CUA также обновили – она стала более настойчивой и точной в управлении браузером.

Опубликованные бенчмарки Operator – это та честная проверка реальностью, которая необходима всему сообществу, поэтому мы используем их как основу для раздела «насколько они на самом деле хороши» ниже. Исходный CUA набрал 87% на тесте веб-навигации WebVoyager и 58,1% на более сложном WebArena, но всего 38,1% на OSWorld – тесте полноценных десктоп-задач с работой с файлами, офисными приложениями и операционной системой. Запомните эти 38,1%: веб-задачи для таких агентов гораздо проще, чем полный контроль над десктопом, и именно этот разрыв – самое важное, что должен усвоить владелец продукта, прежде чем обещать пользователям агента, который «может всё на вашем компьютере».

Manus AI – агент, созданный для самостоятельной работы

Manus AI – самый автономный из пяти. В то время как Operator управляет браузером шаг за шагом, а Claude Code отправляет работу на ревью, Manus разработан так, чтобы выполнить одну инструкцию и довести длинную многошаговую задачу до конца практически без вмешательства – самостоятельно планируя шаги, выходя в интернет, написав и запустив собственный код, проанализировав данные и вернув готовый результат. Попросите его исследовать рынок и подготовить отчёт – обещание в том, что вы вернётесь позже к готовому отчёту, а не к диалогу.

Manus – ещё и яркий пример того, насколько быстро развивается этот рынок и сколько в нём денег. Проект начался как продукт компании, стоявшей за браузерным ассистентом Monica, привлёк раунд финансирования на 75 миллионов долларов во главе с американским венчурным фондом Benchmark в 2025 году, переехал штаб-квартиру в Сингапур, а в декабре 2025 года был приобретён Meta в сделке, оценённой более чем в два миллиарда долларов – по некоторым данным, до трёх миллиардов. Для владельца продукта главный урок здесь не в сплетнях, а в том, что крупнейшие технологические компании консолидируют слой автономных агентов в этом стеке, и любой поставщик, на котором вы сегодня строите свою инфраструктуру, уже в следующем квартале может оказаться под контролем другого игрока.

С Manus есть острая практическая оговорка, которую должен знать каждый, кто отвечает за бюджет. Он работает по кредитам, и одна сложная задача может «съесть» непредсказуемое их количество – ведь заранее невозможно понять, сколько циклов «наблюдение–рассуждение–действие» потребуется. Опубликованные планы на 2026 год начинаются с бесплатного тарифа с небольшим дневным лимитом и заканчиваются платными – около двадцати и сорока долларов в месяц с месячными пулами кредитов. Опасность не в цене, указанной на витрине, а в том, что при выполнении долгой автономной задачи без ограничения по стоимости кредиты могут быстро исчерпаться, и предсказать это будет крайне трудно. Это автономная-агентная версия проблемы, которую мы уже рассматривали в уроке про стоимость ИИ: чем больше автономии вы даёте, тем сложнее предсказать итоговую сумму.

Perplexity Comet – браузер, который упрощает вашу рутину

Comet от компании ИИ-поиска Perplexity – это веб-браузер со встроенным агентом. Он построен на Chromium – той же открытой платформе, что и Google Chrome, поэтому выглядит и работает как обычный браузер, но внутри работает ИИ-ассистент Perplexity. Вы можете задать вопрос любой странице, попросить пересказать прочитанное – а также поручить рутину: «разбери эти вкладки», «сравни эти три товара и скажи, какой дешевле», «заполни эту форму», «забронируй за меня». Агент выполняет цикл «наблюдение – рассуждение – действие» на тех веб-страницах, которые вы и так просматриваете.

История Comet в 2026 году – это история о масштабе. Он стартовал в 2025 году как закрытая бета по приглашениям и стал доступен глобально в 2026-м на iPhone, Android, Mac и Windows. Perplexity представил версию для Android как первый агентный ИИ-браузер, созданный специально для смартфонов, а агентный браузер Comet был интегрирован в встроенный браузер на устройствах Samsung. Продукт важен для этого урока не потому, что вы захотите встроить сам Comet, а потому, что он демонстрирует направление развития: браузер – самую используемую программу на планете – перестраивают вокруг агента, который действует, а не просто показывает страницы. Если ваш видеопродукт находится во вкладке браузера, ваши пользователи всё чаще будут приходить туда с агентом, сидящим рядом.

Apple Intelligence – ограниченный агент в миллиарде карманов

Apple Intelligence – белая ворона, и поучительно. Это системный ИИ-слой Apple, встроенный в iPhone, iPad и Mac, и его проектные решения – почти зеркало Manus. Там, где Manus максимизирует автономию, Apple максимизирует приватность и контроль над охватом. Многое работает на устройстве – ИИ-работа идёт на самом телефоне, так что личным данным не нужно его покидать, – а более тяжёлые запросы уходят в то, что Apple называет Private Cloud Compute, серверы на собственных чипах Apple, спроектированные так, что даже Apple не видит данные. Когда запрос превышает то, что справляются собственные модели Apple, он может с разрешения пользователя передаться в ChatGPT от OpenAI.

Агентная часть работает внутри Siri и фреймворка для разработчиков App Intents. App Intents – это механизм, с помощью которого приложение сообщает системе, что оно умеет: «это приложение может начать запись», «это приложение может добавить заметку» – чтобы Siri могла объединять эти действия между приложениями от имени пользователя. Версия Siri 2026 года также обладает осведомлённостью об экране: она видит, что отображается на дисплее, и действует исходя из этого, так что можно сказать: «сделай это фото ярче, а потом добавь его в мою рабочую заметку» – и она перенесёт результат из одного приложения в другое. Важно, что действия ограничены: приложение объявляет только те возможности, которые оно предоставляет, а не позволяет агенту свободно кликать где попало. Для разработчика видеоприложения это самый прямой из пяти подходов: если вы выпускаете приложение для iPhone, объявление нужных App Intents – это способ сделать ваши функции доступными для Siri с защитой, встроенной в фреймворк, а не добавленной отдельно.

Пять в одном взгляде

Поставьте пятёрку рядом – и семейства займут свои места. Ниже приведена таблица, которую стоит сохранить.

ПродуктСемействоЧем управляетАвтономияЛучше всегоНа что смотреть
Claude CodeTrack B (строить)Ваш код, терминал, инструменты разработкиВысокая, человек одобряет коммитыМиграции, рефакторинги, многофайловые фичи, починка CIНужны тесты + ревью; не замена решений по архитектуре
OpenAI Operator (ChatGPT agent mode)Track A (использовать)Веб-браузерХод за ходом, спрашивает подтверждениеВеб-задачи – формы, заказ, бронированиеОтдельный продукт закрыт, ушёл в ChatGPT; слаб в полных десктоп-задачах
Manus AITrack A (использовать)Браузер + свой кодовый sandboxОчень высокая, длинные задачи без присмотраEnd-to-end исследование и результат из одного промптаНепредсказуемая цена по кредитам; вендор теперь у Meta
Perplexity CometTrack A (использовать)Веб-страницы в своём браузереАссистент + агент на страницеРутина в браузере, пересказы, вкладки/формыЭто целый браузер; агент рядом, а не внутри вашего приложения
Apple IntelligenceTrack A (использовать)Приложения на телефоне, через App IntentsОграниченная, приватность, на устройствеМеж-аппные действия, которые вы объявили; голос SiriВозможности ограничены объявленными intents; только платформы Apple

Таблица 1. Пять computer-use агентов 2026 года, отсортированы по семействам. Track B ускоряет разработку; Track A действует за пользователя. Автономия и риск растут вместе по мере спуска по строкам Track A.

Насколько они на самом деле хороши? Проверка реальностью на OSWorld

Вот раздел, который отделяет реалистичный план развития от разочаровывающего запуска. Самое честное публичное измерение общей способности агента управлять компьютером – бенчмарк OSWorld: 369 реальных задач для рабочего стола, связанных с управлением файлами, веб-серфингом, офисными приложениями и операциями операционной системы, где агент либо успешно выполняет задачу, либо не справляется. Поскольку OSWorld оценивает общий контроль над рабочим столом, а не простые действия в браузере, его результаты – наиболее близкое к объективному ответу на вопрос: «Может ли этот агент управлять моим компьютером?»

Цифра, которая всё определяет, – уровень человека: около 72%. Именно так: на этих реалистичных задачах обычные люди справляются лишь примерно в 72% случаев, потому что задачи действительно сложные. Поэтому, оценивая агента, сравнивайте его результат с 72%, а не с 100%.

Теперь арифметика, которую каждый владелец продукта должен хотя бы раз пройти вслух. Допустим, ваш сценарий включает пять шагов агента, и каждый из них, в лучшем случае, успешен в 90% случаев. Вероятность того, что вся цепочка пройдёт успешно, – не 90%, а 0,9, умноженное само на себя пять раз:

успех от начала до конца = 0,90 × 0,90 × 0,90 × 0,90 × 0,90
                         = 0,90 ^ 5
                         ≈ 0,59

Итак, пятишаговая задача с сильным агентом «90% за шаг» завершается чисто меньше чем в 60% случаев. Растяните до десяти шагов – и вы у одного к трём. Это накопление и есть настоящая причина, почему агенты, ослепляющие в двушаговом демо, разочаровывают в десятишаговом продакшене, – и поэтому всё поле одержимо надёжностью на шаг и удержанием человека в петле на важных шагах.

На этом фоне прогресс 2026 года реален, но его следует читать с осторожностью. Сильнейшие универсальные агенты наконец достигли и немного превысили человеческий уровень на OSWorld в конце 2025 и в 2026 году – ведущие frontier-модели от Anthropic и OpenAI на проверенном наборе бенчмарка показывают результаты в пределах низких–средних 70-х, а исследовательский агент стал первым, кто преодолел порог ~72% в декабре 2025 года. Задачи, ограниченные только вебом, демонстрируют значительно лучшие показатели: у Operator результат на WebVoyager составил 87%, тогда как на полном десктопном OSWorld – всего 38,1%. Вывод для вашего roadmap: агент, сфокусированный на узкой, веб-ориентированной задаче, в 2026 году может быть действительно готов к продакшену; агент, заявленный как «он может всё на вашем компьютере», разочарует, поскольку общий контроль над десктопом по-прежнему держится на уровне обычной человеческой надёжности, а она недостаточна для работы без присмотра.

Рисунок 3. Проверка реальностью. Веб-задачи почти решены; общий контроль десктопа лишь дотягивает до уровня обычного человека; а сцепление шагов умножает долю отказов. Планируйте с учётом планки в 72%.

Сколько стоят эти агенты и почему счёт трудно предсказать

Стоимость использования агента напрямую следует из цикла, показанного на Рисунке 1, и, разобравшись в этом, перестаёшь считать ценообразование загадкой. В каждом цикле две тарифицируемые части: скриншот, на который смотрит агент, тарифицируется как входная картинка – модели нужно обработать изображение. Решение, которое она принимает, тарифицируется как выходной текст – модель генерирует действие. Таким образом, каждый цикл «наблюдение-рассуждение-действие» стоит одного скриншота на вход и одного решения на выход – на той модели, которую вы выбрали.

Проговорим наглядный пример вслух. Допустим, один цикл обходится примерно в один-два цента на модели среднего уровня – реалистичная цифра для 2026 года, если речь идёт о скриншоте и коротком решении. Тогда задача, на выполнение которой уходит сорок циклов, будет стоить:

стоимость одной задачи = 40 циклов × ~$0,015 за цикл
                       ≈ $0,60 за выполненную задачу

Шестьдесят центов – это действительно дёшево, если речь идёт об одной задаче. Но ловушка в том, что заранее невозможно предсказать, уйдёт ли на выполнение сорок циклов или четыреста – всё зависит от того, сколько раз агент будет ошибаться, возвращаться, повторяться и снова пробовать. Задача, которая сошла с рельсов и зациклилась, может незаметно увеличить счёт в разы по сравнению с первоначальной оценкой. Именно поэтому кредитная модель Manus кажется непредсказуемой, и именно поэтому каждому агенту с первого дня развертывания нужны две жёсткие границы: лимит на количество циклов на задачу и лимит на общий расход. Проблема не в самой экономике – проблема в безграничной экономике. Подробный разбор такой стоимости на действие вы найдёте в уроке про стоимость ИИ.

Частая ошибка – воспринимать агента как скрипт

Самое дорогое заблуждение в этой теме – воспринимать computer-use агента как традиционный скрипт автоматизации. Скрипт каждый раз выполняет одну и ту же последовательность действий: при одинаковых входных данных он даёт одинаковый результат, и если он сработал один раз, он будет работать всегда, пока сайт не изменится. Computer-use агент вероятностен – на каждом цикле он принимает решение на основе скриншота и может по-разному реагировать на один и тот же экран. Команды, которые включают агента в критический путь, исходя из предположения, что он детерминирован – «агент всегда точно кликнет по Confirm», – потом вынуждены объяснять клиенту, почему агент подтвердил не тот заказ.

Лекарство – не в отказе от агентов, а в проектировании с учётом их природы. Держите под контролем человека, который одобряет любое действие, связанное с расходованием денег, отправкой сообщений или удалением данных – так же, как Claude Code запрашивает подтверждение перед коммитом, а Operator – перед покупкой. Устанавливайте лимиты на количество циклов и стоимость операций, как указано выше. Отдавайте предпочтение максимально узкому функционалу: агент, ограниченный одной веб-задачей, гораздо надёжнее того, которому дали команду «делай что угодно». И логируйте каждое действие, чтобы, когда агент совершит что-то неожиданное – а это обязательно произойдёт, – вы могли увидеть скриншот, который он анализировал, и решение, которое принял. Зрелые продукты 2026 года уже внедряют такие рамки: Claude Code по умолчанию запрашивает разрешение перед изменением файлов, App Intents от Apple предоставляют только объявленные возможности, а Operator делает паузу для подтверждения на ключевых шагах. Когда вы разрабатываете или приобретаете агента, наличие этих ограничений – первое, что нужно проверять, ещё до любых бенчмарков.

Строить, покупать или пропустить – для вашего видеопродукта

Вернёмся к двум ключевым вопросам, на которые вам действительно нужно ответить. Для Track B – строить быстрее – решение на 2026 год простое, и ответ, как правило, «использовать». Claude Code и Cursor уже достаточно зрелые, стоимость лицензии на одного пользователя значительно ниже зарплаты инженера, а преимущества при миграциях, рефакторинге и работе с многофайловыми фичами хорошо задокументированы и существенны. Дисциплина остаётся прежней – как в любой хорошей инженерной практике: поддерживайте тесты в зелёном состоянии, проверяйте каждый коммит и следите, чтобы человек контролировал архитектуру. Никакого экзотического риска нет в том, чтобы запустить кодового агента на собственный проект при условии ревью; ошибки из-за плохой подсказки выявляются до выхода в продакшн.

Для Track A – агент внутри вашего продукта – задача сложнее, и честное решение – «сузить охват или пока отказаться». Если автоматизация касается узкой веб-задачи – например, выгрузить данные с портала или заполнить повторяющуюся форму – агент может быть готов к продакшену уже сегодня, при соблюдении указанных рамок. Если же речь идёт о широком контроле рабочего стола, проверка надёжности на OSWorld говорит: стоит подождать или ограничить функционал, пока стабильность не достигнет нужного уровня.

И прежде чем создавать универсального агента, подумайте: не будет ли надёжнее и дешевле ограниченная интеграция? Если у системы, которую вы хотите управлять, есть нормальный «чёрный ход» – официальный программный интерфейс – использовать его напрямую будет быстрее, проще и гораздо надёжнее, чем заставлять агента «читать» скриншоты. Суперсила агента – управлять программами, у которых «чёрного хода» нет; тратить её на софт, где он есть, – самая распространённая ошибка переусложнения в этой категории.

Где здесь Фора Софт

Мы стоим по обе стороны этого разделения каждую неделю. В рамках Track B ИИ-агенты на основе кода уже стали неотъемлемой частью наших систем видеоконференций, OTT, стриминга, видеонаблюдения, телемедицины и e-learning – мы разрабатываем их с 2005 года. Они ускоряют миграции и автоматизируют рутинные этапы сборки, в то время как наши инженеры отвечают за архитектуру и код-ревью. Что касается Track A, мы помогаем командам взвешенно решить: где ИИ-агент действительно уместен в видео-продукте, а где ограниченная интеграция – более безопасный и экономичный вариант. Мы также определяем, как встроить рамки человеческого одобрения, лимиты по стоимости и логирование ещё до того, как решение дойдёт до реального пользователя. Услуга, которую мы предоставляем чаще всего, – не просто «добавить агента», а «честно скажите нам: должен ли это быть агент вообще, и если да – сделайте это безопасным». Именно это суждение, применённое к видео-вертикалям, которые мы хорошо знаем, и составляет нашу ценность.

Ключевые выводы

  • Агент по работе с компьютером управляет программами, как человек: смотрит на экран и нажимает, не используя специальных «чёрных ходов».
  • Каждый из них проходит один цикл: смотри скриншот, рассуждай, действуй, снова смотри – и повторяй.
  • Агенты Track B (Claude Code, Cursor) быстрее создают ваш продукт; агенты Track A (Operator, Manus, Comet, Siri) выполняют действия от имени пользователя.
  • Оценивайте способность по сравнению с уровнем человека на уровне ~72% в OSWorld; веб-задачи решаются легко, а общий контроль над рабочим столом – нет.
  • Многошаговые цепочки накапливают ошибки: пять шагов по 90% успешности завершаются без сбоев менее чем в 60% случаев.
  • Перед тем как агент начнёт работать с реальным пользователем, внедрите одобрение человека, лимит на количество циклов и лимит на расход ресурсов.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.