Конкуренция AI-агентов: переход от производительности моделей к корпоративным системам
Конкуренция AI-агентов смещает акцент с компьютерных навыков на операционные системы, которые можно безопасно внедрить в корпоративные процессы. Анализ показывает, что для реального выполнения задач необходимо учитывать не только производительность моделей, но и контекст компании, управление правами, восстановление после ошибок и системы верификации.
В статье, опубликованной Andreessen Horowitz 28 августа 2025 года, говорится, что агенты, использующие компьютеры, расширяют область автоматизации задач, непосредственно взаимодействуя с браузерами и рабочими столами. На корпоративном уровне важнее не универсальные модели, а проектирование контекста и надежности для конкретных компаний, а также оркестрация долгосрочных задач.
Агенты, использующие компьютеры, представляют собой AI-системы, которые распознают экран, используемый человеком, и выполняют действия, такие как клики, ввод данных и перемещение по экрану. В отличие от традиционной автоматизации процессов (RPA), они выбирают необходимые инструменты и обрабатывают несколько этапов после получения цели.
Применение таких агентов охватывает задачи, связанные с поиском документов, вводом данных в системы управления клиентами, уведомлениями в корпоративных мессенджерах и составлением отчетов, что требует взаимодействия с несколькими программами. В корпоративной среде задачи связаны с правами доступа, обработкой исключений, аудитом и процедурами одобрения, что делает автоматизацию всего процесса только на основе навыков управления экраном затруднительной.
Согласно официальной статье OSWorld, в 369 реальных компьютерных задачах уровень выполнения человеком составил 72,36%, в то время как успех лучших моделей на тот момент составил 12,24%. OSWorld — это бенчмарк, который измеряет способности работы с файлами, приложениями и веб-страницами в реальной операционной системе.
OpenAI сообщила, что компьютерный агент (Computer-Using Agent, CUA), представленный 23 января 2025 года, показал 38,1% в OSWorld, 58,1% в WebArena и 87% в WebVoyager. Эти цифры показывают, что модели, работающие с компьютерами, перешли от стадии исследования к стадии коммерциализации.
Тем не менее, даже при измерении одинаковых компьютерных навыков, результаты трудно сравнивать, если версии бенчмарка, конфигурация задач и условия выполнения различаются. Оригинальная статья, OSWorld-Verified и повторные оценки отдельных компаний применяют разные условия, поэтому необходимо раскрывать критерии оценки вместе с показателями производительности.
Причина, по которой трудно объяснить узкие места корпоративных AI-агентов только по баллам моделей, заключается в том, что даже при наличии мощной модели необходимо своевременно предоставлять необходимый контекст, проверять результаты выполнения и восстанавливать неудачные задачи, иначе надежная эксплуатация в производственной среде будет затруднена.
Microsoft в статье, опубликованной 2 июня 2026 года, отметила, что для компаний важны не только мощные модели или вычислительные ресурсы, но и системы для создания, развертывания, наблюдения и контроля агентов. Основными условиями для внедрения в производственную среду были названы контекст, управление, наблюдаемость и постоянное улучшение.
OpenAI также сообщила 25 июня 2026 года, что способ использования агентов меняется от одноразовых запросов к делегированию долгосрочных задач. По мере увеличения времени выполнения задач возрастает важность проверки промежуточных результатов, ограничения прав и процедур передачи задач человеку в случае неудачи.
Безопасность является еще одной задачей, которую необходимо решить корпоративным агентам. Когда агенты получают возможность читать и записывать внутренние документы и рабочие системы, возрастает риск утечки конфиденциальной информации и необходимость использования необходимых контекстов.
Исследование CI-Work от Microsoft Research показало, что уровень нарушения конфиденциальности у агентов на основе больших языковых моделей (LLM) составляет от 15,8% до 50,9%, а уровень утечки информации может достигать 26,7%. Исследователи пришли к выводу, что просто увеличение размера модели или глубины вывода не решит проблему утечки информации в зависимости от контекста.
В отрасли существуют разные мнения: одни считают, что агенты, проходящие через экран и браузер, являются переходным способом соединения с существующим программным обеспечением, в то время как другие полагают, что агенты, которые напрямую управляют существующими инструментами, станут основным направлением. Оба мнения согласны в том, что для реального внедрения необходимы контроль доступа, защитные меры и проверка результатов выполнения.
Внутри компаний продолжаются попытки создать структуру управления агентами. Внутренняя AI-система Coinbase применяет облачные песочницы, координацию подагентов и структуру автоматического создания задач, что создает основу для разделения области выполнения и ответственности в процессе выполнения многослойных задач.
В области виртуальных активов важнее, чем выгоды от ценовых преимуществ AI-агентов, является то, как спроектировать идентификацию, права и систему аудита. Поскольку начались совместные исследования по проверке идентификации и допустимого диапазона для автономных торговых AI-агентов, важность системы контроля возрастает по мере интеграции агентов в корпоративные процессы и инфраструктуру цифровых активов.
Цена --
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.
Вам также может понравиться

DGrid AI: Реконструкция механизма доверия к инфраструктуре ИИ с помощью PoQ и узлов верификации

200 AI торговых продуктов бесполезны? Бывший соучредитель Foresight Ventures сделал нечто иное

NVIDIA Qwen3.8-Flash-Next достигла более 16 000 токенов в секунду на платформе GB300 NVL72

Qualcomm представила IMSDK 2.0 для разработки приложений на основе AI

Почему ваше письмо звучит как ИИ? Редакторы a16z учат вас восстанавливать 'человеческое прикосновение'

Apple представила Mac mini с чипом M6, стартовая цена 899 долларов

CFTC рассматривает целесообразность бессрочных фьючерсов на GPU-вычисления【Руководство по последним тенденциям】

Thomson Reuters разработала юридическую AI-модель 'Томсон' за 40 миллионов долларов

Google и AMD сотрудничают для разработки 10-го поколения TPU с интегрированным CPU для удовлетворения потребностей в вычислениях ИИ

Хоскинсон представил открытый проект по обработке меток AI

Meta представила статью о снижении затрат на обучение LLM

Tencent, исследователь послеобучения присоединился к команде WeLM WeChat

Открытое API Toss Securities соединяет торговлю акциями для всех клиентов

Хакерская группа Северной Кореи разрабатывает и внедряет инструменты ИИ, усиливая кибератаки на криптовалютные компании

IOSG: Путь команды Web3, стоящей за восхождением Hermes на вершину

Хасабис уходит, последний акт эпохи до LLM

Vitalik заявил, что Minimax H3 превосходит HunyuanVideo 1.5

Алекс Карп и война за суверенитет в ИИ для компаний

Университет народной полиции Китая разработал ИИ для обнаружения незаконных сделок с биткойнами с точностью 89,4%

Morgan Stanley: Снижение цен на Token и H100, стоимость ИИ начинает снижаться?

Обзор Kimi K3 за неделю: консенсус, расхождения и тенденции

Почему акции майнинговых компаний растут, несмотря на падение BTC на 46%?

Воссоздание "DeepSeek момента"? Уолл-стрит единодушно заявляет: Kimi K3, наоборот, усиливает спрос на вычислительные мощности

Команда бывших сотрудников Microsoft основала Skyfall AI и планирует инвестировать 1 миллион долларов в тестирование модели «AI CEO»

Обзор GPT-5.6 против Fable 5: Какой выбрать зависит от этих факторов

Акции горнодобывающих компаний все дальше от криптовалюты

Все последние события: IPO Anthropic против OpenAI, раскрытие реальной ROI ИИ, экспортные ограничения моделей Китая и универсальное акционерное участие

Интерпретация внутреннего письма Zhipu AI: Прилив пришел, монетизация после листинга невозможна, ставка на самый "деньгиемкий" путь AGI

Количество пользователей Bai B.AI превысило 2 миллиона




