Microsoft утверждает, что MDASH превосходит Claude Mythos и GPT-5.6 Sol в тесте на кибербезопасность

By: decrypt.co|2026/07/27 19:01:04
0
Поделиться
copy
Оценить в GoogleОценить в Google

Microsoft представила свою первую специализированную модель кибербезопасности под названием MAI-Cyber-1-Flash и интегрировала её в MDASH, систему поиска уязвимостей, которая, по словам компании, превосходит Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI, при этом стоя на 50% дешевле, чем текущая лучшая конфигурация MDASH от Microsoft.

Согласно Microsoft, комбинированная система набрала 95,95% на CyberGym. CyberGym — это бенчмарк, который требует от ИИ-агентов воспроизвести 1,507 известных уязвимостей в 188 проектах с открытым исходным кодом, а затем оценивает их по проценту успешно воспроизведённых в контролируемой среде.

Это поставило MDASH впереди GPT-5.5 Cyber с 85,6%, Mythos 5 с 83,8%, GPT-5.6 Sol с 83,6% и Gemini 3.5 Flash Cyber с 83,2%. Результат был саморепортирован Microsoft и не появился в публичной таблице лидеров CyberGym на момент публикации, хотя бенчмарк использует публичный тестовый набор и определённую метрику успеха.

MAI-Cyber-1-Flash не работает в одиночку. Microsoft утверждает, что он обрабатывает до 90% задач, в то время как MDASH перенаправляет самые сложные 10% на GPT-5.4. Это важно, потому что токены — это куски текста, которые обрабатывает ИИ, стоят денег каждый раз, когда модель читает код или выдает ответ.

Это первый случай, когда модель Microsoft, созданная для эффективности, способна превзойти плотную модель на переднем крае технологий, созданную с учетом общих возможностей. "В сочетании с MDASH (MAI-Cyber-1-Flash) демонстрирует производительность мирового класса при 50% стоимости ведущих моделей", — написал генеральный директор Microsoft Сатья Наделла.

Модель (в данном случае MAI-Cyber-1-Flash) — это ИИ, который рассуждает о коде. Хардвар (в данном случае MDASH) — это механизмы вокруг него: агенты, инструменты, проверки и рабочий процесс, которые решают, где искать, ставят под сомнение подозрительные находки, удаляют дубликаты и доказывают, что ошибка может быть вызвана.

MDASH использует более 100 специализированных агентов, назначенных для аудита кода, обсуждения, является ли находка подлинной, и создания доказательства концепции — работающей демонстрации того, что недостаток существует.

Microsoft заявила, что периодические сканирования и задержанные патчи становятся устаревшими, поскольку ИИ делает обнаружение ошибок дешевле. Компания утверждает, что десятилетия данных о безопасности дают ей преимущество, добавляя: "Никто не может создать эту историю".

С момента выхода Claude Mythos эксперты по кибербезопасности пытались превзойти или сопоставить его возможности. Исследователи воспроизвели охоту на уязвимости в стиле Mythos с помощью публичных моделей менее чем за 30 долларов за сканирование. Давид Мочадло, один из участвующих исследователей, сказал: "Рубеж перемещается от доступа к модели к валидации".

Редкие части становятся системой, которая доказывает находки, не загружая разработчиков ложными тревогами.

Decrypt также сообщила, что GPT-5.5 Cyber недавно занял первое место в публичном CyberGym с результатом 85,6%, чуть обогнав Mythos. Результат Microsoft примерно на 10 пунктов выше, чем у GPT-5.5 Cyber, и на 7,5 пунктов выше предыдущего результата MDASH, но он оценивает полную систему, а не MAI-Cyber-1-Flash отдельно.

Microsoft вводит MDASH в частный предварительный просмотр через Microsoft Security Exposure Management в портале Defender. Клиенты могут сканировать репозитории Git, видеть находки, ранжированные от маловероятных до доказанных, и использовать Defender CLI для генерации предложенных исправлений кода для рассмотрения разработчиками.

Предварительный просмотр в настоящее время ограничивает репозитории примерно до 256 МБ и разрешает одно параллельное сканирование на арендатора. Проект Perception ожидается, что расширит тот же многопользовательский подход за пределы сканирования кода в более широкие рабочие процессы мониторинга угроз и устранения неполадок.

Цена --

--
--
--

Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.

Вам также может понравиться

ИИ создает эксплойт для Zoom менее чем за 24 часа

Частые случаи нарушения безопасности AI-тестирования: тестовая среда становится новой точкой риска

Кими K3 из Китая вышел за пределы песочницы, чтобы найти ответы на тесты

Утренний обзор Уолл-стрит: Давление на фондовые рынки перед выходом данных по занятости, акции в сфере хранения и ИИ под давлением, цены на медь приближаются к историческому максимуму

Uppsala Security присоединилась к Альянсу киберугроз CTA

Компания Uppsala Security, расположенная в Сингапуре, стала первой блокчейн-интеллектуальной компанией, присоединившейся к Альянсу киберугроз CTA в качестве ассоциированного члена.

Apple ограничивает количество отчетов о уязвимостях и усиливает проверку AI

Apple ($AAPL) ограничила количество отчетов о уязвимостях, которые может одновременно подать один исследователь безопасности. С увеличением скорости обнаружения уязвимостей с помощью генеративного ИИ приоритет отдается воспроизводимости...
...
iconiconiconiconiconiconiconiconicon
Служба поддержки:@weikecs
Деловое сотрудничество:@weikecs
Количественная торговля и ММ:bd@weex.com
VIP-программа:support@weex.com