Microsoft утверждает, что MDASH превосходит Claude Mythos и GPT-5.6 Sol в тесте на кибербезопасность
Microsoft представила свою первую специализированную модель кибербезопасности под названием MAI-Cyber-1-Flash и интегрировала её в MDASH, систему поиска уязвимостей, которая, по словам компании, превосходит Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI, при этом стоя на 50% дешевле, чем текущая лучшая конфигурация MDASH от Microsoft.
Согласно Microsoft, комбинированная система набрала 95,95% на CyberGym. CyberGym — это бенчмарк, который требует от ИИ-агентов воспроизвести 1,507 известных уязвимостей в 188 проектах с открытым исходным кодом, а затем оценивает их по проценту успешно воспроизведённых в контролируемой среде.
Это поставило MDASH впереди GPT-5.5 Cyber с 85,6%, Mythos 5 с 83,8%, GPT-5.6 Sol с 83,6% и Gemini 3.5 Flash Cyber с 83,2%. Результат был саморепортирован Microsoft и не появился в публичной таблице лидеров CyberGym на момент публикации, хотя бенчмарк использует публичный тестовый набор и определённую метрику успеха.
MAI-Cyber-1-Flash не работает в одиночку. Microsoft утверждает, что он обрабатывает до 90% задач, в то время как MDASH перенаправляет самые сложные 10% на GPT-5.4. Это важно, потому что токены — это куски текста, которые обрабатывает ИИ, стоят денег каждый раз, когда модель читает код или выдает ответ.
Это первый случай, когда модель Microsoft, созданная для эффективности, способна превзойти плотную модель на переднем крае технологий, созданную с учетом общих возможностей. "В сочетании с MDASH (MAI-Cyber-1-Flash) демонстрирует производительность мирового класса при 50% стоимости ведущих моделей", — написал генеральный директор Microsoft Сатья Наделла.
Модель (в данном случае MAI-Cyber-1-Flash) — это ИИ, который рассуждает о коде. Хардвар (в данном случае MDASH) — это механизмы вокруг него: агенты, инструменты, проверки и рабочий процесс, которые решают, где искать, ставят под сомнение подозрительные находки, удаляют дубликаты и доказывают, что ошибка может быть вызвана.
MDASH использует более 100 специализированных агентов, назначенных для аудита кода, обсуждения, является ли находка подлинной, и создания доказательства концепции — работающей демонстрации того, что недостаток существует.
Microsoft заявила, что периодические сканирования и задержанные патчи становятся устаревшими, поскольку ИИ делает обнаружение ошибок дешевле. Компания утверждает, что десятилетия данных о безопасности дают ей преимущество, добавляя: "Никто не может создать эту историю".
С момента выхода Claude Mythos эксперты по кибербезопасности пытались превзойти или сопоставить его возможности. Исследователи воспроизвели охоту на уязвимости в стиле Mythos с помощью публичных моделей менее чем за 30 долларов за сканирование. Давид Мочадло, один из участвующих исследователей, сказал: "Рубеж перемещается от доступа к модели к валидации".
Редкие части становятся системой, которая доказывает находки, не загружая разработчиков ложными тревогами.
Decrypt также сообщила, что GPT-5.5 Cyber недавно занял первое место в публичном CyberGym с результатом 85,6%, чуть обогнав Mythos. Результат Microsoft примерно на 10 пунктов выше, чем у GPT-5.5 Cyber, и на 7,5 пунктов выше предыдущего результата MDASH, но он оценивает полную систему, а не MAI-Cyber-1-Flash отдельно.
Microsoft вводит MDASH в частный предварительный просмотр через Microsoft Security Exposure Management в портале Defender. Клиенты могут сканировать репозитории Git, видеть находки, ранжированные от маловероятных до доказанных, и использовать Defender CLI для генерации предложенных исправлений кода для рассмотрения разработчиками.
Предварительный просмотр в настоящее время ограничивает репозитории примерно до 256 МБ и разрешает одно параллельное сканирование на арендатора. Проект Perception ожидается, что расширит тот же многопользовательский подход за пределы сканирования кода в более широкие рабочие процессы мониторинга угроз и устранения неполадок.
Цена --
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.
Вам также может понравиться

ИИ создает эксплойт для Zoom менее чем за 24 часа

Частые случаи нарушения безопасности AI-тестирования: тестовая среда становится новой точкой риска

Кими K3 из Китая вышел за пределы песочницы, чтобы найти ответы на тесты

Утренний обзор Уолл-стрит: Давление на фондовые рынки перед выходом данных по занятости, акции в сфере хранения и ИИ под давлением, цены на медь приближаются к историческому максимуму

Uppsala Security присоединилась к Альянсу киберугроз CTA

Apple ограничивает количество отчетов о уязвимостях и усиливает проверку AI

Опубликован путь атаки повышения привилегий AI-агента Gemini

Искусственные агенты как сотрудники: кто понесет ответственность в случае проблем?

OpenAI выпустила открытую версию Codex Security CLI

Strategy объявила о сценарии падения Bitcoin на 5,8 лет

Отчет CertiK показывает, что убытки от атак с использованием ключей возросли до 124 миллионов долларов

Цель операции Decrypted заявляет, что поделился паролем от биткойн-кошелька с третьими лицами и что был несправедливо арестован после взлома биржи

Coinspect: Уязвимость кошелька привела к краже 3,14 миллиона долларов, высокие риски для активов китайских пользователей

Программа для кражи криптовалюты TrapDoor атакует три крупных репозитория кода, выявлено 34 вредоносных пакета

Polymarket: The security incident reported by ZachXBT is due to the leakage of the internal operational wallet's private key, but user funds and market settlements are safe

MARA discloses executives' huge security expenses, as incidents of cryptocurrency "ransomware attacks" continue to increase

GoPlus: Ликвидный стейкинг-кошелек ListaDAO был атакован, и злоумышленник использовал логическую уязвимость для кражи средств

Федеральные прокуроры штата Коннектикут (США) вернули 600 000 долларов в криптовалюте, похищенных в результате фишинговой атаки на пользователя Ledger

GoPlus: Вредоносное ПО Infiniti Stealer атакует криптовалютные кошельки, ориентируясь на пользователей Mac

Фонд Ethereum запускает "Hardness", специальную команду для защиты децентрализованной основы

Национальный центр кибербезопасности и другие организации выпустили Руководство по практике использования OpenClaw Security

GoPlus раскрывает новый тип вредоносного ПО для Android PromptSpy, который использует большие модели ИИ для удаленного управления устройствами







