Система MAI-Cyber-1-Flash от Microsoft набрала 96% в тесте CyberGym и превзошла Mythos от Anthropic на 12 процентных пунктов. В основе решения — связка лёгкой модели и GPT-5.4, а также оркестрация более 100 специализированных агентов.

Microsoft представила новую ИИ-систему кибербезопасности, которая набрала 96% в тесте CyberGym. Это на 12 процентных пунктов выше результата Mythos от Anthropic, при этом стоимость решения примерно вдвое ниже предыдущей системы Microsoft. Ключевая особенность подхода — отказ от одной большой модели. MAI-Cyber-1-Flash обрабатывает около 90% задач безопасности, а наиболее сложные 10% передаются на анализ GPT-5.4. За координацию отвечает система MDASH, которая управляет более чем 100 специализированными ИИ-агентами. Эти агенты ищут уязвимости в коде, оценивают реальные угрозы, удаляют дубликаты, проверяют возможность эксплуатации ошибок и собирают доказательства перед формированием отчёта.

Источники 1
  • Microsoft представила ИИ-систему для кибербезопасности с результатом 96% в CyberGym AI Post
    ⚡️Microsoft’s new AI cybersecurity system just hit a 96% score on CyberGym.
    
    That’s 12 points higher than Anthropic’s Mythos while costing roughly half as much as Microsoft’s previous system.
    
    The secret? Microsoft didn’t rely on one giant AI model.
    
    Instead:
    
    • MAI-Cyber-1-Flash handles about 90% of security tasks.
    • Only the toughest 10% are escalated to GPT-5.4.
    
    Behind the scenes, a system called MDASH orchestrates 100+ specialized AI agents that:
    
    • Search code for vulnerabilities
    • Investigate and debate whether issues are real
    • Remove duplicate findings
    • Test whether bugs are actually exploitable
    • Gather evidence before reporting results
    
    @aipost 🏴