微软AI发布MAI-Cyber-1-Flash:50亿活跃参数的网络安全模型,将MDASH在CyberGym上的性能提升至95.95%
微软AI发布了MAI-Cyber-1-Flash,这是其首个专门用于网络防御的模型。该模型拥有1370亿总参数和50亿活跃参数,基于MAI-Code-1-Flash的稀疏MoE微调版本,上下文窗口为256k。它不独立提供端点服务,而是运行在微软的多模型代理扫描框架MDASH内部,可处理高达90%的任务,并将系统在CyberGym基准测试中的得分推至95.95%。该模型设计为仅执行防御性任务,无法生成漏洞利用代码。
微软AI今日发布了MAI-Cyber-1-Flash,这是其首个专为网络防御打造的模型。该模型并非作为独立端点提供,而是集成在微软的多模型代理扫描框架MDASH中运行。
MAI-Cyber-1-Flash采用带有自注意力机制和稀疏混合专家层的Transformer架构,总参数量达1370亿,其中活跃参数为50亿,上下文长度高达256k token,仅支持文本输入输出。它是基于MAI-Code-1-Flash(已嵌入GitHub Copilot和VS Code的轻量级代理编程模型)进行网络安全专业微调而来,官方称其源自MAI-Thinking-1系列。
在基准测试方面,CyberGym是一个包含188个OSS-Fuzz项目中1507个真实世界漏洞复现任务的开源套件。微软在CyberGym的默认级别1配置下进行评估(提供易受攻击的源代码和高层描述)。MDASH搭载MAI-Cyber-1-Flash与GPT-5.4的配置达到了95.95%的得分。微软宣称这比Anthropic的Mythos高出约12个百分点,而其他四个竞争系统的得分在83.2%至85.6%之间。
值得注意的是,微软在2026年5月首次详细公布MDASH时,该框架仅使用通用模型便在CyberGym上获得了88.45%的得分,这已是当时公开榜单的最高分,领先第二名约5个百分点。研究团队明确指出,将MDASH中80%的现有模型替换后,得分从88.4%跃升至95.95%。
路由机制是该产品的核心。MDASH管理着超过100个专门代理,经过准备、扫描、验证、去重和证明五个阶段。审计代理标记发现,辩论代理争论漏洞的可利用性(利用分歧作为信号),而证明阶段针对C/C++目标使用ASan执行触发输入。为控制前沿模型的大规模成本,MAI-Cyber-1-Flash处理MDASH中高达90%的任务,仅将最难的10%升级到GPT-5.4。这种路由机制相比之前使用GPT-5.4、5.4 mini和5.3 codex的配置,实现了50%的成本节省。
MDASH由微软自主代码安全(ACS)团队开发,成员包括DARPA AI网络挑战赛冠军Team Atlanta的成员。今年5月,MDASH辅助的工作在Windows网络和认证栈中生成了16个CVE(包括4个严重远程代码执行漏洞)。回顾性分析显示,它能在五年窗口期内恢复clfs.sys中28个MSRC案例的96%,以及tcpip.sys中7个案例的100%。
研究团队还公布了一个轻量级终端框架的独立测试结果:CVEBench为0.314,CyberSecEval4威胁情报为0.553,CyberSecEval4恶意软件分析为0.33,CRSBench为0.651(POV=1200),而ExploitGym(内核/用户空间/浏览器)得分均为0。
ExploitGym上的零分是有意为之,并非缺陷。微软团队表示,该模型被训练执行防御性任务,如修补漏洞,而非生成漏洞利用代码。一个50亿活跃参数、无法生成漏洞利用却可驱动95.95%发现管道的模型,正是防御者所需的产品。
访问权限受到限制,具体使用方式需进一步了解。