微軟AI釋出MAI-Cyber-1-Flash:50億活躍引數的網路安全模型,將MDASH在CyberGym上的效能提升至95.95%
微軟AI釋出了MAI-Cyber-1-Flash,這是其首個專門用於網路防禦的模型。該模型擁有1370億總引數和50億活躍引數,基於MAI-Code-1-Flash的稀疏MoE微調版本,上下文視窗為256k。它不獨立提供端點服務,而是執行在微軟的多模型代理掃描框架MDASH內部,可處理高達90%的任務,並將系統在CyberGym基準測試中的得分推至95.95%。該模型設計為僅執行防禦性任務,無法生成漏洞利用程式碼。
微軟AI今日釋出了MAI-Cyber-1-Flash,這是其首個專為網路防禦打造的模型。該模型並非作為獨立端點提供,而是整合在微軟的多模型代理掃描框架MDASH中執行。
MAI-Cyber-1-Flash採用帶有自注意力機制和稀疏混合專家層的Transformer架構,總引數量達1370億,其中活躍引數為50億,上下文長度高達256k token,僅支援文本輸入輸出。它是基於MAI-Code-1-Flash(已嵌入GitHub Copilot和VS Code的輕量級代理程式設計模型)進行網路安全專業微調而來,官方稱其源自MAI-Thinking-1系列。
在基準測試方面,CyberGym是一個包含188個OSS-Fuzz專案中1507個真實世界漏洞復現任務的開源套件。微軟在CyberGym的預設級別1配置下進行評估(提供易受攻擊的原始碼和高層描述)。MDASH搭載MAI-Cyber-1-Flash與GPT-5.4的配置達到了95.95%的得分。微軟宣稱這比Anthropic的Mythos高出約12個百分點,而其他四個競爭系統的得分在83.2%至85.6%之間。
值得注意的是,微軟在2026年5月首次詳細公佈MDASH時,該框架僅使用通用模型便在CyberGym上獲得了88.45%的得分,這已是當時公開榜單的最高分,領先第二名約5個百分點。研究團隊明確指出,將MDASH中80%的現有模型替換後,得分從88.4%躍升至95.95%。
路由機制是該產品的核心。MDASH管理著超過100個專門代理,經過準備、掃描、驗證、去重和證明五個階段。審計代理標記發現,辯論代理爭論漏洞的可利用性(利用分歧作為訊號),而證明階段針對C/C++目標使用ASan執行觸發輸入。為控制前沿模型的大規模成本,MAI-Cyber-1-Flash處理MDASH中高達90%的任務,僅將最難的10%升級到GPT-5.4。這種路由機制相比之前使用GPT-5.4、5.4 mini和5.3 codex的配置,實現了50%的成本節省。
MDASH由微軟自主程式碼安全(ACS)團隊開發,成員包括DARPA AI網路挑戰賽冠軍Team Atlanta的成員。今年5月,MDASH輔助的工作在Windows網路和認證棧中生成了16個CVE(包括4個嚴重遠端程式碼執行漏洞)。回顧性分析顯示,它能在五年視窗期內恢復clfs.sys中28個MSRC案例的96%,以及tcpip.sys中7個案例的100%。
研究團隊還公佈了一個輕量級終端框架的獨立測試結果:CVEBench為0.314,CyberSecEval4威脅情報為0.553,CyberSecEval4惡意軟體分析為0.33,CRSBench為0.651(POV=1200),而ExploitGym(核心/使用者空間/瀏覽器)得分均為0。
ExploitGym上的零分是有意為之,並非缺陷。微軟團隊表示,該模型被訓練執行防禦性任務,如修補漏洞,而非生成漏洞利用程式碼。一個50億活躍引數、無法生成漏洞利用卻可驅動95.95%發現管道的模型,正是防禦者所需的產品。
訪問許可權受到限制,具體使用方式需進一步瞭解。