Microsoft AI、MAI-Cyber-1-Flashを公開:5BアクティブパラメータのサイバーモデルがMDASHのCyberGymスコアを95.95%に向上
Microsoft AIは、サイバー防御専用として初のモデルMAI-Cyber-1-Flashを公開した。総パラメータ137B、アクティブパラメータ5BのスパースMoEモデルで、MAI-Code-1-Flashを微調整したものであり、256kのコンテキストウィンドウを持つ。このモデルは単独のエンドポイントとしては提供されず、MicrosoftのマルチモデルエージェントスキャンハーネスMDASH内で動作し、最大90%のタスクを処理し、システムのCyberGymスコアを95.95%に押し上げる。
Microsoft AIは、サイバー防御に特化した初のモデルMAI-Cyber-1-Flashをリリースしました。このモデルは単独のエンドポイントとして提供されるのではなく、MicrosoftのマルチモデルエージェントスキャンハーネスMDASH内で動作します。
MAI-Cyber-1-Flashは、自己注意機構とスパース混合専門家(MoE)層を備えたトランスフォーマーであり、総パラメータ数137B、アクティブパラメータ5B、コンテキスト長256kを持ちます。入出力はテキストのみです。これは、すでにGitHub CopilotやVS Codeに組み込まれている軽量エージェントコーディングモデルMAI-Code-1-Flashをサイバーセキュリティ向けに微調整したもので、MAI-Thinking-1系統から派生したと説明されています。
ベンチマークにおいて、CyberGymは188のOSS-Fuzzプロジェクトから抽出された1,507の実世界の脆弱性再現タスクからなる公開スイートです。MicrosoftはCyberGymのデフォルトレベル1構成(脆弱なソースコードと高レベルな説明が提供される)で評価しました。MDASHがMAI-Cyber-1-FlashとGPT-5.4を組み合わせて実行した場合のスコアは95.95%です。MicrosoftはこれをAnthropicのMythosより約12ポイント高いと位置付け、競合4システムは83.2%から85.6%の間にあります。
Microsoftが2026年5月にMDASHを初めて詳細に説明した際、このハーネスは汎用モデルのみを使用してCyberGymで88.45%を達成していました。これは当時の公開リーダーボードで最高スコアであり、次のエントリー(83.1%)を約5ポイント上回っていました。研究チームは改善点を明確に述べています。MDASH内の既存モデルの80%を置き換えることで、ハーネスのスコアは88.4%から95.95%に向上しました。
ルーティングこそが真の製品です。MDASHは、Prepare、Scan、Validate、Dedupe、Proveの5つの段階を通じて100以上の専門エージェントを管理します。Auditorエージェントが発見をフラグし、Debaterエージェントが悪用可能性を議論(意見の相違をシグナルとして利用)し、Prove段階ではC/C++ターゲットに対してASanを使用してトリガー入力を実行します。
フロンティアモデルのコストを大規模に抑制するため、MAI-Cyber-1-FlashはMDASHタスクの最大90%を処理し、最も難しい10%をGPT-5.4にエスカレーションします。このルーティングにより、以前のGPT-5.4、5.4 mini、5.3 codexの構成と比較して50%のコスト削減を実現しています。
MDASHはMicrosoftのAutonomous Code Security(ACS)チームによって開発され、DARPA AI Cyber Challengeで優勝したTeam Atlantaのメンバーも参加しています。2026年5月、MDASHによる支援作業でWindowsネットワーキングおよび認証スタックにおいて16件のCVE(4件の重大なリモートコード実行脆弱性を含む)が生成されました。遡及的に、clfs.sysの28件のMSRC事例の96%、tcpip.sysの7件の事例の100%を5年間のウィンドウで復旧しました。
パフォーマンスについて、研究チームは軽量ターミナルハーネスからの独立した結果を提示しています:CVEBench 0.314、CyberSecEval4脅威インテリジェンス0.553、CyberSecEval4マルウェア解析0.33、CRSBench 0.651(POV=1200)、ExploitGym(カーネル/ユーザースペース/ブラウザ)0/0/0。
ExploitGymでのゼロスコアは意図的なものであり、欠陥ではありません。Microsoftチームは、このモデルはバグ修正などの防御タスクを実行するように訓練されており、マルウェア展開などの攻撃タスクを実行しないと述べています。エクスプロイトを生成できないが95.95%の発見パイプラインを駆動できる5Bアクティブモデルは、まさに防御専用製品に必要な成果物です。
アクセスは制限されており、具体的な使用方法は別途案内されます。