Sakana AI 發佈 Fugu-Cyber:編排模型在 CyberGym 上報告 86.9%,在 CTI-REALM 上報告 72.1%
Sakana AI 發佈了 Fugu-Cyber,這是其 Fugu 編排模型的安全專用端點。報告顯示在 CyberGym 和 CTI-REALM 上的成功率分別為 86.9% 和 72.1%,略高於 GPT-5.5-Cyber 和 Claude Mythos Preview。訪問需經手動審批、防禦使用策略和代幣計劃。
Sakana AI 發佈了 Fugu-Cyber(模型 ID 為 fugu-cyber-v1.0),這是其 Fugu 編排家族中的一個網絡安全專用端點。它並不是一個全新的前沿模型,而是 Fugu 編排器上的第三個端點,專門針對安全推理進行了調優。Sakana 在一個月前推出了該編排器。
Sakana 報告稱,Fugu-Cyber 在 CyberGym 和 CTI-REALM 上的成功率分別為 86.9% 和 72.1%。該公司表示,這些結果與 GPT-5.5-Cyber 和 Claude Mythos Preview 等專注於網絡安全的領先模型相當。
兩個基準測試衡量不同的安全工作流程。CyberGym 是加州大學伯克利分校的基準測試,包含 188 個 OSS-Fuzz 項目中的 1,507 個真實世界漏洞。其主要任務是:代理接收漏洞描述和未修補的代碼庫,必須編寫一個概念驗證,能夠使修補前的構建崩潰,但修補後的構建不會崩潰。這一驗證步驟使得該基準難以被操縱。CTI-REALM 是微軟的開源檢測工程基準測試。微軟從 Datadog Security Labs、Palo Alto Networks 和 Splunk 等來源整理了 37 份公開威脅報告。代理必須映射 MITRE ATT&CK 技術、探索遙測、迭代 KQL 查詢併發出經過驗證的 Sigma 規則。評分覆蓋 Linux 端點、Azure Kubernetes 服務和 Azure 雲。兩者結合涵蓋了“發現並證明漏洞”和“將情報轉化為檢測”,這是 Sakana 公告中最有説服力的部分。
在 CyberGym 上,86.9% 的成績需放在上下文背景中看待。當 CyberGym 研究人員首次發佈結果時,最佳的代理-模型配對僅達到約 20%。Anthropic 在 2026 年 4 月的 Project Glasswing 下報告 Claude Mythos Preview 達到 83.1%。OpenAI 報告更新後的 GPT-5.5-Cyber 達到 85.6%,而 GPT-5.5 為 81.8%。因此,Sakana 的 86.9% 是向前沿的小步邁進,而非大幅躍升。CTI-REALM 則不同。微軟自己的評估將前三名配置(均為 Claude)置於 0.624 至 0.685 之間。Fugu-Cyber 的 72.1% 將高於該區間。但需要注意的是,CTI-REALM 的評分是介於 0 和 1 之間的軌跡獎勵,並非通過/失敗率,而 Sakana 仍將其稱為成功率。
Fugu 本身是一個語言模型,經過訓練能夠讀取查詢並即時構建代理框架,然後將子任務委託給池中的專業模型。該方法在 Fugu 技術報告以及兩篇 ICLR 2026 論文(TRINITY 和 Conductor)中有所記錄。TRINITY 在多個 LLM 之間分配思考者、工作者和驗證者角色。Conductor 通過強化學習學習自然語言協調策略。對於安全工作,Sakana 研究團隊認為驗證者角色是關鍵。一個代理發現的候選漏洞在提出任何修補之前,會由安全專業子代理進行驗證。路由信息仍為專有,因此無法查看哪個模型處理了哪一步。
Fugu-Cyber 的訪問受到四個方面的限制。訪問需要提交申請表,説明預期用途並驗證聯繫方式。Sakana 團隊會逐個手動審核。該模型附帶更新的可接受使用政策,禁止進攻性濫用。計費僅限於代幣計劃。20 美元、100 美元和 200 美元的訂閲層級僅涵蓋 Fugu 和 Fugu-Ultra。此外,Fugu API 在歐盟或歐洲經濟區不可用,因為 Sakana 正在努力實現 GDPR 合規。定價固定為每百萬輸入代幣 6 美元,輸出代幣 36 美元,緩存輸入 0.60 美元。在上下文超過 272K 代幣時,所有三條費率翻倍。每行費用恰好是 Fugu-Ultra 費率的 1.2 倍,即網絡安全端點統一溢價 20%。長代碼庫運行很容易超過 272K,因此翻倍層級並非邊緣情況。
關鍵要點:Fugu-Cyber 是編排端點,而非新前沿模型,於 2026 年 7 月 21 日推出。Sakana 報告 CyberGym 86.9% 和 CTI-REALM 72.1%,均為自報且未復現。這些分數略微超過 GPT-5.5-Cyber 的 85.6% 和 Claude Mythos Preview 的 83.1%。訪問受限:手動審批、防禦性使用 AUP、僅限代幣計劃、無歐盟/歐洲經濟區、無權重。Sakana 自身的立場是,一個強大的 API 加上人類安全專業知識勝過單獨的 API。