Exploitbench:全面評估AI代理的漏洞利用能力
Exploitbench是一個由卡內基梅隆大學開發的新基準,用於全面評估AI代理在真實漏洞利用中的能力。它定義了從程式碼覆蓋到完全控制的5個層級(T5-T1),並針對V8引擎進行測試。當前排行榜顯示,Claude Mythos Preview和GPT-5.5已能在多個漏洞上實現任意程式碼執行。
Exploitbench是由卡內基梅隆大學的研究人員Seunghyun Lee和David Brumley教授開發的一個全新基準,旨在系統性地評估AI代理在真實世界漏洞利用中的實際進展。與現有僅關注崩潰觸發的基準不同,Exploitbench將漏洞利用過程細分為五個明確的層級,從低到高分別為:T5(程式碼覆蓋)、T4(漏洞復現)、T3(目標原語)、T2(通用原語)和T1(完全控制)。這種細粒度評估使得研究人員能夠清晰瞭解AI能力在利用鏈中的真實邊界,而不僅僅是得到一個二元結果。
首個基準v8-bench針對的是谷歌的V8引擎,這是Chrome、Edge、Node.js和Cloudflare Workers等廣泛使用的JavaScript和WebAssembly引擎。評估在啟用了安全沙箱的生產級V8上進行,使得實現任意程式碼執行變得極具挑戰性,因為這需要突破一個經過高度審計、具有多層防禦機制的複雜軟體系統。每個層級的評分由V8獨立shell d8中的確定性驗證器自動完成,無需人類或LLM介入,確保了評估的客觀性和可重複性。
當前排行榜顯示了20個模型/配置中的前7名,按照平均能力排序。其中,Anthropic的Claude Mythos Preview(包括提示和無提示版本)表現最為突出,在41個漏洞中的21個上達到了T1級別,平均能力得分達到9.90/16。OpenAI的GPT-5.5(透過Codex CLI)是唯一另一個在T1級別上取得突破的模型,在2個漏洞(v8-cve-2024-2887和v8-cve-2024-1939)上實現了完全控制。此外,Claude Opus 4.7的提示版本成功突破了V8沙箱,在v8-cve-2024-2887上實現了T2級別的通用讀寫原語,這是唯一一個達到該級別的模型。
成本分析揭示了漏洞利用能力與經濟成本之間的複雜關係。實現T4復現的最低成本僅為0.32美元,而實現T1完全控制的典型成本約為220美元。但值得注意的是,GPT-5.5的一個特例僅花費14美元就實現了完全控制,展示了成本與能力之間的帕累託前沿。Claude Mythos Preview的完全控制執行成本在72美元至360美元之間,平均約220美元(這些成本基於Project Glasswing的估算,而非實際結算費用)。
Exploitbench為安全社群提供了一個強大的防禦性評估工具。透過開源實現和MCP伺服器,使用者可以在Docker中輕鬆執行自己的評估,例如針對具體的CVE(如CVE-2024-3159)進行測試。這不僅有助於安全團隊在漏洞利用程式碼公開之前進行嚴重性評估、復現和補丁優先順序排序,也為AI安全研究提供了寶貴的基準。