AI News HubLIVE
站内改写2 分钟阅读

Exploitbench:全面评估AI代理的漏洞利用能力

Exploitbench是一个由卡内基梅隆大学开发的新基准,用于全面评估AI代理在真实漏洞利用中的能力。它定义了从代码覆盖到完全控制的5个层级(T5-T1),并针对V8引擎进行测试。当前排行榜显示,Claude Mythos Preview和GPT-5.5已能在多个漏洞上实现任意代码执行。

来源Hacker News AI作者: anp

Exploitbench是由卡内基梅隆大学的研究人员Seunghyun Lee和David Brumley教授开发的一个全新基准,旨在系统性地评估AI代理在真实世界漏洞利用中的实际进展。与现有仅关注崩溃触发的基准不同,Exploitbench将漏洞利用过程细分为五个明确的层级,从低到高分别为:T5(代码覆盖)、T4(漏洞复现)、T3(目标原语)、T2(通用原语)和T1(完全控制)。这种细粒度评估使得研究人员能够清晰了解AI能力在利用链中的真实边界,而不仅仅是得到一个二元结果。

首个基准v8-bench针对的是谷歌的V8引擎,这是Chrome、Edge、Node.js和Cloudflare Workers等广泛使用的JavaScript和WebAssembly引擎。评估在启用了安全沙箱的生产级V8上进行,使得实现任意代码执行变得极具挑战性,因为这需要突破一个经过高度审计、具有多层防御机制的复杂软件系统。每个层级的评分由V8独立shell d8中的确定性验证器自动完成,无需人类或LLM介入,确保了评估的客观性和可重复性。

当前排行榜显示了20个模型/配置中的前7名,按照平均能力排序。其中,Anthropic的Claude Mythos Preview(包括提示和无提示版本)表现最为突出,在41个漏洞中的21个上达到了T1级别,平均能力得分达到9.90/16。OpenAI的GPT-5.5(通过Codex CLI)是唯一另一个在T1级别上取得突破的模型,在2个漏洞(v8-cve-2024-2887和v8-cve-2024-1939)上实现了完全控制。此外,Claude Opus 4.7的提示版本成功突破了V8沙箱,在v8-cve-2024-2887上实现了T2级别的通用读写原语,这是唯一一个达到该级别的模型。

成本分析揭示了漏洞利用能力与经济成本之间的复杂关系。实现T4复现的最低成本仅为0.32美元,而实现T1完全控制的典型成本约为220美元。但值得注意的是,GPT-5.5的一个特例仅花费14美元就实现了完全控制,展示了成本与能力之间的帕累托前沿。Claude Mythos Preview的完全控制运行成本在72美元至360美元之间,平均约220美元(这些成本基于Project Glasswing的估算,而非实际结算费用)。

Exploitbench为安全社区提供了一个强大的防御性评估工具。通过开源实现和MCP服务器,用户可以在Docker中轻松运行自己的评估,例如针对具体的CVE(如CVE-2024-3159)进行测试。这不仅有助于安全团队在漏洞利用代码公开之前进行严重性评估、复现和补丁优先级排序,也为AI安全研究提供了宝贵的基准。