ExploitGym – AI代理能否将安全漏洞转化为真实攻击?
ExploitGym是一个包含869个任务的基准测试,用于测试AI代理能否将漏洞证明输入转化为有效的利用代码,涵盖用户空间、V8和Linux内核领域。GPT-5.5和Claude Mythos Preview等前沿模型取得了显著成功,有时甚至发现了非预期的漏洞。标准缓解措施虽能降低攻击成功率,但无法完全阻止。这一结果凸显了自主漏洞利用的双重用途性质,并强调了防御适应和负责任AI开发的必要性。
ExploitGym是一个全新的基准测试,旨在评估AI代理能否将已知的安全漏洞转化为真实的攻击。与以往侧重于漏洞发现或补丁编写的基准不同,ExploitGym要求代理在给定漏洞源代码、触发漏洞的输入以及容器化运行环境后,生成能够实现未授权代码执行的利用程序,具体目标是获取一个通过合法途径无法访问的秘密标志。该基准包含869个任务,覆盖三个领域:502个用户空间程序(如FFmpeg、OpenSSL),181个V8浏览器引擎任务,以及186个Linux内核任务。每个利用程序还需通过代理法官的验证,确保其确实利用了提供的漏洞。
关键结果显示,自主漏洞利用已不再只是理论。前沿模型,如GPT-5.5和Claude Mythos Preview,能够分析内存布局,链式组合多个攻击原语,并生成完全可用的利用代码,而这传统上需要深厚的专业知识和大量时间。尽管启用了ASLR、栈金丝雀和V8堆沙盒等标准防御后,成功率大幅下降,但并未降至零。代理们找到了各种绕过方法,包括部分指针覆盖、已知的沙盒逃逸技术,以及覆盖modprobe_path等内核技巧。
值得关注的是,代理们在任务中经常表现出“偏离脚本”的行为,即通过非预期的漏洞实现代码执行。例如,GPT-5.5在210次成功中有120次使用了正确的漏洞,而Claude Mythos Preview在226次成功中有157次利用了指定漏洞。有些代理转向了验证较弱的相邻代码路径,有些则通过代码审计甚至动态模糊测试寻找新的攻击面,展现了令人惊叹的自主安全推理能力。此外,不同模型发现了截然不同的利用方法:仅Claude与GPT就有56个独有的成功目标,表明它们依赖不同的利用策略,集成多种模型可以显著扩大覆盖范围。
预算(时间)对最强模型的效果显著:将预算从2小时延长至6小时后,Claude Mythos Preview的成功次数从127增至204,且未见明显平台期,而较弱模型的成功次数很快停滞。这意味着2小时的预算可能低估了最强代理的实际能力。一个典型案例是GPT-5.4在V8引擎上的利用:面对一个仅5行的崩溃输入,它在71分钟内独立构建了完整的利用链,包括越界堆读取、指针泄漏、伪造字符串对象、任意内存读取、libc地址泄漏,最后通过信号返回导向编程(SROP)链执行系统命令。不过,这一成功是在禁用ASLR和V8堆沙盒的条件下实现的;启用这些防御后,同样的方法便失效了。
ExploitGym的结果证实了安全社区的许多猜测:AI从“发现漏洞”到“利用漏洞”的差距正在迅速缩小。这一进步具有双重用途:它既能加速严重性分类和缓解措施验证,也降低了攻击性滥用的门槛。因此,防御者需要开始将AI代理视为潜在攻击者,标准缓解措施虽然仍有价值,但已不足以单独应对能够以机器速度推理、适应和重试的对手。同时,负责任的AI开发必须明确考虑这些能力,通过结构化访问、安全过滤器和持续评估来加以管控。