ExploitGym:AI智能体能否将漏洞转化为实际攻击?
ExploitGym是一个大规模、多样化、真实的基准测试,用于评估AI智能体将安全漏洞转化为实际利用的能力。该基准包含898个来自真实世界漏洞的实例,覆盖用户空间程序、Google V8 JavaScript引擎和Linux内核。评估显示,前沿模型(如Claude Mythos Preview和GPT-5.5)能够成功利用非平凡比例的漏洞,即使启用了广泛使用的防御机制,模型仍保持着一定的成功率。这突出了日益强大的AI智能体带来的网络安全风险。
随着人工智能技术飞速发展,AI智能体的能力日益增强,这给网络安全领域带来了前所未有的挑战与机遇。近期,一篇发表在arXiv上的预印本论文《ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?》正式提出了一个名为ExploitGym的全新基准测试,旨在系统评估AI智能体将安全漏洞转化为实际攻击的能力。
漏洞利用(Exploitation)是网络安全中的一项关键技能,它要求将只是潜在威胁的漏洞变为实际的安全事件,例如未经授权的文件访问或代码执行。这一过程需要低层次的程序推理(如内存布局分析)、运行时自适应以及长时间持续进展的能力。由于其双重用途特性,漏洞利用既能用于防御演练,也可能降低攻击门槛,因此对其进行严格评估至关重要。
ExploitGym基准测试包含898个精心设计的测试实例,这些实例均来源于真实世界的漏洞,覆盖了三大领域:用户空间程序、谷歌V8 JavaScript引擎以及Linux内核。研究团队针对每个实例应用了不同级别的安全防护措施,以隔离其对AI智能体性能的影响。所有实验配置均封装在可重现的容器化环境中,确保了结果的可比性和可靠性。
评估结果显示,虽然漏洞利用任务本身极具挑战性,但当前最先进的AI模型已经展现出不可忽视的能力。例如,Anthropic的最新模型Claude Mythos Preview成功利用了157个漏洞实例,而OpenAI的GPT-5.5也完成了120个。令人担忧的是,即使启用了广泛使用的防御机制,这些模型仍然保持着一定的成功率。
这些发现不仅验证了ExploitGym作为漏洞利用能力测试平台的有效性,也凸显了日益强大的AI智能体所带来的网络安全风险正在逐步加剧。研究人员呼吁业界警惕AI技术的双重用途特性,并加快制定应对策略。该论文的作者团队包括来自多所高校和研究机构的16位学者,论文编号为arXiv:2605.11086。