ExploitGym:AI代理利用开发基准测试源代码
ExploitGym是一个大规模、真实的基准测试,基于来自用户空间程序、Google V8引擎和Linux内核的实际漏洞构建,旨在评估AI代理开发利用的能力。
ExploitGym是一个专为评估AI代理利用开发能力而设计的大规模基准测试。它基于从用户空间程序、Google V8引擎和Linux内核中收集的真实漏洞构建,提供了869个实例,涵盖广泛的攻击面。该基准测试旨在推动AI在网络安全领域的研究,特别是自动化漏洞利用生成。
使用ExploitGym需要完成一系列设置步骤。首先,通过uv sync安装Python依赖,然后运行设置脚本构建运行时环境并提取任务数据。接下来,拉取必要的Docker镜像。启动控制器、防火墙和LLM代理后,用户可以运行示例代理脚本来测试AI模型的性能。详细的文档包括系统依赖、Docker镜像、评估方法等,可在相关文档链接中找到。
ExploitGym的源代码采用Apache-2.0许可,但任务数据来自外部上游,保留各自的许可。研究社区被鼓励使用该基准测试,并引用相关论文。当前版本为v1.0,持续维护中。基准测试排行榜允许提交结果,促进比较和进步。
该基准测试的文档涵盖了多个方面:设置(Python依赖、GDB、socat/nc、节点和代理CLI)、Docker镜像(按任务系列拉取目标镜像)、评估(控制器/防火墙/LLM代理及示例脚本)、防御(禁用系统防御如ASLR)、防火墙(代理容器的出站网络隔离)以及提交(基准测试排行榜的格式和要求)。所有详细步骤和系统依赖均在docs/setup.md中说明。
ExploitGym的发布版本为v1.0,包含869个实例。完整的版本历史记录在CHANGELOG.md中。当前版本的规范任务列表位于data/task_ids/v1.txt。研究社区被鼓励使用该基准测试,并在研究中引用相关论文。
此外,GitHub仓库显示该项目已获得576颗星、76个分支和4个关注者,表明社区对其有浓厚兴趣。仓库还包含CHANGELOG.md、DATA_LICENSE.md、LICENSE、README.md、pyproject.toml、pytest.ini和uv.lock等文件,为用户提供了完整的使用指南和贡献途径。