ExploitGym:AI代理利用開發基準測試原始碼
ExploitGym是一個大規模、真實的基準測試,基於來自使用者空間程式、Google V8引擎和Linux核心的實際漏洞構建,旨在評估AI代理開發利用的能力。
ExploitGym是一個專為評估AI代理利用開發能力而設計的大規模基準測試。它基於從使用者空間程式、Google V8引擎和Linux核心中收集的真實漏洞構建,提供了869個例項,涵蓋廣泛的攻擊面。該基準測試旨在推動AI在網路安全領域的研究,特別是自動化漏洞利用生成。
使用ExploitGym需要完成一系列設定步驟。首先,透過uv sync安裝Python依賴,然後執行設定指令碼構建執行時環境並提取任務資料。接下來,拉取必要的Docker映象。啟動控制器、防火牆和LLM代理後,使用者可以執行示例代理指令碼來測試AI模型的效能。詳細的文件包括系統依賴、Docker映象、評估方法等,可在相關文件連結中找到。
ExploitGym的原始碼採用Apache-2.0許可,但任務資料來自外部上游,保留各自的許可。研究社群被鼓勵使用該基準測試,並引用相關論文。當前版本為v1.0,持續維護中。基準測試排行榜允許提交結果,促進比較和進步。
該基準測試的文件涵蓋了多個方面:設定(Python依賴、GDB、socat/nc、節點和代理CLI)、Docker映象(按任務系列拉取目標映象)、評估(控制器/防火牆/LLM代理及示例指令碼)、防禦(停用系統防禦如ASLR)、防火牆(代理容器的出站網路隔離)以及提交(基準測試排行榜的格式和要求)。所有詳細步驟和系統依賴均在docs/setup.md中說明。
ExploitGym的釋出版本為v1.0,包含869個例項。完整的版本歷史記錄在CHANGELOG.md中。當前版本的規範任務列表位於data/task_ids/v1.txt。研究社群被鼓勵使用該基準測試,並在研究中引用相關論文。
此外,GitHub倉庫顯示該專案已獲得576顆星、76個分支和4個關注者,表明社群對其有濃厚興趣。倉庫還包含CHANGELOG.md、DATA_LICENSE.md、LICENSE、README.md、pyproject.toml、pytest.ini和uv.lock等檔案,為使用者提供了完整的使用指南和貢獻途徑。