AI News HubLIVE
站內改寫1 分鐘閱讀

ExploitGym:AI代理利用開發基準測試源代碼

ExploitGym是一個大規模、真實的基準測試,基於來自用户空間程序、Google V8引擎和Linux內核的實際漏洞構建,旨在評估AI代理開發利用的能力。

來源Hacker News AI作者: joshka

ExploitGym是一個專為評估AI代理利用開發能力而設計的大規模基準測試。它基於從用户空間程序、Google V8引擎和Linux內核中收集的真實漏洞構建,提供了869個實例,涵蓋廣泛的攻擊面。該基準測試旨在推動AI在網絡安全領域的研究,特別是自動化漏洞利用生成。

使用ExploitGym需要完成一系列設置步驟。首先,通過uv sync安裝Python依賴,然後運行設置腳本構建運行時環境並提取任務數據。接下來,拉取必要的Docker鏡像。啓動控制器、防火牆和LLM代理後,用户可以運行示例代理腳本來測試AI模型的性能。詳細的文檔包括系統依賴、Docker鏡像、評估方法等,可在相關文檔鏈接中找到。

ExploitGym的源代碼採用Apache-2.0許可,但任務數據來自外部上游,保留各自的許可。研究社區被鼓勵使用該基準測試,並引用相關論文。當前版本為v1.0,持續維護中。基準測試排行榜允許提交結果,促進比較和進步。

該基準測試的文檔涵蓋了多個方面:設置(Python依賴、GDB、socat/nc、節點和代理CLI)、Docker鏡像(按任務系列拉取目標鏡像)、評估(控制器/防火牆/LLM代理及示例腳本)、防禦(禁用系統防禦如ASLR)、防火牆(代理容器的出站網絡隔離)以及提交(基準測試排行榜的格式和要求)。所有詳細步驟和系統依賴均在docs/setup.md中説明。

ExploitGym的發佈版本為v1.0,包含869個實例。完整的版本歷史記錄在CHANGELOG.md中。當前版本的規範任務列表位於data/task_ids/v1.txt。研究社區被鼓勵使用該基準測試,並在研究中引用相關論文。

此外,GitHub倉庫顯示該項目已獲得576顆星、76個分支和4個關注者,表明社區對其有濃厚興趣。倉庫還包含CHANGELOG.md、DATA_LICENSE.md、LICENSE、README.md、pyproject.toml、pytest.ini和uv.lock等文件,為用户提供了完整的使用指南和貢獻途徑。