ExploitGym:AI智能體能否將漏洞轉化為實際攻擊?
ExploitGym是一個大規模、多樣化、真實的基準測試,用於評估AI智能體將安全漏洞轉化為實際利用的能力。該基準包含898個來自真實世界漏洞的實例,覆蓋用户空間程序、Google V8 JavaScript引擎和Linux內核。評估顯示,前沿模型(如Claude Mythos Preview和GPT-5.5)能夠成功利用非平凡比例的漏洞,即使啓用了廣泛使用的防禦機制,模型仍保持着一定的成功率。這突出了日益強大的AI智能體帶來的網絡安全風險。
隨着人工智能技術飛速發展,AI智能體的能力日益增強,這給網絡安全領域帶來了前所未有的挑戰與機遇。近期,一篇發表在arXiv上的預印本論文《ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?》正式提出了一個名為ExploitGym的全新基準測試,旨在系統評估AI智能體將安全漏洞轉化為實際攻擊的能力。
漏洞利用(Exploitation)是網絡安全中的一項關鍵技能,它要求將只是潛在威脅的漏洞變為實際的安全事件,例如未經授權的文件訪問或代碼執行。這一過程需要低層次的程序推理(如內存佈局分析)、運行時自適應以及長時間持續進展的能力。由於其雙重用途特性,漏洞利用既能用於防禦演練,也可能降低攻擊門檻,因此對其進行嚴格評估至關重要。
ExploitGym基準測試包含898個精心設計的測試實例,這些實例均來源於真實世界的漏洞,覆蓋了三大領域:用户空間程序、谷歌V8 JavaScript引擎以及Linux內核。研究團隊針對每個實例應用了不同級別的安全防護措施,以隔離其對AI智能體性能的影響。所有實驗配置均封裝在可重現的容器化環境中,確保了結果的可比性和可靠性。
評估結果顯示,雖然漏洞利用任務本身極具挑戰性,但當前最先進的AI模型已經展現出不可忽視的能力。例如,Anthropic的最新模型Claude Mythos Preview成功利用了157個漏洞實例,而OpenAI的GPT-5.5也完成了120個。令人擔憂的是,即使啓用了廣泛使用的防禦機制,這些模型仍然保持着一定的成功率。
這些發現不僅驗證了ExploitGym作為漏洞利用能力測試平台的有效性,也凸顯了日益強大的AI智能體所帶來的網絡安全風險正在逐步加劇。研究人員呼籲業界警惕AI技術的雙重用途特性,並加快制定應對策略。該論文的作者團隊包括來自多所高校和研究機構的16位學者,論文編號為arXiv:2605.11086。