ExploitGym – AI代理能否將安全漏洞轉化為真實攻擊?
ExploitGym是一個包含869個任務的基準測試,用於測試AI代理能否將漏洞證明輸入轉化為有效的利用程式碼,涵蓋使用者空間、V8和Linux核心領域。GPT-5.5和Claude Mythos Preview等前沿模型取得了顯著成功,有時甚至發現了非預期的漏洞。標準緩解措施雖能降低攻擊成功率,但無法完全阻止。這一結果凸顯了自主漏洞利用的雙重用途性質,並強調了防禦適應和負責任AI開發的必要性。
ExploitGym是一個全新的基準測試,旨在評估AI代理能否將已知的安全漏洞轉化為真實的攻擊。與以往側重於漏洞發現或補丁編寫的基準不同,ExploitGym要求代理在給定漏洞原始碼、觸發漏洞的輸入以及容器化執行環境後,生成能夠實現未授權程式碼執行的利用程式,具體目標是獲取一個透過合法途徑無法訪問的秘密標誌。該基準包含869個任務,覆蓋三個領域:502個使用者空間程式(如FFmpeg、OpenSSL),181個V8瀏覽器引擎任務,以及186個Linux核心任務。每個利用程式還需透過代理法官的驗證,確保其確實利用了提供的漏洞。
關鍵結果顯示,自主漏洞利用已不再只是理論。前沿模型,如GPT-5.5和Claude Mythos Preview,能夠分析記憶體佈局,鏈式組合多個攻擊原語,並生成完全可用的利用程式碼,而這傳統上需要深厚的專業知識和大量時間。儘管啟用了ASLR、棧金絲雀和V8堆沙盒等標準防禦後,成功率大幅下降,但並未降至零。代理們找到了各種繞過方法,包括部分指標覆蓋、已知的沙盒逃逸技術,以及覆蓋modprobe_path等核心技巧。
值得關注的是,代理們在任務中經常表現出“偏離指令碼”的行為,即透過非預期的漏洞實現程式碼執行。例如,GPT-5.5在210次成功中有120次使用了正確的漏洞,而Claude Mythos Preview在226次成功中有157次利用了指定漏洞。有些代理轉向了驗證較弱的相鄰程式碼路徑,有些則透過程式碼審計甚至動態模糊測試尋找新的攻擊面,展現了令人驚歎的自主安全推理能力。此外,不同模型發現了截然不同的利用方法:僅Claude與GPT就有56個獨有的成功目標,表明它們依賴不同的利用策略,整合多種模型可以顯著擴大覆蓋範圍。
預算(時間)對最強模型的效果顯著:將預算從2小時延長至6小時後,Claude Mythos Preview的成功次數從127增至204,且未見明顯平臺期,而較弱模型的成功次數很快停滯。這意味著2小時的預算可能低估了最強代理的實際能力。一個典型案例是GPT-5.4在V8引擎上的利用:面對一個僅5行的崩潰輸入,它在71分鐘內獨立構建了完整的利用鏈,包括越界堆讀取、指標洩漏、偽造字串物件、任意記憶體讀取、libc地址洩漏,最後透過訊號返回導向程式設計(SROP)鏈執行系統命令。不過,這一成功是在停用ASLR和V8堆沙盒的條件下實現的;啟用這些防禦後,同樣的方法便失效了。
ExploitGym的結果證實了安全社群的許多猜測:AI從“發現漏洞”到“利用漏洞”的差距正在迅速縮小。這一進步具有雙重用途:它既能加速嚴重性分類和緩解措施驗證,也降低了攻擊性濫用的門檻。因此,防禦者需要開始將AI代理視為潛在攻擊者,標準緩解措施雖然仍有價值,但已不足以單獨應對能夠以機器速度推理、適應和重試的對手。同時,負責任的AI開發必須明確考慮這些能力,透過結構化訪問、安全過濾器和持續評估來加以管控。