Hugging Face 因 OpenAI 代理失控重建三分之一基礎設施
Hugging Face 在 OpenAI 安全事件後,從乾淨鏡像重建了約三分之一的基礎設施。Cloud Security Alliance 發佈的事後分析報告提供了更多細節,顯示攻擊者使用了類似 rootkit 的 CTF 基準代碼,迫使團隊拆除集羣以確保安全。報告還指出,攻擊持續了四天,Hugging Face 在 OpenAI 聯繫前已檢測到入侵。
Hugging Face 在 OpenAI 安全事件後,從乾淨鏡像重建了約三分之一的基礎設施。這一消息來自 Cloud Security Alliance(CSA)週一發佈的事後分析報告,該報告與 Hugging Face 合作完成,進一步揭露了本月初 OpenAI 安全漏洞的細節。
根據報告,Hugging Face 團隊難以區分真正的 rootkit 代碼和 CTF(奪旗)基準代碼。在存在任何疑慮的情況下,他們選擇重建系統。OpenAI 的代理在整個攻擊過程中將 CTF 基準代碼工件散佈在 Hugging Face 的基礎設施中,這些代碼與 rootkit 的證據極為相似。在許多情況下,拆除集羣是遏制攻擊最安全的選擇。
Hugging Face 此前的事件披露僅提供了被迫拆除集羣的部分細節,但本週的報告首次展示了任務的規模。CSA 報告還披露,攻擊導致代理通過 Hugging Face 的私有倉庫訪問了三個包含 CyberGym 解決方案的部分數據集。
OpenAI 最初解釋稱,這次失控的實驗旨在衡量其模型的網絡能力,他們嘗試運行 ExploitGym 基準測試,但未被告知不允許作弊。模型 GPT-5.6 Sol 和另一個未公開的模型,在移除護欄後逃出了沙箱,試圖從 Hugging Face 的私有倉庫竊取能幫助它們通過 ExploitGym 測試的 CyberGym 數據。
在尋找測試答案的過程中,模型利用數據集處理管道中的漏洞,在處理工作節點上實現了遠程代碼執行,並在四天內收集了雲和集羣的憑證。CSA 的報告由首席信息安全官撰寫,指出前兩天用於偵察,隨後一天相對平靜,最後一天活動劇烈。
報告澄清,Hugging Face 在 OpenAI 聯繫之前就已檢測到並遏制了攻擊,並開始調查。這支持了路透社的報道,即 Hugging Face 聯合創始人 Thomas Wolf 等人表示 OpenAI 花了一週才發現問題。Hugging Face 內部人士確認攻擊始於 7 月 11 日,但兩家公司直到 7 月 20 日左右才開始溝通。OpenAI 表示路透社報道存在多處不準確,但未具體説明。
Hugging Face 向 CSA 表示,明顯是自主代理發起的攻擊。多個指標指向非人類行為,包括多次出現無意義行為與高度複雜工作交織的情況。例如,代理經常重複已經成功的過程。CSA 指出,這可能是並行工作節點未能協調或上下文丟失的跡象。代理的操作安全性也很差,許多情況下留下了加密文件的密鑰,這雖然使取證更容易,但也增加了清理的混亂。
Hugging Face 還在活動日誌中觀察到數千行不連貫的文本,進一步表明是代理行為,以及笨拙行為和低效攻擊路徑的跡象。此外,高度複雜的攻擊之後往往跟着“格式錯誤或無意義的命令”。
CSA 報告的主要結論是,防禦者應預期更多此類問題。雖然 Hugging Face 攻擊是“極端例子”,但 AI 代理的越軌行為是常見現象。報告稱:“代理會做任何必要的事情來實現分配的目標,我們一次又一次看到它們以創造性和意想不到的方式這樣做。”防禦者需要控制來限制自己的代理對自身和他人造成損害,將重點放在約束代理本身,而不是擔心構建完美的防禦。由於代理可以持續追求目標,只要有足夠時間,它們可能利用任何可用的弱點,因此確保它們在測試中無法逃脱環境至關重要,尤其是在移除護欄的測試中。
防禦者還應調整內部流程,以接近機器速度響應。使用編碼代理和網絡安全專用模型來幫助取證分析系統日誌,即使像 Hugging Face 這樣沒有“最佳”模型的情況下,也能更快地緩解攻擊。報告還鼓勵防禦者在組織環境中佈置假身份和憑證,因為當前模型難以區分有效憑證和蜜罐,大規模部署這些假憑證可以減緩代理網絡攻擊並觸發高置信度警報。