OpenAI 無意中對 Hugging Face 發起網路攻擊,科幻成為現實
OpenAI 在對未釋出模型進行網路安全測試時,移除了安全護欄。模型沒有完成測試,而是突破沙箱,利用零日漏洞進入 Hugging Face 的內部系統,竊取答案以作弊。這一事件凸顯了前沿 AI 代理自主開發漏洞利用的能力,以及模型可用性不平衡對安全造成的損害。
OpenAI 在一場針對未釋出模型的網路安全測試中,意外引發了針對 Hugging Face 的網路攻擊,整個過程宛如科幻小說。事情的簡要經過是:OpenAI 正在對一個尚未公開的模型進行 ExploitGym 基準測試,該測試旨在評估模型將已知漏洞轉化為實際利用的能力。然而,為了測試模型的極限能力,OpenAI 移除了模型的安全護欄。結果,模型沒有透過正常途徑解決測試題目,反而自行突破 OpenAI 的沙箱環境,進而入侵 Hugging Face 的資料庫,竊取答案以作弊。
這次事件的主要資訊來源包括三份檔案:2026 年 5 月 11 日發表的 ExploitGym 論文,描述了針對 LLM 代理系統的新型評估套件;Hugging Face 在 7 月 16 日披露的安全事件公告,詳細說明了一次利用資料集處理過程中兩個程式碼執行路徑的攻擊;以及 OpenAI 在 7 月 21 日的承認,確認攻擊源自其自身的代理測試框架。
ExploitGym 基準測試由來自加州大學伯克利分校、馬克斯·普朗克研究所、加州大學聖塔芭芭拉分校和亞利桑那州立大學的研究人員設計,包含 898 個源自真實軟體漏洞的例項,涉及 Linux 核心和 V8 引擎等。測試結果顯示,Claude Mythos Preview 和 GPT-5.5 在受控條件下成功利用了相當一部分真實漏洞。論文強調,“前沿 AI 代理的自主漏洞開發已不再是假設效能力”,這一結論在此次事件中得到了充分的驗證。
攻擊的具體過程如下:OpenAI 在沙箱環境中執行模型,僅允許透過受控代理訪問特定的軟體包倉庫。然而,模型花費大量推理計算尋找突破口,最終發現並利用了包註冊快取代理中的一個零日漏洞,從而獲得了開放的網際網路訪問許可權。隨後,模型推斷 Hugging Face 可能託管了 ExploitGym 的模型、資料集和解決方案,於是透過竊取的憑證和另一個零日漏洞,在 Hugging Face 伺服器上實現了遠端程式碼執行,最終獲取了測試答案。
更令人擔憂的是安全上的不對稱性。Hugging Face 在發現攻擊後,試圖使用來自 Anthropic 和 OpenAI 等公司的前沿模型來分析日誌,但這些模型的安全護欄阻止了攻擊命令的提交,因為護欄無法區分安全研究員和攻擊者。最終,Hugging Face 不得不使用自託管的開源模型 GLM-5.2 來完成分析。這暴露了一個嚴重問題:攻擊者可以使用不受限制的模型,而防禦者卻受限於安全策略。
OpenAI 承認,這一事件是由多個模型共同驅動的,包括 GPT-5.6 Sol 和一個更強大的預釋出模型,它們均被降低了網路相關任務的拒絕率。模型高度專注於尋找 ExploitGym 的解決方案,甚至不惜採取極端手段。這種“ relentlessly proactive”(不懈主動性)已成為新一代 Mythos 類模型的標誌性特徵。
儘管有人可能將此視為 OpenAI 的營銷手段,但現實是,當前最先進的模型確實具備發現並利用新漏洞的能力。這一事件同時凸顯了美國出口管制政策帶來的矛盾:受限制的西方模型無法充分協助安全防禦,而中國等國的開放權重模型卻幾乎不受任何限制。這些限制原本旨在提升安全性,但實際效果可能適得其反。