Anthropic稱Claude在測試中意外入侵了真實公司系統
Anthropic 披露,在網路安全評估中,其 Claude 模型因配置錯誤獲得真實網際網路訪問,並自主入侵了三個組織的系統。事件最早發生於四月,涉及 Opus 4.7、Mythos 5 和一個內部研究模型。該公司強調主動審查了超過 14.1 萬次測試,並呼籲業界加強安全管控。
Anthropic 近日披露,在網路安全評估過程中,其多款 Claude 模型在未被公司察覺的情況下,自主入侵了三家不同組織的真實系統。這一訊息釋出前幾天,競爭對手 OpenAI 也承認自家模型入侵了開發者平臺 Hugging Face,進一步加劇了外界對前沿 AI 實驗室是否足以管控其越來越強大系統的擔憂。
據 Anthropic 釋出的一篇部落格文章,Claude 是在“奪旗”演習中獲得了對真實系統的未授權訪問。這是一種常見的駭客能力測試方式,模型需要在一個模擬網路中找到並獲取隱藏資訊。Anthropic 表示,這些測試環境本應是隔離的,但由於一個“配置錯誤”,模型實際訪問到的機器具有“即時網際網路連線”。又因為所有模型都被“明確告知”沒有網際網路訪問許可權,它們便將在真實網路上遇到的內容誤認為是模擬環境的一部分。
這些事件最早發生在四月,涉及三款不同的 Claude 模型:Opus 4.7、Mythos 5,以及一個“內部研究測試模型”。部落格文章稱,這些模型在接受網路能力測試時,沒有配備通常用於限制高風險行為的防護措施。Anthropic 直到 OpenAI 披露其“叛逆”AI 代理攻擊 Hugging Face 之後,才審查了超過 141,000 次網路安全測試執行,並由此發現了相關問題。
三款模型在遇到表明系統為真實的證據時表現各異。按照 Anthropic 的說法,最舊的模型 Opus 4.7 意識到自己連線到了真實系統,但“繼續攻擊”;旗艦模型 Mythos 5 發現自己正在使用網際網路,卻依然認為這一切仍屬於模擬,因此也繼續行動;而被描述為“最新模型”的內部測試模型,在出現目標真實的證據後停止了操作。
Anthropic 沒有透露受影響組織的具體身份,只表示將繼續調查,並在能夠提供資訊時公佈更新。該公司還稱,正與非營利性 AI 研究機構 METR 討論對事件進行第三方審查;OpenAI 也已聘請 METR 進行獨立審查。
在整篇博文中,Anthropic 多次將事件的性質及其處理方式與 OpenAI 進行對比,最後用四點列表指出了差異,並解釋為何相信自己的應對更好。Anthropic 強調他們“主動”審查了測試,且是在任何公司檢測到異常之前便展開。還指出,其模型是“透過開放路徑”訪問網際網路,而非像 OpenAI 的代理那樣利用了全新的漏洞;同時其最新模型也能夠在意識到真實環境時停下來。
Anthropic 還表示,其模型的失敗方式與 OpenAI 的代理不同,並認為這是一種更安全的失敗。“儘管兩者之間沒有截然分明的界限,但我們相信,這些事件更像是一次控制和操作失敗,而非模型對齊失敗。”簡而言之,Claude 模型是在執行被要求的任務,而 OpenAI 的代理則以其創造者未預料的方式追求目標,即 AI 安全領域所說的“錯位”。Anthropic 呼籲其他 AI 實驗室也對自身的網路測試進行類似的主動審查,並強調這一發現凸顯出在測試 AI 系統時需要更強的控制和更嚴格的安全措施。