重新部署 Claude Fable 5
美國出口管制解除後,Anthropic 宣佈將於2026年7月1日重新向全球用户提供Claude Fable 5。同時,Claude Mythos 5已恢復對美國組織的訪問。文章詳細介紹了事件時間線、安全防護措施更新、行業共識框架的制定以及更深入的政府合作。
Anthropic 宣佈,在出口管制解除後,Claude Fable 5 將於2026年7月1日重新向全球用户開放。此前,美國政府於6月12日對最新模型(包括 Claude Fable 5 和 Claude Mythos 5)實施出口管制,要求限制外國國民的訪問。由於無法實時驗證國籍,Anthropic 暫停了兩個模型的所有訪問。6月30日,出口管制解除。Fable 5 將在 Claude 平台、Claude.ai、Claude Code 和 Claude Cowork 上提供。Pro、Max、Team 和部分企業計劃用户可在7月7日前享受每週使用限額50%的免費額度,之後需使用積分。Mythos 5 也於6月26日獲美國政府批准,向一組美國組織恢復訪問。Anthropic 繼續與政府協調,擴大 Glasswing 項目合作伙伴的訪問權限。
事件時間線與安全更新 Anthropic 於6月9日發佈 Fable 5 和 Mythos 5。兩者共享底層模型,但 Fable 5 具有更強的安全保障。Mythos 5 僅向少數受信任的 Glasswing 合作伙伴開放,用於防禦性網絡安全。6月12日的出口管制指令源於亞馬遜研究人員的一份報告,他們發現了一種繞過 Fable 5 安全措施的方法:通過特定提示讓模型識別軟件漏洞,並編展示利用代碼。Anthropic 與政府及亞馬遜合作調查後確認,許多能力較弱的模型也能識別相同漏洞,且所有測試模型都能復現利用演示。報告的技術並未展現任何獨特的 Mythos 級網絡能力,僅涉及常規防禦性網絡安全工作。為此,Anthropic 訓練了改進的安全分類器,可在99%以上的案例中阻止報告中的技術。研究人員驗證了這些防護措施的有效性。新分類器可能導致良性請求被誤攔,但 Anthropic 將持續優化。
網絡安全防護方法 Claude Mythos 5 在發現和利用軟件漏洞方面具有超強能力,而 Claude Fable 5 因強大的防護措施不具備獨特攻擊能力。Fable 5 採用多層防禦機制,包括訓練模型拒絕危險請求、分析濫用模式以及使用分類器實時檢測有害內容。分類器會攔截可能危險的請求,包括邊緣案例。Anthropic 擴大了 Fable 5 的安全裕度,雖增加誤報但降低了漏報風險。安全裕度還有助於緩解越獄攻擊:大多數越獄僅觸及安全裕度或模糊有害行為,無法達到核心有害行為。Anthropic 認為,迄今報告的 Fable 5 越獄均屬此類。更嚴重的越獄可解鎖具體有害行為,但通常範圍有限;最令人擔憂的通用越獄尚未發現。Anthropic 致力於優先發現重大越獄並及時修復。
行業共識框架 目前AI行業缺乏評估越獄嚴重性的共識標準,這給開發者和政府帶來不確定性。Anthropic 與亞馬遜、微軟、谷歌等 Glasswing 合作伙伴共同起草一個共識框架,以客觀描述越獄的嚴重程度。該框架將幫助AI公司安全發佈模型,並讓用户充分利用先進能力。Anthropic 還加強了與美國政府的合作,包括預發佈測試、信息共享和研究協作。