AI News HubLIVE
站內改寫2 分鐘閱讀

關於 Fable 5 網路安全防護措施及越獄框架的更多細節

Anthropic 重新部署了 Claude Fable 5,並詳細介紹了其網路安全分類器以及一套新的 AI 越獄嚴重性評估框架。分類器將網路安全相關活動分為四類:禁止使用、高風險雙重用途、低風險雙重用途和良性使用,並針對不同類別採取不同的阻斷或監控策略。公司還提出了一個初步的 AI 越獄嚴重性框架,旨在與政府、學術界和行業共同討論,以建立標準。

Anthropic 近日重新部署了其最新的 AI 模型 Claude Fable 5,現已面向全球所有使用者開放。伴隨此次重新上線,公司公佈了更多關於模型網路安全防護機制的細節,特別是其安全分類器的工作原理,以及一套全新的 AI 越獄嚴重性評估框架。

網路安全分類器

網路安全領域是一個典型的“雙重用途”領域——許多技術既可被防禦者用於保護系統,也可被攻擊者用於破壞。因此,Fable 5 並未簡單地對所有網路安全相關請求進行一刀切式的攔截,而是透過訓練安全分類器,將相關活動劃分為四個層級,並採取不同的處理策略:

  1. 禁止使用:指那些可能造成嚴重危害、且幾乎沒有防禦價值的活動,例如勒索軟體、破壞性攻擊、防禦規避、命令與控制通道、資料竊取、惡意軟體開發等。對於這些請求,分類器將直接予以阻斷。
  1. 高風險雙重用途:這些活動具有較高的潛在危害性,但同時也是安全專業人士日常工作中的一部分,例如滲透測試、許可權提升、橫向移動、漏洞利用開發等。由於這些行為極易被濫用,Fable 5 預設會將其阻斷,直到未來有更好的訪問控制機制來確保只有可信使用者才能使用。
  1. 低風險雙重用途:這類活動更傾向於防禦用途,但同時也可能為攻擊者提供一定幫助。例如公開源情報收集、普通漏洞識別、加密協議測試等。對於此類請求,分類器會進行監控,並部分阻斷——這構成了所謂的“安全邊際”,即寧可誤傷一些良性請求,也要確保高風險的請求不會被漏過。
  1. 良性使用:這些是純粹的防禦性或 IT 運維活動,幾乎不存在被濫用的風險,例如常規的安全配置、日誌分析等。分類器不會對這類請求進行攔截。

需要注意的是,Fable 5 的安全邊際設定得比前代模型更寬,這意味著更多請求(包括部分良性請求)可能會被誤攔,但這也大大降低了高風險請求被放行的機率。

AI 越獄嚴重性框架

除了分類器,Anthropic 還與合作伙伴 Glasswing 共同制定了一個初步的 AI 越獄嚴重性評估框架。所謂“越獄”,是指透過特殊的提示詞繞過模型的安全防護,從而引發原本被禁止的行為。越獄的嚴重程度各不相同:有些可能只繞過一些微不足道的限制,而另一些則可能解鎖大量有害輸出,使模型變得極其危險。然而,目前行業內缺乏一個統一的標準來描述越獄的嚴重性。

Anthropic 此次公佈的框架草案旨在提供一個通用語言,讓 AI 開發者、政府、學術界和民間社會能夠就每個越獄的風險進行一致的討論。公司歡迎各方反饋,並已在 HackerOne 上啟動了漏洞賞金計劃,鼓勵安全研究人員提交針對 Fable 5 的潛在越獄漏洞。

總結

Fable 5 的網路安全防護體系是多層次的:除了分類器,還包括訪問控制、模型安全訓練和離線監控。Anthropic 強調,他們希望透過行業合作,建立既允許技術用於防禦、又能防止濫用的標準。此次公佈的分類細節和越獄框架是這一努力的重要一步。