AI News HubLIVE
站內改寫1 分鐘閱讀

Boris Cherny 稱讚 Claude Opus 5 的抗提示注入能力

Anthropic 的 Boris Cherny 表示,Claude Opus 5 是其模型中最難被成功提示注入的,這一發現隱藏在系統卡中,但經過評估和紅隊測試證實其安全性。

Anthropic 的 Boris Cherny 近日在社交媒體上表示,Claude Opus 5 是目前最難以被成功提示注入(prompt injection)的模型。他指出,這一特性在官方發佈的系統卡中有所提及,但並未得到廣泛關注。系統卡是一份詳細描述模型能力、限制和安全評估的技術文檔,其中第73頁包含了關於提示注入抗性的具體數據。

經過全面的提示注入評估和紅隊測試,Opus 5 展現出了極強的抗攻擊能力。Cherny 認為,這一成就比任何評估分數都更具意義,因為它直接關係到模型的安全性和可靠性。提示注入是當前大語言模型面臨的主要安全挑戰之一,攻擊者可以通過精心構造的輸入繞過模型的安全機制,導致模型輸出有害或未經授權的內容。Opus 5 的進步標誌着 Anthropic 在安全防護方面取得了重要突破,也意味着用户在使用該模型時可以更放心地處理敏感任務。

這一消息由獨立開發者 Simon Willison 在其博客中引用並傳播。Cherny 的評論出現在一篇關於模型評估的討論中,他明確表示,與各類評測分數相比,抗提示注入能力的提升更令他興奮。雖然系統卡中的這一細節容易被忽略,但紅隊測試的結果表明,Opus 5 在抵禦對抗性攻擊方面顯著優於前代模型。隨着大語言模型在各行各業的廣泛應用,安全性能的提升將直接影響模型的實際可用性和用户信任度。