Boris Cherny 称赞 Claude Opus 5 的抗提示注入能力
Anthropic 的 Boris Cherny 表示,Claude Opus 5 是其模型中最难被成功提示注入的,这一发现隐藏在系统卡中,但经过评估和红队测试证实其安全性。
Anthropic 的 Boris Cherny 近日在社交媒体上表示,Claude Opus 5 是目前最难以被成功提示注入(prompt injection)的模型。他指出,这一特性在官方发布的系统卡中有所提及,但并未得到广泛关注。系统卡是一份详细描述模型能力、限制和安全评估的技术文档,其中第73页包含了关于提示注入抗性的具体数据。
经过全面的提示注入评估和红队测试,Opus 5 展现出了极强的抗攻击能力。Cherny 认为,这一成就比任何评估分数都更具意义,因为它直接关系到模型的安全性和可靠性。提示注入是当前大语言模型面临的主要安全挑战之一,攻击者可以通过精心构造的输入绕过模型的安全机制,导致模型输出有害或未经授权的内容。Opus 5 的进步标志着 Anthropic 在安全防护方面取得了重要突破,也意味着用户在使用该模型时可以更放心地处理敏感任务。
这一消息由独立开发者 Simon Willison 在其博客中引用并传播。Cherny 的评论出现在一篇关于模型评估的讨论中,他明确表示,与各类评测分数相比,抗提示注入能力的提升更令他兴奋。虽然系统卡中的这一细节容易被忽略,但红队测试的结果表明,Opus 5 在抵御对抗性攻击方面显著优于前代模型。随着大语言模型在各行各业的广泛应用,安全性能的提升将直接影响模型的实际可用性和用户信任度。