研究显示:OpenAI、Anthropic、Google、Amazon和xAI均未能通过某种攻击类型的测试
思科最新研究发现,所有主流前沿AI模型在多轮攻击中均存在漏洞,单轮安全基准测试无法有效预测模型的多轮防御能力。
思科最新研究评估了来自OpenAI、Anthropic、Google、Amazon和xAI的15个前沿封闭模型,发现所有模型在多轮对话攻击中均存在漏洞。多轮攻击成功率从7.89%到88.30%不等,而单轮攻击成功率范围仅为2.19%到64.91%。研究指出,单轮表现无法预示多轮防御能力,两者差异最高达55个百分点。例如,Gemini 3 Pro的单轮攻击成功率为18.10%,但在多轮攻击下飙升至73.35%;GPT-5.4的单轮成功率仅为2.74%,多轮下升至24.68%。Anthropic的Claude系列表现最佳,多轮攻击成功率在11.16%到16.20%之间。亚马逊的Nova系列出现相反趋势:单轮攻击成功率高但多轮下反而降低。配置变化影响显著:Grok 4.1 Fast在启用推理模式后,多轮攻击成功率从88.30%降至43.47%。思科建议AI提供商在模型发布时公布按攻击策略分类的成功率,企业部署时应包含高风险程序回归测试,并对单轮与多轮差距超过15个百分点的模型进行人工审查。思科强调,安全性是连续的、依赖场景的属性,而非二元认证。