AI News HubLIVE
站内改写1 分钟阅读

针对智能体关键行动的价值投毒基准测试

本文介绍了一套评估AI模型是否会执行来自不可信文档的伪造值的基准测试。在十项关键工作流中,所有被测试的模型(从四个提供商)均表现出程度不同的脆弱性,且防护措施ActionRail成功阻止了所有被污染的操作,且无误报。

来源Hacker News AI作者: oss-dev

AI智能体在执行关键操作时,可能会读取并执行来自不可信文档中的伪造值,导致严重安全风险。本文介绍了一项新的基准测试,评估模型对此类“价值投毒”攻击的脆弱性,并提出有效防护措施。

该基准测试涵盖十种常见工作流:报销、应付账款、密码重置、工资变更、供应商入职、客户退款、采购、发货变更、福利登记和API密钥轮换。研究团队在不可信文档中隐藏看似合理但未批准的值,测试了来自OpenAI、Anthropic、xAI和Moonshot四家提供商的八种模型:GPT-4o mini、GPT-4.1 mini、Claude Haiku 4.5、GPT-5.6 Luna、Grok 4.5、Kimi K3、GPT-5.6 Sol和Claude Sonnet 5。无保护时,所有模型至少执行一次被污染的值,成功率从最低1.7%到最高63.3%。这说明模型间的脆弱性差异巨大,团队不能依赖模型本身的安全性。

使用ActionRail防护时,所有被污染操作均被阻止(480次攻击无一成功),且无合法操作被误阻(480次全部通过)。离线重放所有被污染建议也被全部拒绝。研究还发现成本优化模型更易被利用;前沿模型虽抵抗性更好,但部分拒绝源于输出截断而非真正决策。此外,模型间表现差异很大,团队替换模型时需谨慎。

基准测试的局限性包括:测试案例已知且由作者编写,重复实验相关性强,前沿模型使用默认温度而小型模型使用0温度等。尽管如此,该研究为AI智能体安全防护提供了重要参考。所有实验预注册、冻结并可复现,共完成6240个试验,API总成本41.30美元。