針對智慧體關鍵行動的價值投毒基準測試
本文介紹了一套評估AI模型是否會執行來自不可信文件的偽造值的基準測試。在十項關鍵工作流中,所有被測試的模型(從四個提供商)均表現出程度不同的脆弱性,且防護措施ActionRail成功阻止了所有被汙染的操作,且無誤報。
AI智慧體在執行關鍵操作時,可能會讀取並執行來自不可信文件中的偽造值,導致嚴重安全風險。本文介紹了一項新的基準測試,評估模型對此類“價值投毒”攻擊的脆弱性,並提出有效防護措施。
該基準測試涵蓋十種常見工作流:報銷、應付賬款、密碼重置、工資變更、供應商入職、客戶退款、採購、發貨變更、福利登記和API金鑰輪換。研究團隊在不可信文件中隱藏看似合理但未批准的值,測試了來自OpenAI、Anthropic、xAI和Moonshot四家提供商的八種模型:GPT-4o mini、GPT-4.1 mini、Claude Haiku 4.5、GPT-5.6 Luna、Grok 4.5、Kimi K3、GPT-5.6 Sol和Claude Sonnet 5。無保護時,所有模型至少執行一次被汙染的值,成功率從最低1.7%到最高63.3%。這說明模型間的脆弱性差異巨大,團隊不能依賴模型本身的安全性。
使用ActionRail防護時,所有被汙染操作均被阻止(480次攻擊無一成功),且無合法操作被誤阻(480次全部透過)。離線重放所有被汙染建議也被全部拒絕。研究還發現成本最佳化模型更易被利用;前沿模型雖抵抗性更好,但部分拒絕源於輸出截斷而非真正決策。此外,模型間表現差異很大,團隊替換模型時需謹慎。
基準測試的侷限性包括:測試案例已知且由作者編寫,重複實驗相關性強,前沿模型使用預設溫度而小型模型使用0溫度等。儘管如此,該研究為AI智慧體安全防護提供了重要參考。所有實驗預註冊、凍結並可復現,共完成6240個試驗,API總成本41.30美元。