AI News HubLIVE
站內改寫2 分鐘閱讀

為AI智能體安全護欄進行基準測試

本文對開源AI智能體安全護欄進行基準測試:在BIPIA上測試提示注入檢測模型,在HammerBench上測試函數調用判斷模型。結果顯示,PIGuard在間接提示注入檢測上表現出色,而FlowJudge和GLIDER在函數調用故障檢測上仍力不從心。

來源Hacker News AI作者: TangoBee

AI智能體讓大語言模型超越純文本生成:它們可以調用函數、訪問內外部資源、執行確定性操作,甚至與其他智能體通信。然而,現有的大多數護欄並不是為了保護這些操作而設計的。OWASP和安全研究人員一直在關注智能體系統帶來的風險,包括工具投毒攻擊、工具調用所需推理能力故障的放大,以及來自網頁或向量數據庫的間接提示注入攻擊等。

這涉及“致命三重奏”概念——當LLM獲得工具訪問權限時,風險面會如何演變。工具訪問可能通過連接向量數據庫而暴露私人數據,導致公司機密或個人敏感信息泄露;允許人們用自然語言與系統交互,為新型攻擊開闢了途徑;允許信息來自外部來源,則讓智能體系統必須處理大量不可信內容。因此,不僅要做整體系統評估,還要對每個組件儘可能多地進行威脅壓力測試。

當前多數護欄模型專門訓練用於智能體系統的輸入和輸出,而非其內部運作。這與智能體的構建方式相矛盾。LLM本身可能是黑箱,但智能體系統的數據流並非黑箱。為此,我們構建了any-guardrail,快速測試現成的開源護欄模型。結果發現:一些模型在提示注入檢測上顯示出潛力,但在保護函數調用操作方面仍存在關鍵缺口。

評估設置方面,我們選擇了可能處理分佈外任務的護欄:間接提示注入檢測模型和自定義判斷模型。測試的提示注入檢測模型包括Deepset、PIGuard、Harm Guard、Pangolin、Sentinel、Jasper和ProtectAI;自定義判斷模型包括FlowJudge和GLIDER。提示注入檢測模型都是encoder-only,這大概是因為encoder-only模型不易被越獄,而decoder-only模型易受越獄和提示注入攻擊。FlowJudge和GLIDER則是decoder-only模型,經過多種判斷任務的微調,適合評估函數調用是否正確。

基準數據方面,間接提示注入使用BIPIA基準,它把攻擊嵌入在電子郵件、表格、新聞文章等真實格式中。因為BIPIA只包含攻擊,我們將其與WildGuardMix的良性數據混合,以測試護欄能否區分惡意和良性提示。最終使用BIPIA電子郵件(11250條)和表格(22550條)測試集,以及11248條WildGuardMix良性樣本。函數調用方面,選擇HammerBench,它包含用户與智能體的對話、完整工具列表、智能體選擇的工具,以及基於分類法的“正常/故障”標籤。我們使用單輪數據,共13054條,均勻分佈在Perfect、Imperfect、External和Irrelevant類別中;凡不是“Perfect(相關)”的均視為故障。

在電子郵件數據集的間接提示注入結果中,多個模型呈現“高召回、低精確率”模式——能近乎完美地識別攻擊,但誤報率也高;另一些模型整體表現不佳,各項指標低於0.5;還有少數模型取得了較平衡的精確率和召回率。PIGuard的F1為0.86(精確率0.79,召回率0.96),Sentinel為0.87。在表格數據集中,PIGuard以0.91的F1(精確率0.88,召回率0.94)成為唯一在兩個數據集上都表現穩定且優秀的模型。這表明PIGuard既能有效檢測間接提示注入,又能讓良性提示通過,是當前一個強護欄。

函數調用實驗使用相同的判斷提示詞評估FlowJudge和GLIDER。FlowJudge零樣本的F1僅0.09,GLIDER為0.38,表現都不理想。加入少樣本示例後,FlowJudge的F1提升到0.5,但三次運行的Cohen Kappa僅0.26到0.27,屬於“一般一致性”,可靠性堪憂。定性查看輸出時,同一個數據點在多次運行中得到了不同的解釋和分數,進一步説明結果不穩定。

總結來看,我們的實驗表明,PIGuard是間接提示注入檢測的有效選擇(在BIPIA電子郵件和表格部分均表現良好);而函數調用故障檢測對可定製判斷模型來説仍是一個難題,我們希望未來幾個月能填補這一空白。所有實驗、數據和結果都已公開在GitHub倉庫中,歡迎使用any-guardrail。