AI News HubLIVE
站內改寫2 分鐘閱讀

為AI智慧體安全護欄進行基準測試

本文對開源AI智慧體安全護欄進行基準測試:在BIPIA上測試提示注入檢測模型,在HammerBench上測試函式呼叫判斷模型。結果顯示,PIGuard在間接提示注入檢測上表現出色,而FlowJudge和GLIDER在函式呼叫故障檢測上仍力不從心。

來源Hacker News AI作者: TangoBee

AI智慧體讓大語言模型超越純文本生成:它們可以呼叫函式、訪問內外部資源、執行確定性操作,甚至與其他智慧體通訊。然而,現有的大多數護欄並不是為了保護這些操作而設計的。OWASP和安全研究人員一直在關注智慧體系統帶來的風險,包括工具投毒攻擊、工具呼叫所需推理能力故障的放大,以及來自網頁或向量資料庫的間接提示注入攻擊等。

這涉及“致命三重奏”概念——當LLM獲得工具訪問許可權時,風險面會如何演變。工具訪問可能透過連線向量資料庫而暴露私人資料,導致公司機密或個人敏感資訊洩露;允許人們用自然語言與系統互動,為新型攻擊開闢了途徑;允許資訊來自外部來源,則讓智慧體系統必須處理大量不可信內容。因此,不僅要做整體系統評估,還要對每個元件儘可能多地進行威脅壓力測試。

當前多數護欄模型專門訓練用於智慧體系統的輸入和輸出,而非其內部運作。這與智慧體的構建方式相矛盾。LLM本身可能是黑箱,但智慧體系統的資料流並非黑箱。為此,我們構建了any-guardrail,快速測試現成的開源護欄模型。結果發現:一些模型在提示注入檢測上顯示出潛力,但在保護函式呼叫操作方面仍存在關鍵缺口。

評估設定方面,我們選擇了可能處理分佈外任務的護欄:間接提示注入檢測模型和自定義判斷模型。測試的提示注入檢測模型包括Deepset、PIGuard、Harm Guard、Pangolin、Sentinel、Jasper和ProtectAI;自定義判斷模型包括FlowJudge和GLIDER。提示注入檢測模型都是encoder-only,這大概是因為encoder-only模型不易被越獄,而decoder-only模型易受越獄和提示注入攻擊。FlowJudge和GLIDER則是decoder-only模型,經過多種判斷任務的微調,適合評估函式呼叫是否正確。

基準資料方面,間接提示注入使用BIPIA基準,它把攻擊嵌入在電子郵件、表格、新聞文章等真實格式中。因為BIPIA只包含攻擊,我們將其與WildGuardMix的良性資料混合,以測試護欄能否區分惡意和良性提示。最終使用BIPIA電子郵件(11250條)和表格(22550條)測試集,以及11248條WildGuardMix良性樣本。函式呼叫方面,選擇HammerBench,它包含使用者與智慧體的對話、完整工具列表、智慧體選擇的工具,以及基於分類法的“正常/故障”標籤。我們使用單輪資料,共13054條,均勻分佈在Perfect、Imperfect、External和Irrelevant類別中;凡不是“Perfect(相關)”的均視為故障。

在電子郵件資料集的間接提示注入結果中,多個模型呈現“高召回、低精確率”模式——能近乎完美地識別攻擊,但誤報率也高;另一些模型整體表現不佳,各項指標低於0.5;還有少數模型取得了較平衡的精確率和召回率。PIGuard的F1為0.86(精確率0.79,召回率0.96),Sentinel為0.87。在表格資料集中,PIGuard以0.91的F1(精確率0.88,召回率0.94)成為唯一在兩個資料集上都表現穩定且優秀的模型。這表明PIGuard既能有效檢測間接提示注入,又能讓良性提示透過,是當前一個強護欄。

函式呼叫實驗使用相同的判斷提示詞評估FlowJudge和GLIDER。FlowJudge零樣本的F1僅0.09,GLIDER為0.38,表現都不理想。加入少樣本示例後,FlowJudge的F1提升到0.5,但三次執行的Cohen Kappa僅0.26到0.27,屬於“一般一致性”,可靠性堪憂。定性檢視輸出時,同一個資料點在多次執行中得到了不同的解釋和分數,進一步說明結果不穩定。

總結來看,我們的實驗表明,PIGuard是間接提示注入檢測的有效選擇(在BIPIA電子郵件和表格部分均表現良好);而函式呼叫故障檢測對可定製判斷模型來說仍是一個難題,我們希望未來幾個月能填補這一空白。所有實驗、資料和結果都已公開在GitHub倉庫中,歡迎使用any-guardrail。