NEXUS:面向工具使用LLM代理的結構化執行時安全監控
NEXUS是一個結構化計劃安全監控器,結合確定性安全規則、引數級檢查和校準的邏輯迴歸風險評分,對LLM代理執行四種干預措施:允許、阻止、請求確認或請求修訂。在多個基準測試中,NEXUS表現出色,F1分數高達0.949,延遲僅0.205毫秒。
隨著大型語言模型(LLM)代理越來越多地執行高風險操作,例如自動交易、軟體部署和敏感資料訪問,執行時安全監控變得至關重要。傳統的基於規則的安全系統往往過於僵化,無法處理代理行為的多樣性和複雜性。NEXUS(神經執行效用與安全)系統提出了一種結構化計劃安全監控器,它應用正式干預策略,能夠從四個動作中選擇一個:允許、阻止、請求確認或請求修訂。這種分級干預方式使得系統可以在必要時阻止危險操作,同時避免過度阻塞合法行為。
NEXUS結合了確定性安全規則、引數級檢查以及校準的邏輯迴歸風險評分。確定性規則可以快速捕獲已知的高風險模式,而引數級檢查則對每個函式呼叫的引數進行細緻驗證。風險評分器透過邏輯迴歸模型對歷史資料進行校準,從而對未見過的模式進行風險評估。這種混合方法實現了分級升級:對於低風險操作,系統可能直接允許;對於中風險操作,可能請求使用者確認;對於高風險操作,則直接阻止或請求修改。
在效能評估中,NEXUS在多個基準測試中展現了強大的結果。在一個包含128個例項的合成基準上,NEXUS的F1分數達到0.949,四類干預準確率為0.6406,比純規則干預選擇提高了27.3個百分點。在R-Judge基準上,NEXUS的F1分數為0.861,優於純規則的0.849。在AgentHarm基準上,由於威脅模型的限制,NEXUS與純規則持平。在IPI基準上,NEXUS實現了0%的攻擊成功率,同時保持了99%的控制允許率。此外,在專門設計用於測試規則盲場景的NEXUS-Stress基準上,NEXUS的F1分數為0.881,這充分說明了細粒度干預路由的難度。
在效率方面,NEXUS的中位延遲僅為0.205毫秒,對典型代理迴圈的額外開銷低於0.1%,這使得它非常適合即時應用。程式碼、基準測試和校準的風險評分器均已公開發布,為研究人員和工程師提供了重要的工具。該工作為LLM代理的安全部署提供了一種高效且可擴充套件的解決方案,有望在未來的AI系統中發揮關鍵作用。