AI News HubLIVE
站內改寫2 分鐘閱讀

面向多輪對話大語言模型系統的狀態化護欄:對話風險累積框架

現有大語言模型安全護欄僅獨立評估每輪對話,忽略了對話過程中良性輪次累積導致的危害。本文提出對話風險累積(CRA)概念及會話層框架,跟蹤語義漂移、敏感資訊累積和順從度梯度三個軌跡訊號,併發布CRA-Bench基準和評估協議。

來源arXiv Computational Linguistics作者: Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

現有的大語言模型(LLM)安全護欄通常獨立評估每個提示-響應對,這忽略了在多輪對話中,多個看似無害的輪次組合起來可能產生危害的情況。研究人員將這種現象稱為“對話風險累積”(Conversational Risk Accumulation, CRA),具體表現為逐步的意圖漂移、禁止指令的碎片化組裝,以及因重複披露而產生的敏感度累積。意圖漂移是指使用者透過一系列逐漸偏移的提問,繞開模型的安全限制;禁止指令的碎片化組裝則是將違禁指令分散在多個輪次中,使模型在不知不覺中執行;敏感度累積源於模型在多次互動中逐步透露更多敏感資訊。這些風險在單輪評估中完全不可見,因此需要新的框架來捕捉會話層面的動態威脅。

為了應對這一挑戰,該論文提出了一種會話層CRA框架。該框架跟蹤三個關鍵的軌跡訊號:與會話錨點的語義漂移、基於提取實體的敏感加權資訊累積圖,以及反映模型順從意願遞增的順從度梯度訊號。語義漂移訊號檢測當前對話與初始錨點之間的語義距離變化,當距離超過閾值時觸發警報;資訊累積圖構建對話中提取的實體及其敏感權重,跟蹤敏感資訊的累積量;順從度梯度透過分析模型在連續輪次中違反安全規則的傾向性,預測即將發生的違規行為。在評分方面,研究者提供了兩種方法:一種無監督的凸融合方法用於歸因和消融,以及CRA-Net DA,一種緊湊的基於學習的軌跡模型,透過家族對抗目標訓練以減少長度和主題覆蓋混淆。CRA-Net DA採用輕量級架構,能夠在保持高檢測精度的同時降低計算開銷。

為了對CRA進行基準測試,研究者釋出了CRA-Bench v0.1(包含1200個八輪會話,涵蓋三個威脅家族,並配有主題匹配的良性孿生會話)、CRA-Bench v0.2(透過LLM改寫變體以減少模板偽影),以及一個擴充套件的5家族集(增加2000個會話,加入角色預設和上下文填充)。三個威脅家族包括:意圖漂移(使用者逐漸改變話題)、碎片化指令(將禁止操作拆解為多步)、敏感資訊累積(逐步追問個人資訊)。良性孿生會話用於校準檢測假陽性率。為了全面評估,論文引入了一套軌跡原生評估協議,包括會話級分割、混合集閾值校準、軌跡AUROC、檢測輪次、校準假陽性指標、自助置信區間、留一族診斷壓力測試,以及合成到人類轉移檢查。軌跡AUROC評估模型在整個會話軌跡上的判別能力,檢測輪次則衡量風險暴露的時間視窗。

該研究主要關注在CRA-Bench和人類轉移子集上的分佈內會話評分。實驗結果表明,CRA框架能夠有效檢測多輪會話中的累積風險,在保持低假陽性率的同時實現高檢測率。CRA-Net DA在軌跡AUROC指標上顯著優於基線方法,且對不同威脅家族具有魯棒性。這一工作為多輪LLM系統的安全性評估提供了新的視角和工具,有助於檢測那些在單輪評估中難以發現的累積性風險,對構建更安全的對話AI系統具有重要價值。