選擇在哪裡以及如何稽核:過濾器放置和響應重寫的端到端權衡
該研究評估了內容稽核中不同干預位置和響應重寫的端到端效果,提出了有用性和有害暴露兩個客戶結果指標。結果表明,僅響應過濾在僅過濾場景下有用性最高,而輸入+響應硬阻塞有害暴露最低。響應重寫可以恢復大部分被阻塞流量且不增加有害暴露。探針路由相比LLM路由顯著降低延遲。重寫透過泛化觸發語言平衡過濾器透過率和有用性,但在敏感領域可能遺漏安全支援資訊。研究支援根據部署場景制定稽核策略。
內容稽核分類器通常在孤立環境中評估其準確性,但在實際部署中,如何選擇干預位置以及在觸發標記後採取何種後續處理,對使用者體驗和安全性產生直接影響。微軟研究院Mengya Hu等人發表的預印本論文《Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting》系統評估了不同稽核配置的端到端效果,提出了兩個以客戶結果為導向的評估指標:有用性(Usefulness)和有害暴露(Harmful Exposure)。有用性定義為在對話中顯示非有害且相關響應的輪次比例;有害暴露則定義為顯示有害響應的輪次比例。研究還引入延遲和錯誤率作為診斷指標。
研究團隊在人工標註的產品基準和公開的ToxicChat資料集上,對比了三種硬阻塞策略:僅輸入過濾(Input only)、僅響應過濾(Response only)以及輸入+響應過濾(Input+response)。實驗結果顯示,在僅過濾的場景下,僅響應過濾在有用性上表現最佳,而輸入+響應過濾則實現了最低的有害暴露。這一發現表明,不同的過濾位置對最終效果有顯著影響。
進一步地,研究探討了響應重寫作為替代方案的效果。當用響應重寫代替僅響應阻塞時,大部分原本被阻塞的流量得以恢復,且有害暴露計數與僅響應阻塞相同。但研究人員強調,這種相等並不意味著兩種策略等價,因為重寫可能會改變響應的內容細節。為了降低延遲,論文引入了探針路由(Probe routing),與LLM路由相比,在可比測量結果下,探針路由顯著減少了條件路由和生成時間。
對輸出內容的深入審查顯示,重寫機制透過泛化觸發語言,同時保留良性意圖和安全重定向,在過濾器透過率和有用性之間取得了平衡。然而,在部分敏感領域,重寫後的輸出可能遺漏了潛在的安全支援資訊。這些結果支援根據部署場景的具體安全和延遲約束來比較稽核配置,而不是應用通用的規則。論文的程式碼和公共資源已釋出在GitHub上。