选择在哪里以及如何审核:过滤器放置和响应重写的端到端权衡
该研究评估了内容审核中不同干预位置和响应重写的端到端效果,提出了有用性和有害暴露两个客户结果指标。结果表明,仅响应过滤在仅过滤场景下有用性最高,而输入+响应硬阻塞有害暴露最低。响应重写可以恢复大部分被阻塞流量且不增加有害暴露。探针路由相比LLM路由显著降低延迟。重写通过泛化触发语言平衡过滤器通过率和有用性,但在敏感领域可能遗漏安全支持信息。研究支持根据部署场景制定审核策略。
内容审核分类器通常在孤立环境中评估其准确性,但在实际部署中,如何选择干预位置以及在触发标记后采取何种后续处理,对用户体验和安全性产生直接影响。微软研究院Mengya Hu等人发表的预印本论文《Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting》系统评估了不同审核配置的端到端效果,提出了两个以客户结果为导向的评估指标:有用性(Usefulness)和有害暴露(Harmful Exposure)。有用性定义为在对话中显示非有害且相关响应的轮次比例;有害暴露则定义为显示有害响应的轮次比例。研究还引入延迟和错误率作为诊断指标。
研究团队在人工标注的产品基准和公开的ToxicChat数据集上,对比了三种硬阻塞策略:仅输入过滤(Input only)、仅响应过滤(Response only)以及输入+响应过滤(Input+response)。实验结果显示,在仅过滤的场景下,仅响应过滤在有用性上表现最佳,而输入+响应过滤则实现了最低的有害暴露。这一发现表明,不同的过滤位置对最终效果有显著影响。
进一步地,研究探讨了响应重写作为替代方案的效果。当用响应重写代替仅响应阻塞时,大部分原本被阻塞的流量得以恢复,且有害暴露计数与仅响应阻塞相同。但研究人员强调,这种相等并不意味着两种策略等价,因为重写可能会改变响应的内容细节。为了降低延迟,论文引入了探针路由(Probe routing),与LLM路由相比,在可比测量结果下,探针路由显著减少了条件路由和生成时间。
对输出内容的深入审查显示,重写机制通过泛化触发语言,同时保留良性意图和安全重定向,在过滤器通过率和有用性之间取得了平衡。然而,在部分敏感领域,重写后的输出可能遗漏了潜在的安全支持信息。这些结果支持根据部署场景的具体安全和延迟约束来比较审核配置,而不是应用通用的规则。论文的代码和公共资源已发布在GitHub上。