AI News HubLIVE
站内改写2 分钟阅读

面向多轮对话大语言模型系统的状态化护栏:对话风险累积框架

现有大语言模型安全护栏仅独立评估每轮对话,忽略了对话过程中良性轮次累积导致的危害。本文提出对话风险累积(CRA)概念及会话层框架,跟踪语义漂移、敏感信息累积和顺从度梯度三个轨迹信号,并发布CRA-Bench基准和评估协议。

来源arXiv Computational Linguistics作者: Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

现有的大语言模型(LLM)安全护栏通常独立评估每个提示-响应对,这忽略了在多轮对话中,多个看似无害的轮次组合起来可能产生危害的情况。研究人员将这种现象称为“对话风险累积”(Conversational Risk Accumulation, CRA),具体表现为逐步的意图漂移、禁止指令的碎片化组装,以及因重复披露而产生的敏感度累积。意图漂移是指用户通过一系列逐渐偏移的提问,绕开模型的安全限制;禁止指令的碎片化组装则是将违禁指令分散在多个轮次中,使模型在不知不觉中执行;敏感度累积源于模型在多次交互中逐步透露更多敏感信息。这些风险在单轮评估中完全不可见,因此需要新的框架来捕捉会话层面的动态威胁。

为了应对这一挑战,该论文提出了一种会话层CRA框架。该框架跟踪三个关键的轨迹信号:与会话锚点的语义漂移、基于提取实体的敏感加权信息累积图,以及反映模型顺从意愿递增的顺从度梯度信号。语义漂移信号检测当前对话与初始锚点之间的语义距离变化,当距离超过阈值时触发警报;信息累积图构建对话中提取的实体及其敏感权重,跟踪敏感信息的累积量;顺从度梯度通过分析模型在连续轮次中违反安全规则的倾向性,预测即将发生的违规行为。在评分方面,研究者提供了两种方法:一种无监督的凸融合方法用于归因和消融,以及CRA-Net DA,一种紧凑的基于学习的轨迹模型,通过家族对抗目标训练以减少长度和主题覆盖混淆。CRA-Net DA采用轻量级架构,能够在保持高检测精度的同时降低计算开销。

为了对CRA进行基准测试,研究者发布了CRA-Bench v0.1(包含1200个八轮会话,涵盖三个威胁家族,并配有主题匹配的良性孪生会话)、CRA-Bench v0.2(通过LLM改写变体以减少模板伪影),以及一个扩展的5家族集(增加2000个会话,加入角色预设和上下文填充)。三个威胁家族包括:意图漂移(用户逐渐改变话题)、碎片化指令(将禁止操作拆解为多步)、敏感信息累积(逐步追问个人信息)。良性孪生会话用于校准检测假阳性率。为了全面评估,论文引入了一套轨迹原生评估协议,包括会话级分割、混合集阈值校准、轨迹AUROC、检测轮次、校准假阳性指标、自助置信区间、留一族诊断压力测试,以及合成到人类转移检查。轨迹AUROC评估模型在整个会话轨迹上的判别能力,检测轮次则衡量风险暴露的时间窗口。

该研究主要关注在CRA-Bench和人类转移子集上的分布内会话评分。实验结果表明,CRA框架能够有效检测多轮会话中的累积风险,在保持低假阳性率的同时实现高检测率。CRA-Net DA在轨迹AUROC指标上显著优于基线方法,且对不同威胁家族具有鲁棒性。这一工作为多轮LLM系统的安全性评估提供了新的视角和工具,有助于检测那些在单轮评估中难以发现的累积性风险,对构建更安全的对话AI系统具有重要价值。