AI News HubLIVE
站内改写1 分钟阅读

在推理时引导指令层级

一种名为V-Steer的新方法通过在推理时编辑缓存的值向量来强制执行语言模型中的指令层级,在角色冲突基准测试中将主要约束准确率从不足18%提升到92%,且无需训练。

来源arXiv Computational Linguistics作者: Siqi Zeng, Sewoong Lee, Han Zhao, Julia Hockenmaier

大型语言模型(LLM)在部署时依赖于指令层级的安全假设:系统提示等更高优先级的输入应覆盖来自用户或工具的冲突低优先级输入。然而,前沿模型经常违反这一层级,导致潜在的安全风险。针对这一问题,来自COLM '26的一篇论文提出了V-Steer,一种无需训练的推理时方法,通过编辑提示位置的缓存值向量来恢复特权影响力。

V-Steer的核心机制是利用第一个下一个标记预测上的直接logit归因,识别出低优先级片段占据主导的注意力头。然后,通过就地乘法编辑缓存的值张量,该方法能够提升特权片段并抑制冲突的低优先级片段。由于V-Steer仅作用于缓存的值,它与融合注意力后端完全兼容,并且只增加一次预填充开销,解码速度的影响几乎可以忽略不计。

在从7B到70B的模型上进行的实验中,这种归因引导的干预在受控角色冲突基准上将主要约束准确率从低于18%提升至92%。在更广泛的指令层级评估中,V-Steer显著优于仅使用提示的基线方法,并在LLM的四个规模中的三个上匹配或超越了最先进的基于训练的方法,同时保持了解码速度的无明显开销。

该论文由Siqi Zeng等人撰写,已在GitHub上开源代码(https://github.com/cindy2000sh/v-steer),为社区提供了实用的工具来改善LLM的指令遵守能力。这一方法不仅提高了模型的安全性,还为未来无需额外训练即可增强LLM可靠性的研究开辟了新途径。