跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

通过动态语义路由校准缓解大语言模型的过度拒绝

文章摘要

安全对齐的大语言模型常出现过度拒绝,错误地拒绝良性但涉及安全主题的指令。该论文从Transformer注意力内部的路由冲突切入,发现稀疏的“超敏感安全头”在Hard-Safe提示上误触发,导致高熵路由冲突;作者提出免训练的语义路由校准(SRC),在推理时抑制这些安全头,并配合双分支logits融合,在尽量保留安全性能的同时缓解过度拒绝。论文被EMNLP 2026主会接收,共33页、13张图。

来源arXiv Computational Linguistics作者: Zixuan Wang, Bingjie Zhang, He Zhao, Dandan Guo
通过动态语义路由校准缓解大语言模型的过度拒绝
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

2026年9月6日,一篇题为《Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione》(通过动态语义路由校准缓解大语言模型过度拒绝)的论文提交至 arXiv,编号为 arXiv:2609.25049v1 [cs.CL]。该论文由 Zixuan Wang 及另外两位作者共同完成,投稿于计算与语言(cs.CL)与人工智能(cs.AI)分类,并已被 EMNLP 2026 主会议接收。论文共33页、含13张图。提交记录显示,论文于2026年9月6日星期日 09:37:56 UTC 上传,文件大小约为 10,075 KB。该预印本当前位于 cs.CL 的“new”浏览条目下,属于 2026年9月的 recent 范围,也可切换至 cs 或 cs.AI 浏览。arXiv 页面提供 PDF 全文、实验性 HTML 版本以及 TeX 源码,并附有许可证链接、DOI 信息(https://doi.org/10.48550/arXiv.2609.25049,由 DataCite 发放)以及引用格式。

论文摘要指出,经过安全对齐的大语言模型(LLM)常常出现“过度拒绝”问题:它们会错误地拒绝那些本身良性、但表面上与安全相关的指令。以往研究主要将这一现象归因于静态的表示重叠,在很大程度上忽略了其背后的动态机制。本文从 transformer 注意力内部的路由冲突这一视角,对过度拒绝展开机制性分析。作者发现,一个稀疏的“超敏感安全头”(Hypersensitive Safety Heads)子集会在“Hard-Safe”提示上误触发,表现出异常的注意力纠缠,将无害的目标实体强行绑定到拒绝语义上。这会引发严重的高熵路由冲突,使目标实体无法获得必要的注意力。

为对抗这一问题,作者提出“语义路由校准”(Semantic Routing Calibration,SRC),这是一个轻量级、免训练的推理框架。SRC 在推理阶段精确地定位并动态抑制这些超敏感安全头;同时,配合双分支 logits 融合,在随后的解码过程中充当安全正则化器,从而无缝地恢复可信推理。大量实验表明,SRC 能够缓解过度拒绝,并在尽可能的范围内保留模型的内在安全性能。需要注意的是,摘要中的措辞是“尽可能保留”(as much as feasible),这暗示在实际部署中可能仍存在安全性与可用性之间的权衡,具体实验设置、评测基准与权衡幅度并未在摘要页面展开。

该论文的 arXiv 页面还整合了参考文献与引文工具,包括 NASA ADS、Google Scholar、Semantic Scholar 等入口,以及 Connected Papers、Litmaps、scite、alphaXiv、CatalyzeX、DagsHub、Hugging Face、ScienceCast、Replicate、Hugging Face Spaces、TXYZ.AI 等第三方服务,便于读者追踪论文的引用网络、代码与数据、演示与复现资源。页面同时提供 arXivLabs 介绍——该框架允许合作者直接在 arXiv 网站上开发和分享新功能,参与方需认同开放、社区、卓越与用户数据隐私等价值。论文作者一栏提供了“哪些作者是该论文的背书人”的查询入口,另有禁用 MathJax 的选项。

展开要点与分析

文章情报

工程师进阶

要点

  • 过度拒绝的既有解释多停留在静态表征重叠,本文转向注意力内部动态路由冲突。
  • 识别出稀疏的Hypersensitive Safety Heads在Hard-Safe提示上异常纠缠,把无害目标实体绑定到拒绝语义。
  • 提出免训练推理框架SRC:定位并动态抑制超敏感安全头,并用双分支logits融合充当安全正则器。
  • 实验显示SRC缓解过度拒绝,同时尽可能保留内在安全性能;论文获EMNLP 2026主会接收。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。