2026年9月6日,一篇题为《Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione》(通过动态语义路由校准缓解大语言模型过度拒绝)的论文提交至 arXiv,编号为 arXiv:2609.25049v1 [cs.CL]。该论文由 Zixuan Wang 及另外两位作者共同完成,投稿于计算与语言(cs.CL)与人工智能(cs.AI)分类,并已被 EMNLP 2026 主会议接收。论文共33页、含13张图。提交记录显示,论文于2026年9月6日星期日 09:37:56 UTC 上传,文件大小约为 10,075 KB。该预印本当前位于 cs.CL 的“new”浏览条目下,属于 2026年9月的 recent 范围,也可切换至 cs 或 cs.AI 浏览。arXiv 页面提供 PDF 全文、实验性 HTML 版本以及 TeX 源码,并附有许可证链接、DOI 信息(https://doi.org/10.48550/arXiv.2609.25049,由 DataCite 发放)以及引用格式。
论文摘要指出,经过安全对齐的大语言模型(LLM)常常出现“过度拒绝”问题:它们会错误地拒绝那些本身良性、但表面上与安全相关的指令。以往研究主要将这一现象归因于静态的表示重叠,在很大程度上忽略了其背后的动态机制。本文从 transformer 注意力内部的路由冲突这一视角,对过度拒绝展开机制性分析。作者发现,一个稀疏的“超敏感安全头”(Hypersensitive Safety Heads)子集会在“Hard-Safe”提示上误触发,表现出异常的注意力纠缠,将无害的目标实体强行绑定到拒绝语义上。这会引发严重的高熵路由冲突,使目标实体无法获得必要的注意力。
为对抗这一问题,作者提出“语义路由校准”(Semantic Routing Calibration,SRC),这是一个轻量级、免训练的推理框架。SRC 在推理阶段精确地定位并动态抑制这些超敏感安全头;同时,配合双分支 logits 融合,在随后的解码过程中充当安全正则化器,从而无缝地恢复可信推理。大量实验表明,SRC 能够缓解过度拒绝,并在尽可能的范围内保留模型的内在安全性能。需要注意的是,摘要中的措辞是“尽可能保留”(as much as feasible),这暗示在实际部署中可能仍存在安全性与可用性之间的权衡,具体实验设置、评测基准与权衡幅度并未在摘要页面展开。
该论文的 arXiv 页面还整合了参考文献与引文工具,包括 NASA ADS、Google Scholar、Semantic Scholar 等入口,以及 Connected Papers、Litmaps、scite、alphaXiv、CatalyzeX、DagsHub、Hugging Face、ScienceCast、Replicate、Hugging Face Spaces、TXYZ.AI 等第三方服务,便于读者追踪论文的引用网络、代码与数据、演示与复现资源。页面同时提供 arXivLabs 介绍——该框架允许合作者直接在 arXiv 网站上开发和分享新功能,参与方需认同开放、社区、卓越与用户数据隐私等价值。论文作者一栏提供了“哪些作者是该论文的背书人”的查询入口,另有禁用 MathJax 的选项。