2026年9月6日,一篇題為《Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione》(通過動態語義路由校準緩解大語言模型過度拒絕)的論文提交至 arXiv,編號為 arXiv:2609.25049v1 [cs.CL]。該論文由 Zixuan Wang 及另外兩位作者共同完成,投稿於計算與語言(cs.CL)與人工智能(cs.AI)分類,並已被 EMNLP 2026 主會議接收。論文共33頁、含13張圖。提交記錄顯示,論文於2026年9月6日星期日 09:37:56 UTC 上傳,文件大小約為 10,075 KB。該預印本當前位於 cs.CL 的“new”瀏覽條目下,屬於 2026年9月的 recent 範圍,也可切換至 cs 或 cs.AI 瀏覽。arXiv 頁面提供 PDF 全文、實驗性 HTML 版本以及 TeX 源碼,並附有許可證鏈接、DOI 信息(https://doi.org/10.48550/arXiv.2609.25049,由 DataCite 發放)以及引用格式。
論文摘要指出,經過安全對齊的大語言模型(LLM)常常出現“過度拒絕”問題:它們會錯誤地拒絕那些本身良性、但表面上與安全相關的指令。以往研究主要將這一現象歸因於靜態的表示重疊,在很大程度上忽略了其背後的動態機制。本文從 transformer 注意力內部的路由衝突這一視角,對過度拒絕展開機制性分析。作者發現,一個稀疏的“超敏感安全頭”(Hypersensitive Safety Heads)子集會在“Hard-Safe”提示上誤觸發,表現出異常的注意力糾纏,將無害的目標實體強行綁定到拒絕語義上。這會引發嚴重的高熵路由衝突,使目標實體無法獲得必要的注意力。
為對抗這一問題,作者提出“語義路由校準”(Semantic Routing Calibration,SRC),這是一個輕量級、免訓練的推理框架。SRC 在推理階段精確地定位並動態抑制這些超敏感安全頭;同時,配合雙分支 logits 融合,在隨後的解碼過程中充當安全正則化器,從而無縫地恢復可信推理。大量實驗表明,SRC 能夠緩解過度拒絕,並在儘可能的範圍內保留模型的內在安全性能。需要注意的是,摘要中的措辭是“儘可能保留”(as much as feasible),這暗示在實際部署中可能仍存在安全性與可用性之間的權衡,具體實驗設置、評測基準與權衡幅度並未在摘要頁面展開。
該論文的 arXiv 頁面還整合了參考文獻與引文工具,包括 NASA ADS、Google Scholar、Semantic Scholar 等入口,以及 Connected Papers、Litmaps、scite、alphaXiv、CatalyzeX、DagsHub、Hugging Face、ScienceCast、Replicate、Hugging Face Spaces、TXYZ.AI 等第三方服務,便於讀者追蹤論文的引用網絡、代碼與數據、演示與復現資源。頁面同時提供 arXivLabs 介紹——該框架允許合作者直接在 arXiv 網站上開發和分享新功能,參與方需認同開放、社區、卓越與用户數據隱私等價值。論文作者一欄提供了“哪些作者是該論文的背書人”的查詢入口,另有禁用 MathJax 的選項。