跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

通過動態語義路由校準緩解大語言模型的過度拒絕

文章摘要

安全對齊的大語言模型常出現過度拒絕,錯誤地拒絕良性但涉及安全主題的指令。該論文從Transformer注意力內部的路由衝突切入,發現稀疏的“超敏感安全頭”在Hard-Safe提示上誤觸發,導致高熵路由衝突;作者提出免訓練的語義路由校準(SRC),在推理時抑制這些安全頭,並配合雙分支logits融合,在儘量保留安全性能的同時緩解過度拒絕。論文被EMNLP 2026主會接收,共33頁、13張圖。

來源arXiv Computational Linguistics作者: Zixuan Wang, Bingjie Zhang, He Zhao, Dandan Guo
通過動態語義路由校準緩解大語言模型的過度拒絕
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

2026年9月6日,一篇題為《Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione》(通過動態語義路由校準緩解大語言模型過度拒絕)的論文提交至 arXiv,編號為 arXiv:2609.25049v1 [cs.CL]。該論文由 Zixuan Wang 及另外兩位作者共同完成,投稿於計算與語言(cs.CL)與人工智能(cs.AI)分類,並已被 EMNLP 2026 主會議接收。論文共33頁、含13張圖。提交記錄顯示,論文於2026年9月6日星期日 09:37:56 UTC 上傳,文件大小約為 10,075 KB。該預印本當前位於 cs.CL 的“new”瀏覽條目下,屬於 2026年9月的 recent 範圍,也可切換至 cs 或 cs.AI 瀏覽。arXiv 頁面提供 PDF 全文、實驗性 HTML 版本以及 TeX 源碼,並附有許可證鏈接、DOI 信息(https://doi.org/10.48550/arXiv.2609.25049,由 DataCite 發放)以及引用格式。

論文摘要指出,經過安全對齊的大語言模型(LLM)常常出現“過度拒絕”問題:它們會錯誤地拒絕那些本身良性、但表面上與安全相關的指令。以往研究主要將這一現象歸因於靜態的表示重疊,在很大程度上忽略了其背後的動態機制。本文從 transformer 注意力內部的路由衝突這一視角,對過度拒絕展開機制性分析。作者發現,一個稀疏的“超敏感安全頭”(Hypersensitive Safety Heads)子集會在“Hard-Safe”提示上誤觸發,表現出異常的注意力糾纏,將無害的目標實體強行綁定到拒絕語義上。這會引發嚴重的高熵路由衝突,使目標實體無法獲得必要的注意力。

為對抗這一問題,作者提出“語義路由校準”(Semantic Routing Calibration,SRC),這是一個輕量級、免訓練的推理框架。SRC 在推理階段精確地定位並動態抑制這些超敏感安全頭;同時,配合雙分支 logits 融合,在隨後的解碼過程中充當安全正則化器,從而無縫地恢復可信推理。大量實驗表明,SRC 能夠緩解過度拒絕,並在儘可能的範圍內保留模型的內在安全性能。需要注意的是,摘要中的措辭是“儘可能保留”(as much as feasible),這暗示在實際部署中可能仍存在安全性與可用性之間的權衡,具體實驗設置、評測基準與權衡幅度並未在摘要頁面展開。

該論文的 arXiv 頁面還整合了參考文獻與引文工具,包括 NASA ADS、Google Scholar、Semantic Scholar 等入口,以及 Connected Papers、Litmaps、scite、alphaXiv、CatalyzeX、DagsHub、Hugging Face、ScienceCast、Replicate、Hugging Face Spaces、TXYZ.AI 等第三方服務,便於讀者追蹤論文的引用網絡、代碼與數據、演示與復現資源。頁面同時提供 arXivLabs 介紹——該框架允許合作者直接在 arXiv 網站上開發和分享新功能,參與方需認同開放、社區、卓越與用户數據隱私等價值。論文作者一欄提供了“哪些作者是該論文的背書人”的查詢入口,另有禁用 MathJax 的選項。

展開要點與分析

文章情報

工程師進階

要點

  • 過度拒絕的既有解釋多停留在靜態表徵重疊,本文轉向注意力內部動態路由衝突。
  • 識別出稀疏的Hypersensitive Safety Heads在Hard-Safe提示上異常糾纏,把無害目標實體綁定到拒絕語義。
  • 提出免訓練推理框架SRC:定位並動態抑制超敏感安全頭,並用雙分支logits融合充當安全正則器。
  • 實驗顯示SRC緩解過度拒絕,同時儘可能保留內在安全性能;論文獲EMNLP 2026主會接收。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。