本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

動的セマンティックルーティング校正によるLLMの過剰拒否の緩和

記事の要約

安全性のために調整された大規模言語モデルは、安全に関係するように見えるだけの無害な指示まで誤って拒否する「過剰拒否」を起こしやすい。本論文はTransformer注意機構内のルーティング衝突という観点からこの問題を分析し、Hard-Safeプロンプトで誤作動する疎な「過敏な安全ヘッド」を特定する。著者らは訓練不要の推論フレームワークSemantic Routing Calibration(SRC)を提案し、推論時にこれらの安全ヘッドを抑制しつつ、双分岐logits融合で安全性を正則化する。実験では過剰拒否を緩和し、固有の安全性能を可能な限り維持した。EMNLP 2026本会議に採択され、33ページ・13図。

ソースarXiv Computational Linguistics著者: Zixuan Wang, Bingjie Zhang, He Zhao, Dandan Guo
動的セマンティックルーティング校正によるLLMの過剰拒否の緩和
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

安全性を重視して調整された大規模言語モデル(LLM)は、本来は無害であるにもかかわらず、安全に関係しそうに見える指示を誤って拒否することがある。この「過剰拒否」は、モデルの使い勝手を損ない、正常な情報提供や良性のタスク遂行を妨げる。従来研究の多くは、安全に関わる表現と通常の意味表現が静的に重なることを原因としてきたが、本論文はその説明がモデル内部の動的な機構を見落としていると指摘する。

論文は、Transformerの注意機構に生じる内部的なルーティング衝突という視点から、過剰拒否のメカニズムを分析する。研究チームは、モデル内に「過敏な安全ヘッド(Hypersensitive Safety Heads)」と呼ぶ疎な部分集合が存在し、これがHard-Safeプロンプトで誤作動することを見いだした。これらのヘッドは異常な注意の絡みを生じさせ、無害な対象エンティティを強制的に拒否の意味論へ結びつける。その結果、深刻で高エントロピーなルーティング衝突が起こり、対象エンティティが必要な注意を受け取れなくなる。

この問題に対処するため、著者らはSemantic Routing Calibration(SRC)を提案する。SRCは軽量かつ訓練不要の推論フレームワークであり、再訓練や微調整を必要としない。推論段階で過敏な安全ヘッドを正確に特定し、動的に抑制することで過剰拒否を減らす。一方で、安全ヘッドの抑制は安全性を損なう懸念があるため、SRCは双分岐logits融合を導入し、その後のデコーディングで安全正則化として働かせる。これにより、信頼できる推論を取り戻しつつ、安全境界をできる限り維持する。

実験では、SRCが過剰拒否を緩和し、内在する安全性能を可能な限り保持することが示された。要旨が「as much as feasible」と述べているように、安全性と有用性の間には依然としてトレードオフの余地がある。本論文はEMNLP 2026本会議に採択され、33ページ・13図からなる。著者はZixuan Wang氏ら3名で、2026年9月6日にarXivへ投稿された。arXiv番号はarXiv:2609.25049v1で、cs.CLおよびcs.AIに分類されている。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 過剰拒否の従来説明は静的な表現重なりに偏り、動的な内部機構を見落としてきた。
  • 疎なHypersensitive Safety HeadsがHard-Safeプロンプトで異常な注意の絡みを起こし、無害な対象を拒否意味論に結びつける。
  • 訓練不要のSRCは推論時に過敏な安全ヘッドを局所化・動的抑制し、双分岐logits融合で安全正則化を行う。
  • 実験では過剰拒否を緩和しつつ、内在する安全性能を可能な限り保持。EMNLP 2026本会議採択。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。