LLMは制約を知っているが使わない:語用論的制約推論における活性化ボトルネック
本論文は、顕著な表面的手がかりと暗黙の実現可能性制約が競合するとき、LLMの失敗は知識不足ではなく、符号化された制約を意思決定にルーティングできないことに起因すると主張する。条件付き制約活性化フレームワークと14モデルでの実験により、隠れ制約の失敗は知識問題ではなくルーティング問題であり、既存のプロンプト介入は保守バイアスを強めるだけだと示す。
大規模言語モデル(LLM)は、顕著な表面的手がかりと暗黙の実現可能性制約が競合する問題でしばしば誤答する。従来の研究はこの失敗を「モデルが制約を理解していない」と説明することが多かったが、新しい論文は、モデルは制約を知っているのに、意思決定の際にそれを利用していないと主張する。この研究は2026年5月29日にarXiv(番号2608.12321)へ投稿され、著者はYubo Li氏ら3名。タイトルは「LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning」である。
論文の中心は「条件付き制約活性化」(conditional constraint activation)という枠組みだ。制約推論を、知識(Knowledge:制約が内部に符号化されているか)、対称性(Symmetry:制約があるプロンプトとないプロンプトでその符号化が一貫しているか)、ルーティング(Routing:符号化された制約が最終的な判断に使われるか)、修復(Repair:外部からの活性化で正しい振る舞いを回復できるか)という4つの要素に分解する。また、平均正解率だけを見ると、真の制約推論と保守的なデフォルト(conservative defaulting)を混同してしまうと指摘する。
研究では14のモデルに対して4重診断を行い、2種類の失敗モードを特定した。2つのオープンウェイトモデルに対するプローブ実験では、制約情報が内部表現に88%以上の精度でデコード可能な形で存在していた。しかし、活性化パッチング(activation patching)の結果は対照的で、一方の失敗モードは+6.4 natsと大きく改善したのに対し、他方は-0.07 natsとほぼ改善が見られなかった。つまり、制約の知識は確かに存在するが、必ずしも決定経路にルーティングされていない。
さらに、緩和策の限界も明らかになった。さまざまなプロンプト介入を試みる「緩和フロンティア」を構築したところ、どの介入も修復ポイントに到達しなかった。介入はすべて「前提言及」(prerequisite mention)という単一の媒介経路を通じて保守バイアスを強めるだけだった。著者らは、隠れ制約の失敗は知識問題ではなくルーティング問題だと結論づけている。この発見は、モデルの内部情報がどう利用されるかに注目すべきだという点で、解釈可能性やアライメント研究に重要な示唆を与える。