LLM知道約束條件卻不使用:語用約束推理中的啟用瓶頸
這篇論文指出,大語言模型在表面線索與隱性可行性約束衝突時失敗,並非因為不知道約束,而是未能將已編碼的約束路由到決策中。作者提出條件約束啟用框架,透過14個模型的四重診斷和啟用修補實驗表明,隱藏約束失敗是路由問題而非知識問題,現有提示干預無法真正修復,反而會加劇保守偏差。
大語言模型(LLM)在面對顯著表面線索與隱性可行性約束相互競爭的問題時,常常給出錯誤答案。以往研究多把這類失敗歸因於模型不理解約束,但一篇新論文指出,模型其實知道約束,只是沒有在決策時使用它。該論文於2026年5月29日提交至arXiv(編號2608.12321),作者為Yubo Li及另外兩位合作者,標題是“LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning”。
論文的核心貢獻是提出“條件約束啟用”(conditional constraint activation)框架,把約束推理拆成四個可檢驗環節:知識(Knowledge)——約束是否被內部編碼;對稱性(Symmetry)——在約束出現和缺失的提示中,該編碼是否一致;路由(Routing)——編碼後的約束是否被送入最終決策;修復(Repair)——透過外部啟用能否恢復正確行為。作者強調,僅看總體準確率會混淆真正的約束推斷與保守預設(conservative defaulting),即模型並非真的運用約束,而只是傾向於規避風險。
研究團隊在14個模型上執行四重診斷,識別出兩種不同的失敗模式。針對兩個開放權重模型的探針實驗顯示,約束資訊在內部表徵中可以被解碼,準確率超過88%。然而,啟用修補(activation patching)的結果卻截然不同:一種失敗模式得到明顯修復,對數似然提升+6.4 nats;另一種不僅沒有改善,反而略微下降(-0.07 nats)。這表明,約束知識明明存在,卻並非總能被有效路由到決策路徑上。
更值得注意的是緩解措施的侷限性。論文構建了所謂“緩解前沿”(mitigation frontier),嘗試多種提示干預,但沒有一種能夠真正到達修復角落。所有干預都透過同一條中介通路——前提提及(prerequisite mention)——放大了模型的保守偏差,而非恢復對約束的靈活運用。作者由此總結:隱藏約束失敗本質上是路由問題,而不是知識問題。這一結論對可解釋性和模型對齊研究具有重要意義,提示研究者應當關注模型內部資訊如何被利用,而不僅僅是關注知識是否被儲存。