LLM知道约束条件却不使用:语用约束推理中的激活瓶颈
这篇论文指出,大语言模型在表面线索与隐性可行性约束冲突时失败,并非因为不知道约束,而是未能将已编码的约束路由到决策中。作者提出条件约束激活框架,通过14个模型的四重诊断和激活修补实验表明,隐藏约束失败是路由问题而非知识问题,现有提示干预无法真正修复,反而会加剧保守偏差。
大语言模型(LLM)在面对显著表面线索与隐性可行性约束相互竞争的问题时,常常给出错误答案。以往研究多把这类失败归因于模型不理解约束,但一篇新论文指出,模型其实知道约束,只是没有在决策时使用它。该论文于2026年5月29日提交至arXiv(编号2608.12321),作者为Yubo Li及另外两位合作者,标题是“LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning”。
论文的核心贡献是提出“条件约束激活”(conditional constraint activation)框架,把约束推理拆成四个可检验环节:知识(Knowledge)——约束是否被内部编码;对称性(Symmetry)——在约束出现和缺失的提示中,该编码是否一致;路由(Routing)——编码后的约束是否被送入最终决策;修复(Repair)——通过外部激活能否恢复正确行为。作者强调,仅看总体准确率会混淆真正的约束推断与保守默认(conservative defaulting),即模型并非真的运用约束,而只是倾向于规避风险。
研究团队在14个模型上运行四重诊断,识别出两种不同的失败模式。针对两个开放权重模型的探针实验显示,约束信息在内部表征中可以被解码,准确率超过88%。然而,激活修补(activation patching)的结果却截然不同:一种失败模式得到明显修复,对数似然提升+6.4 nats;另一种不仅没有改善,反而略微下降(-0.07 nats)。这表明,约束知识明明存在,却并非总能被有效路由到决策路径上。
更值得注意的是缓解措施的局限性。论文构建了所谓“缓解前沿”(mitigation frontier),尝试多种提示干预,但没有一种能够真正到达修复角落。所有干预都通过同一条中介通路——前提提及(prerequisite mention)——放大了模型的保守偏差,而非恢复对约束的灵活运用。作者由此总结:隐藏约束失败本质上是路由问题,而不是知识问题。这一结论对可解释性和模型对齐研究具有重要意义,提示研究者应当关注模型内部信息如何被利用,而不仅仅是关注知识是否被存储。