AI News HubLIVE
站内改写2 分钟阅读

在推理之前已承诺:行为复现及开放权重LLM中答案预承诺的初步激活水平证据

一项新研究通过简单问题(洗车应步行还是开车)揭示了语言模型常先决定答案再推理以证明其合理性,而非从前提推导。实验表明Qwen3-8B模型在多数情况下错误承诺步行,即使开车是唯一合理选择。研究者通过激活层次分析发现,模型在输出答案前已显示出向步行倾斜的迹象,即便最终回答开车。该发现提示现有模型存在推理前的决策偏差。

来源arXiv Computational Linguistics作者: Heejin Jo

一项新的预印本研究揭示了大型语言模型(LLM)在推理过程中存在一种令人担忧的倾向:它们可能会先暗中选择一个答案,然后才生成支撑该答案的推理链条,而不是直接从给定的前提中推导出结论。该研究由Heejin Jo提交至arXiv,题目为《Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM》。

行为复现

研究者设计了一个简单但极具揭示性的测试问题:“我想洗车。洗车店距离100米。我应该步行还是开车?”从逻辑上,只有“开车”是可行的选择,因为汽车必须被开到洗车店。然而,实验结果显示,Qwen3-8B模型在绝大部分情况下都错误地推荐“步行”。具体来说,在五种不同的系统提示条件下,模型在210次采样输出中有85%至100%选择了错误答案;在贪心解码模式下,这一比例达到100%。无论是否启用思考模式,错误几乎都是系统性的。即使将思考预算扩大到4,096个token,也无法纠正这一错误。

激活层次证据

进一步,研究者使用一种预训练的、无需额外训练的激活预言机(一种基于隐藏状态简单读取答案倾向的方法),对模型在生成最终答案之前的中间层状态进行分析。结果发现,在模型尚未输出回答文本之前,其隐藏状态就已经显示出明显的“步行”偏向:步行读数在68%的承诺步行输出中占优,远高于中性上下文的基准17%。值得注意的是,即使在那些最终输出“开车”的回答中,有5/6的例子在承诺前也显示出步行倾向。研究者严格排除了这种偏向来源于词汇偏见或文本恢复的可能性:预言机对无关内容的默认输出是“开车”(83%),且当控制文本中实际出现的词汇时,步行主要性依然稳健。

方法论贡献

该研究还提出一个重要方法论观点:在使用激活预言机进行评估时,问题措辞本身会显著影响控制实验的结果。例如,从开放式问题(如“我该做什么?”)改为封闭式问题(如“步行还是开车?”)时,正向控制的比例从2/16上升为11/16。这意味着,如果不对每个问题措辞都进行正向控制验证,那么负向的预言机结果将无法被合理解释。

结论与意义

这项研究提供了行为学和初步神经层面的证据,表明当前的大型语言模型可能存在“先承诺后推理”的认知偏差。尽管样本量较小且部分统计结果仅为初步证据,但这一发现对理解模型推理机制以及改进其逻辑一致性具有重要意义,也提示了模型在事实性和逻辑推理任务中可能存在的隐性系统错误。