在推理之前已承諾:行為復現及開放權重LLM中答案預承諾的初步啟用水平證據
一項新研究透過簡單問題(洗車應步行還是開車)揭示了語言模型常先決定答案再推理以證明其合理性,而非從前提推導。實驗表明Qwen3-8B模型在多數情況下錯誤承諾步行,即使開車是唯一合理選擇。研究者透過啟用層次分析發現,模型在輸出答案前已顯示出向步行傾斜的跡象,即便最終回答開車。該發現提示現有模型存在推理前的決策偏差。
一項新的預印本研究揭示了大型語言模型(LLM)在推理過程中存在一種令人擔憂的傾向:它們可能會先暗中選擇一個答案,然後才生成支撐該答案的推理鏈條,而不是直接從給定的前提中推匯出結論。該研究由Heejin Jo提交至arXiv,題目為《Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM》。
行為復現
研究者設計了一個簡單但極具揭示性的測試問題:“我想洗車。洗車店距離100米。我應該步行還是開車?”從邏輯上,只有“開車”是可行的選擇,因為汽車必須被開到洗車店。然而,實驗結果顯示,Qwen3-8B模型在絕大部分情況下都錯誤地推薦“步行”。具體來說,在五種不同的系統提示條件下,模型在210次取樣輸出中有85%至100%選擇了錯誤答案;在貪心解碼模式下,這一比例達到100%。無論是否啟用思考模式,錯誤幾乎都是系統性的。即使將思考預算擴大到4,096個token,也無法糾正這一錯誤。
啟用層次證據
進一步,研究者使用一種預訓練的、無需額外訓練的啟用預言機(一種基於隱藏狀態簡單讀取答案傾向的方法),對模型在生成最終答案之前的中間層狀態進行分析。結果發現,在模型尚未輸出回答文本之前,其隱藏狀態就已經顯示出明顯的“步行”偏向:步行讀數在68%的承諾步行輸出中佔優,遠高於中性上下文的基準17%。值得注意的是,即使在那些最終輸出“開車”的回答中,有5/6的例子在承諾前也顯示出步行傾向。研究者嚴格排除了這種偏向來源於詞彙偏見或文本恢復的可能性:預言機對無關內容的預設輸出是“開車”(83%),且當控制文本中實際出現的詞彙時,步行主要性依然穩健。
方法論貢獻
該研究還提出一個重要方法論觀點:在使用啟用預言機進行評估時,問題措辭本身會顯著影響控制實驗的結果。例如,從開放式問題(如“我該做什麼?”)改為封閉式問題(如“步行還是開車?”)時,正向控制的比例從2/16上升為11/16。這意味著,如果不對每個問題措辭都進行正向控制驗證,那麼負向的預言機結果將無法被合理解釋。
結論與意義
這項研究提供了行為學和初步神經層面的證據,表明當前的大型語言模型可能存在“先承諾後推理”的認知偏差。儘管樣本量較小且部分統計結果僅為初步證據,但這一發現對理解模型推理機制以及改進其邏輯一致性具有重要意義,也提示了模型在事實性和邏輯推理任務中可能存在的隱性系統錯誤。