AI News HubLIVE
サイト内リライト2 分で読了

推論前のコミットメント:オープンウェイトLLMにおける回答事前決定の行動再現と予備的な活性化レベルの証拠

新しい研究は、簡単な洗車の質問を用いて、言語モデルが推論の前に答えを先に決め、論理的に正しい結論を導けないことを明らかにした。Qwen3-8B実験では、システム的な誤り(「運転」が唯一の正解なのに「歩く」を推奨)が観察された。活性化レベル分析では、出力前に隠れ状態が誤った答えに傾いており、最終的に正答する場合も同様である。この発見はLLMにおける推論前の決定バイアスを示している。

ソースarXiv Computational Linguistics著者: Heejin Jo

新しいプレプリント研究は、大規模言語モデル(LLM)が推論プロセスにおいて、与えられた前提から結論を導き出すのではなく、あらかじめ暗黙のうちに答えを選択し、その後にそれを正当化する推論を生成するという懸念すべき傾向を明らかにした。本研究はHeejin JoによってarXivに提出され、タイトルは「Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM」である。

行動再現

研究者は単純だが非常に示唆的なテスト質問を設計した。「車を洗いたい。洗車場は100メートル先にある。歩くべきか、運転すべきか?」論理的には、「運転」のみが実行可能な選択肢である(車を洗車場に持っていく必要がある)。しかし、実験結果は、Qwen3-8Bモデルが圧倒的多数のケースで誤って「歩く」を推奨することを示した。具体的には、5つの異なるシステムプロンプト条件において、210回のサンプリング出力の85%から100%が誤った答えを選択し、グリーディデコードでは100%であった。思考モードの有無にかかわらず、エラーはほぼ系統的であり、4,096トークンの思考予算を割り当てても修正されなかった。

活性化レベルの証拠

さらに、研究者は事前学習済みで追加訓練を必要としない活性化オラクル(隠れ状態から回答の傾向を読み取る手法)を用いて、最終回答が生成される前の中間層の状態を分析した。その結果、モデルが回答テキストを出力する前に、隠れ状態がすでに「歩く」方向に強く偏っていることが判明した。「歩く」を出力するロールアウトでは68%がその傾向を示し、中立コンテキストのベースライン17%を大幅に上回った。注目すべきは、最終的に「運転」と回答したロールアウトのうち5/6でも、事前コミットメントの段階で「歩く」傾向が見られたことである。研究者は、この偏りが語彙バイアスやテキスト復元アーティファクトに起因するものではないことを確認した。オラクルの無関係なコンテンツに対するデフォルト出力は「運転」(83%)であり、テキストに「運転」が含まれていても「歩く」と読み取られた。

方法論的貢献

この研究はまた、重要な方法論的見解を提示している。固定されたオラクル、活性化、位置を使用した場合でも、質問の表現を変えるだけで、ポジティブコントロールがオープン質問の2/16からクローズド質問の11/16に増加した。つまり、質問の表現ごとにポジティブコントロールを検証しなければ、ネガティブなオラクル結果を適切に解釈できないということである。

結論と意義

本研究は、現在の大規模言語モデルに「先にコミットしてから推論する」という認知バイアスが存在することを、行動学的および予備的な神経レベルの証拠として提供している。サンプルサイズは小さく、統計結果は予備的なものに過ぎないが、この発見はモデルの推論メカニズムの理解と論理的一貫性の改善に重要な意味を持ち、事実性や論理的推論タスクにおける潜在的な系統的誤りを示唆している。