事実・ヒューリスティック・感情状態の強制による大規模言語モデルの行動一貫性の測定と改善
大規模言語モデルは、同一の意思決定問題に対して実行ごとに異なる回答をしたり、自身の過去の回答を文脈として与えると判断を覆したりすることがある。本研究では、認知カーネルモデル(CKM)を提案する。これはプロンプトレベルの状態強制層であり、モデルが決定前に入力を事実、ヒューリスティック、感情の3つに分類することを要求する。26のLLMを用いた実験で、CKMは出力の変動性を有意に低減し(Hedges' g=1.09)、決定の反転率を最大82%削減した。効果はサンプリングの確率性が高いほど大きくなる。ただし、CKMは推論の正確性を改善しない。
大規模言語モデル(LLM)は、同じ意思決定問題に対して実行ごとに異なる答えを返したり、自身の以前の回答が文脈として返された際に判断を覆すことがあります。この不安定性は信頼性への懸念を引き起こしています。新しい研究では、この不安定性をモデルの重みを変更せずに測定し、部分的に低減できるかどうかを調査しています。
研究者らは、認知カーネルモデル(Cognitive Kernel Model, CKM)を提案しました。これはプロンプトレベルの状態強制層であり、モデルが決定を下す前に、入力を3つの認識的役割に分割することを要求します。すなわち、事実(与えられたまたは検証可能な情報)、ヒューリスティック(推論または仮定された情報)、感情(評価的または優先順位を示す信号)です。CKMは能力を追加するものではなく、モデルが行動する前に使用する情報の種類を追跡することを強制します。形式的には、状態遷移関数によって更新される構造化状態 S_t = {F_t, H_t, E_t} を維持します。
実験は韓国語の意思決定シナリオ(曖昧さ、倫理的対立、資源配分、エラー処理を含む)で行われ、4つのベンダーからの26のLLMと37,403の観測データを使用しました。4つのコア実験、4アームのアブレーション、5アームの擬似制限アブレーション、および温度プローブを含む。主な発見は以下の通りです:
(1) CKMは繰り返し出力の変動性を低減しました(ランダム効果Hedges' g=1.09、95%信頼区間[0.83, 1.35]、31モデルペア)。 (2) 状態の持続性により、新しいモデルでの決定反転率が82%減少しました(g=1.52)。 (3) 効果はJSONフォーマットだけによるものではありません(値のみの再計算、g=2.24)。 (4) 固定アンカー状態下での内在的ランダム性は無視できます。 (5) サンプリング確率が高いほど利点が増大します(温度0.7でg=2.87)。 (6) 擬似アブレーションでは、ゲインの約45%が構造的スキャフォールディングに、55%が事実/ヒューリスティック/感情コンテンツに起因し、CKMが一貫性を高めかつ反転を減らす唯一のアームでした。
CKMは推論の正確性を改善しません。より狭い結論としては、行動の一貫性は測定可能であり、モデル間で異なり、決定前に事実、仮定、評価信号を分離させることで部分的に改善可能であるということです。この研究はコード、プロンプト、データセットを提供し、LLMの行動一貫性のさらなる探求の基盤を築いています。