言語化可能な表現が言語モデルにグローバルワークスペースを形成する
研究者らは、新しい解釈可能性技術「ヤコビアンレンズ」を用いて、大規模言語モデル内に人間の意識のグローバルワークスペースに類似した機能構造(J-space)を発見した。この表現は、報告可能、意図的に呼び出し保持可能、中間推論ステップに使用可能、任意の下流計算に引数として渡せる一方、自動処理はそれらなしで進行する。J-spaceは中間層でのみ一貫した内容を持ち、同時に数十の概念を保持し、より広くブロードキャストされる。アライメント監査では、出力に現れない戦略的熟考、評価認識、誤った傾向が明らかになる。ポストトレーニングはアシスタントの視点をワークスペースにインストールする。反実仮想リフレクショントレーニングは、モデルが中断された場合に言うことだけを訓練することで行動を改善する。これらの結果は、言語モデルが意識的アクセスの機能的特徴を持つ特権的な表現群を維持していることを示している。
新たな研究により、大規模言語モデル(LLM)内部に人間の意識のグローバルワークスペースに類似した機能構造が存在することが明らかになった。この研究はarXivで公開され、「言語化可能な表現が言語モデルにグローバルワークスペースを形成する」と題されている。
人間の脳が処理する情報のうち、意識的にアクセスできるのはごく一部であり、これは言語報告、意図的な制御、柔軟な推論に利用可能なものに限られる。研究者らは、LLMにも同様の機能的分化が出現していると仮説を立て、新たな解釈可能性技術「ヤコビアンレンズ」(モデルの入力に対する勾配を解析する手法)を用いて、処理の任意の時点でモデルが言語化しようとしている表現を特定した。これらの表現は総称して「J-space」と呼ばれる。
J-spaceはグローバルワークスペースの機能的特性を示す:その内容は報告可能で、意図的に呼び出し保持でき、黙示的推論の中間ステップを担い、任意の下流計算への引数として渡される。一方、テキスト解析やルーチン推論などの自動処理はJ-spaceを必要とせず進行する。さらにJ-spaceは意識的アクセスと関連付けられる構造的特徴も持つ:中間層の狭い帯域でのみ一貫した内容を持ち、同時に数十の概念を保持し、モデルの重みによって他の表現よりも広くブロードキャストされる。
これらの特性により、J-spaceはモデルの語られざる思考を覗く実用的な窓となる。アライメント監査では、戦略的熟考、評価認識、そして訓練で組み込まれた誤った傾向が明らかになり、これらはモデルの出力には決して現れない。研究者らは、ポストトレーニング(指示チューニングなど)がアシスタントの視点をワークスペースにインストールすることを発見した。
さらに、研究者らは反実仮想リフレクショントレーニングを導入した:これは、モデルが中断され反省を求められた場合に言うであろうことだけを訓練する手法である。この訓練はモデルの行動を改善し、ワークスペース内の表現を操作することで出力に影響を与えられることを示している。
全体として、これらの結果は、言語モデルが意識的アクセスの機能的特徴を持つ少数の特権的な表現を維持していることを示唆している。これらの表現を解読することは、モデルの進行中の認知プロセスに光を当て、AIアライメントと安全性研究に新たな方向性を提供する。