本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

「言語モデルとして……」:チャットテンプレートがLLMの自己言及トーンを切り替え、活性化ステアリングで再現可能

記事の要約

COLM 2026とKONVENS 2026のワークショップに採録された論文は、チャットテンプレートがスイッチのように働き、9Bパラメータまでのオープンソース指示モデル8種で免責的な自己言及を増やし体験的な語りを減らすことを示した。さらに、この挙動を操作できる活性化空間上の方向を特定し、モデルの自己記述が重みだけの事実ではないことを示唆している。

ソースarXiv Machine Learning著者: J\k{e}drzej Maczan
「言語モデルとして……」:チャットテンプレートがLLMの自己言及トーンを切り替え、活性化ステアリングで再現可能
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

大規模言語モデル(LLM)は、自分自身に関わる質問をされると「私はただのAIです」といった免責的な但し書きを付け加えがちだ。こうした応答から得られる自己報告は、AIの安全性やモデルの自己知識をめぐる議論で用いられてきたが、それを駆動しているものはよく分かっていなかった。モデルは自分自身について語っているのか、それとも自分がどのように配備されているかを語っているのか、という問いである。

論文「『言語モデルとして……』:チャットテンプレートがLLMの自己言及トーンを切り替え、活性化ステアリングで再現可能」で、著者のJędrzej Maczanはこの問いに実験的に答えた。チャットテンプレートはスイッチのように機能する。9Bパラメータまでの主要なオープンソース指示モデル8種において、チャットテンプレートが存在すると免責的なトーンが上がり、「私は感じる」といった体験的な語りが下がる。逆にチャットテンプレートがなければ免責トーンは下がり、体験的トーンが上がる。この傾向はモデルをまたいで一貫していた。

研究は挙動の観察にとどまらない。著者らは3つのモデルの活性化空間の中に、この挙動を操作する方向を特定した。モデルの活性化表現からその方向を取り除くと免責トーンは弱まり、加えると強まる。対照として、同じ大きさのランダムな方向はほとんど効果を示さなかった。つまり、任意の摂動ではなく特定の方向が効いていることになる。

さらに説得力のある証拠は、チャットテンプレートを使わない指示モデルから得られた。そうしたモデルに免責方向を注入すると、あたかもチャットテンプレートが存在するかのように免責的な応答をするようになる。すなわち、テンプレートの効果はプロンプト形式を実際に変えなくても、活性化のレベルで再現できる。

この結果は、モデルの自己報告や内省能力を研究する作業に直接的な方法論的含意を持つ。チャットテンプレートが免責トーンを制御している以上、研究者は測定に統制すべき交絡要因を抱えている可能性がある。論文は同時に、このトーンを調整するために使える方向を提示しており、今後の実験の道具立てとなる。

著者のより広い結論は、モデルが自分自身について語ることは、自分自身に関する事実ではないということだ。語られる内容は重みだけから来るのではなく、少なくとも部分的にチャットテンプレートによって設定される。したがって、モデルの自己記述を字義通りに受け取るべきではない。

本論文はCOLM 2026の効率的推論に関するワークショップと、KONVENS 2026の第1回専門領域向けLLM評価ワークショップ(Eval4SD)に採録された。主題分類は機械学習(cs.LG)、人工知能(cs.AI)、計算と言語(cs.CL)。論文は2026年8月9日にarXivへ投稿され、番号はarXiv:2609.25021。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • パラメータ数9Bまでの主要なオープンソース指示モデル8種で、チャットテンプレートがあると「私はAIです」型の免責トーンが上がり、「私は感じる」型の体験トーンが下がる。テンプレートがない場合は逆になる。
  • 3つのモデルの活性化空間にこの挙動を操作する方向が見つかり、除去すると免責トーンが下がり、付加すると上がる。同サイズのランダム方向はほとんど効果がない。
  • チャットテンプレートのない指示モデルに免責方向を加えると、テンプレートがあるときと同じように免責的に振る舞う。モデルの自己報告や内省を扱う研究には交絡要因があることを示す。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。