大規模言語モデル(LLM)は、自分自身に関わる質問をされると「私はただのAIです」といった免責的な但し書きを付け加えがちだ。こうした応答から得られる自己報告は、AIの安全性やモデルの自己知識をめぐる議論で用いられてきたが、それを駆動しているものはよく分かっていなかった。モデルは自分自身について語っているのか、それとも自分がどのように配備されているかを語っているのか、という問いである。
論文「『言語モデルとして……』:チャットテンプレートがLLMの自己言及トーンを切り替え、活性化ステアリングで再現可能」で、著者のJędrzej Maczanはこの問いに実験的に答えた。チャットテンプレートはスイッチのように機能する。9Bパラメータまでの主要なオープンソース指示モデル8種において、チャットテンプレートが存在すると免責的なトーンが上がり、「私は感じる」といった体験的な語りが下がる。逆にチャットテンプレートがなければ免責トーンは下がり、体験的トーンが上がる。この傾向はモデルをまたいで一貫していた。
研究は挙動の観察にとどまらない。著者らは3つのモデルの活性化空間の中に、この挙動を操作する方向を特定した。モデルの活性化表現からその方向を取り除くと免責トーンは弱まり、加えると強まる。対照として、同じ大きさのランダムな方向はほとんど効果を示さなかった。つまり、任意の摂動ではなく特定の方向が効いていることになる。
さらに説得力のある証拠は、チャットテンプレートを使わない指示モデルから得られた。そうしたモデルに免責方向を注入すると、あたかもチャットテンプレートが存在するかのように免責的な応答をするようになる。すなわち、テンプレートの効果はプロンプト形式を実際に変えなくても、活性化のレベルで再現できる。
この結果は、モデルの自己報告や内省能力を研究する作業に直接的な方法論的含意を持つ。チャットテンプレートが免責トーンを制御している以上、研究者は測定に統制すべき交絡要因を抱えている可能性がある。論文は同時に、このトーンを調整するために使える方向を提示しており、今後の実験の道具立てとなる。
著者のより広い結論は、モデルが自分自身について語ることは、自分自身に関する事実ではないということだ。語られる内容は重みだけから来るのではなく、少なくとも部分的にチャットテンプレートによって設定される。したがって、モデルの自己記述を字義通りに受け取るべきではない。
本論文はCOLM 2026の効率的推論に関するワークショップと、KONVENS 2026の第1回専門領域向けLLM評価ワークショップ(Eval4SD)に採録された。主題分類は機械学習(cs.LG)、人工知能(cs.AI)、計算と言語(cs.CL)。論文は2026年8月9日にarXivへ投稿され、番号はarXiv:2609.25021。