大語言模型在被問到與自身相關的問題時,常常會附上一句“我只是一個AI”之類的免責宣告。這類回答所呈現的自我報告,被廣泛用於AI安全或模型自我認知的討論,但究竟是什麼在驅動這種表達,此前並不清楚:模型是在描述它自己,還是在描述它被部署的方式?
一篇題為《“作為一個語言模型……”:聊天模板切換大模型自我指涉口吻,啟用引導可復現該效應》的論文給出了實驗性的回答。作者 Jędrzej Maczan 發現,聊天模板(chat template)的作用類似一個開關。在 8 個流行的開源指令微調模型上(引數量最大 9B),當聊天模板存在時,免責宣告式的口吻被上調,而“我感覺”這類體驗性口吻被下調;當聊天模板缺席時,情況正好相反:免責宣告口吻下降,體驗性口吻上升。這一模式在不同模型之間保持一致。
研究並未止步於行為層面。作者在 3 個模型的啟用空間中找到了一個能夠引導該行為的方向。在模型的啟用表示中移除這一方向,免責宣告口吻會減弱;把它加回去,口吻則會增強。作為對照,一個大小相同的隨機方向幾乎沒有效果,說明起作用的是特定方向而非任意擾動。
更具說服力的證據來自沒有使用聊天模板的指令模型:當把免責宣告方向注入這些模型後,它們會像聊天模板在場時那樣發表免責宣告。也就是說,模板的效果可以在啟用層面被複現,而不必真的改變提示格式。
這一結果對研究模型自我報告或內省能力的工作有直接的方法論含義。既然聊天模板會控制模型的免責宣告口吻,研究者可能在測量中引入了一個需要控制的混淆變數;論文同時給出了一個可用於調節這種口吻的方向,為後續實驗提供了工具。
作者更廣泛的結論是:模型關於自身的陳述並不是關於它自身的事實。這些陳述並非只來自模型權重,至少部分由聊天模板所設定,因此模型的自我描述不應被字面化地對待。
該論文被 COLM 2026 高效推理研討會(Workshop on Efficient Reasoning)以及 KONVENS 2026 首屆面向專業領域的大模型評估研討會(Eval4SD)接收,主題分類為機器學習(cs.LG)、人工智慧(cs.AI)與計算與語言(cs.CL)。論文於 2026 年 8 月 9 日提交至 arXiv,編號 arXiv:2609.25021。