大语言模型在被问到与自身相关的问题时,常常会附上一句“我只是一个AI”之类的免责声明。这类回答所呈现的自我报告,被广泛用于AI安全或模型自我认知的讨论,但究竟是什么在驱动这种表达,此前并不清楚:模型是在描述它自己,还是在描述它被部署的方式?
一篇题为《“作为一个语言模型……”:聊天模板切换大模型自我指涉口吻,激活引导可复现该效应》的论文给出了实验性的回答。作者 Jędrzej Maczan 发现,聊天模板(chat template)的作用类似一个开关。在 8 个流行的开源指令微调模型上(参数量最大 9B),当聊天模板存在时,免责声明式的口吻被上调,而“我感觉”这类体验性口吻被下调;当聊天模板缺席时,情况正好相反:免责声明口吻下降,体验性口吻上升。这一模式在不同模型之间保持一致。
研究并未止步于行为层面。作者在 3 个模型的激活空间中找到了一个能够引导该行为的方向。在模型的激活表示中移除这一方向,免责声明口吻会减弱;把它加回去,口吻则会增强。作为对照,一个大小相同的随机方向几乎没有效果,说明起作用的是特定方向而非任意扰动。
更具说服力的证据来自没有使用聊天模板的指令模型:当把免责声明方向注入这些模型后,它们会像聊天模板在场时那样发表免责声明。也就是说,模板的效果可以在激活层面被复现,而不必真的改变提示格式。
这一结果对研究模型自我报告或内省能力的工作有直接的方法论含义。既然聊天模板会控制模型的免责声明口吻,研究者可能在测量中引入了一个需要控制的混淆变量;论文同时给出了一个可用于调节这种口吻的方向,为后续实验提供了工具。
作者更广泛的结论是:模型关于自身的陈述并不是关于它自身的事实。这些陈述并非只来自模型权重,至少部分由聊天模板所设定,因此模型的自我描述不应被字面化地对待。
该论文被 COLM 2026 高效推理研讨会(Workshop on Efficient Reasoning)以及 KONVENS 2026 首届面向专业领域的大模型评估研讨会(Eval4SD)接收,主题分类为机器学习(cs.LG)、人工智能(cs.AI)与计算与语言(cs.CL)。论文于 2026 年 8 月 9 日提交至 arXiv,编号 arXiv:2609.25021。