跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

“作为一个语言模型……”:聊天模板切换大模型自我指涉口吻,激活引导可复现该效应

文章摘要

一篇被 COLM 2026 与 KONVENS 2026 研讨会接收的论文发现,聊天模板像一个开关:它的存在会抬高模型“我只是个AI”式的免责声明口吻、压低“我感觉”式的体验性口吻;在激活空间中还存在一个可引导该行为的方向向量,暗示模型关于自身的陈述并不只是权重的事实,而部分由部署方式决定。

来源arXiv Machine Learning作者: J\k{e}drzej Maczan
“作为一个语言模型……”:聊天模板切换大模型自我指涉口吻,激活引导可复现该效应
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

大语言模型在被问到与自身相关的问题时,常常会附上一句“我只是一个AI”之类的免责声明。这类回答所呈现的自我报告,被广泛用于AI安全或模型自我认知的讨论,但究竟是什么在驱动这种表达,此前并不清楚:模型是在描述它自己,还是在描述它被部署的方式?

一篇题为《“作为一个语言模型……”:聊天模板切换大模型自我指涉口吻,激活引导可复现该效应》的论文给出了实验性的回答。作者 Jędrzej Maczan 发现,聊天模板(chat template)的作用类似一个开关。在 8 个流行的开源指令微调模型上(参数量最大 9B),当聊天模板存在时,免责声明式的口吻被上调,而“我感觉”这类体验性口吻被下调;当聊天模板缺席时,情况正好相反:免责声明口吻下降,体验性口吻上升。这一模式在不同模型之间保持一致。

研究并未止步于行为层面。作者在 3 个模型的激活空间中找到了一个能够引导该行为的方向。在模型的激活表示中移除这一方向,免责声明口吻会减弱;把它加回去,口吻则会增强。作为对照,一个大小相同的随机方向几乎没有效果,说明起作用的是特定方向而非任意扰动。

更具说服力的证据来自没有使用聊天模板的指令模型:当把免责声明方向注入这些模型后,它们会像聊天模板在场时那样发表免责声明。也就是说,模板的效果可以在激活层面被复现,而不必真的改变提示格式。

这一结果对研究模型自我报告或内省能力的工作有直接的方法论含义。既然聊天模板会控制模型的免责声明口吻,研究者可能在测量中引入了一个需要控制的混淆变量;论文同时给出了一个可用于调节这种口吻的方向,为后续实验提供了工具。

作者更广泛的结论是:模型关于自身的陈述并不是关于它自身的事实。这些陈述并非只来自模型权重,至少部分由聊天模板所设定,因此模型的自我描述不应被字面化地对待。

该论文被 COLM 2026 高效推理研讨会(Workshop on Efficient Reasoning)以及 KONVENS 2026 首届面向专业领域的大模型评估研讨会(Eval4SD)接收,主题分类为机器学习(cs.LG)、人工智能(cs.AI)与计算与语言(cs.CL)。论文于 2026 年 8 月 9 日提交至 arXiv,编号 arXiv:2609.25021。

展开要点与分析

文章情报

工程师进阶

要点

  • 在最多 9B 参数的 8 个流行开源指令模型上,聊天模板的存在与否会系统性地切换免责声明口吻与体验性口吻;模板缺席时趋势正好相反。
  • 在 3 个模型的激活空间中找到可引导该行为的方向:移除则免责声明减少,加入则增多,而同等大小的随机方向几乎无效。
  • 无聊天模板的指令模型在加入该方向后会像带模板一样发表免责声明,提示自我报告与内省研究存在需要控制的混淆因素。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。