跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

“作為一個語言模型……”:聊天模板切換大模型自我指涉口吻,激活引導可復現該效應

文章摘要

一篇被 COLM 2026 與 KONVENS 2026 研討會接收的論文發現,聊天模板像一個開關:它的存在會抬高模型“我只是個AI”式的免責聲明口吻、壓低“我感覺”式的體驗性口吻;在激活空間中還存在一個可引導該行為的方向向量,暗示模型關於自身的陳述並不只是權重的事實,而部分由部署方式決定。

來源arXiv Machine Learning作者: J\k{e}drzej Maczan
“作為一個語言模型……”:聊天模板切換大模型自我指涉口吻,激活引導可復現該效應
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

大語言模型在被問到與自身相關的問題時,常常會附上一句“我只是一個AI”之類的免責聲明。這類回答所呈現的自我報告,被廣泛用於AI安全或模型自我認知的討論,但究竟是什麼在驅動這種表達,此前並不清楚:模型是在描述它自己,還是在描述它被部署的方式?

一篇題為《“作為一個語言模型……”:聊天模板切換大模型自我指涉口吻,激活引導可復現該效應》的論文給出了實驗性的回答。作者 Jędrzej Maczan 發現,聊天模板(chat template)的作用類似一個開關。在 8 個流行的開源指令微調模型上(參數量最大 9B),當聊天模板存在時,免責聲明式的口吻被上調,而“我感覺”這類體驗性口吻被下調;當聊天模板缺席時,情況正好相反:免責聲明口吻下降,體驗性口吻上升。這一模式在不同模型之間保持一致。

研究並未止步於行為層面。作者在 3 個模型的激活空間中找到了一個能夠引導該行為的方向。在模型的激活表示中移除這一方向,免責聲明口吻會減弱;把它加回去,口吻則會增強。作為對照,一個大小相同的隨機方向幾乎沒有效果,説明起作用的是特定方向而非任意擾動。

更具説服力的證據來自沒有使用聊天模板的指令模型:當把免責聲明方向注入這些模型後,它們會像聊天模板在場時那樣發表免責聲明。也就是説,模板的效果可以在激活層面被複現,而不必真的改變提示格式。

這一結果對研究模型自我報告或內省能力的工作有直接的方法論含義。既然聊天模板會控制模型的免責聲明口吻,研究者可能在測量中引入了一個需要控制的混淆變量;論文同時給出了一個可用於調節這種口吻的方向,為後續實驗提供了工具。

作者更廣泛的結論是:模型關於自身的陳述並不是關於它自身的事實。這些陳述並非只來自模型權重,至少部分由聊天模板所設定,因此模型的自我描述不應被字面化地對待。

該論文被 COLM 2026 高效推理研討會(Workshop on Efficient Reasoning)以及 KONVENS 2026 首屆面向專業領域的大模型評估研討會(Eval4SD)接收,主題分類為機器學習(cs.LG)、人工智能(cs.AI)與計算與語言(cs.CL)。論文於 2026 年 8 月 9 日提交至 arXiv,編號 arXiv:2609.25021。

展開要點與分析

文章情報

工程師進階

要點

  • 在最多 9B 參數的 8 個流行開源指令模型上,聊天模板的存在與否會系統性地切換免責聲明口吻與體驗性口吻;模板缺席時趨勢正好相反。
  • 在 3 個模型的激活空間中找到可引導該行為的方向:移除則免責聲明減少,加入則增多,而同等大小的隨機方向幾乎無效。
  • 無聊天模板的指令模型在加入該方向後會像帶模板一樣發表免責聲明,提示自我報告與內省研究存在需要控制的混淆因素。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。