AI News HubLIVE
站內改寫2 分鐘閱讀

一篇關於LLM內部“工作空間”的論文剛剛發現了我們提示詞中的錯誤

一篇2026年7月的可解釋性論文發現,語言模型在大量自動處理層之上保持一個小的、可報告的“工作空間”——這個結構並非人為設計,而是從訓練中湧現的。Hamo AI創始人Chris Cheng分析了該論文的發現,指出它與Hamo自身的架構和療法有三次相同的結構對應,並據此改進了提示詞設計:將禁止性規則改為正面範圍宣告、進一步分離臨床決策和措辭、為模型的不同意見提供記錄空間等。論文還提供了一個操作定義來追蹤“洞察時刻”。

來源Hacker News AI作者: chrischengzh

2026年7月,Anthropic發表了一篇可解釋性論文,題為《語言模型中的可言語化表示構成一個全域性工作空間》。該論文探討了一個機械問題:在語言模型內部,哪些內部表示可以被模型實際報告、操控和推理,而哪些則保持隱形,在黑暗中運作?答案是:在龐大的自動處理層之上,存在一個小的、特權的“工作空間”。功能上,這相當於意識科學中所謂的“通達意識”。這個結構並非由人類設計,而是從訓練中自行湧現的。

Hamo AI的創始人兼CEO Chris Cheng表示,他們閱讀這篇論文時,一直在尋找自己的設計是否被證實或暴露不足。結果發現,論文揭示的結構與Hamo的系統以及療法本身有三次對應:首先,論文發現的工作空間類似於Hamo為客戶端即時狀態構建的可讀模型;其次,療法本身的作用正是擴大來訪者的工作空間——將僅表現為行為的模式拉入視野,使其能夠被命名。

論文中的一個實驗特別接近治療師問話的實驗室版本。同一段文本,讓模型預測下一個詞時,時態等屬性被使用但從未進入工作空間;直接問模型文本的時態時,該屬性變得可報告。這類似於治療師的問題:來訪者總是在行為中表現出某種模式,而治療師的提問並不創造模式,而是將模式拉入來訪者自己的工作空間,使其可以被處理。

基於這些發現,Hamo AI對其系統進行了具體改進。首先,他們重寫了提示詞中的禁止性規則。論文中的“白熊效應”表明,告訴系統“不要做X”會使X在工作空間中存在。因此,他們改為正面範圍宣告,例如“本輪的任務是建立信任和確認,任何更深的內容都屬於後續階段”,從而避擴音及被禁止的事物。其次,他們將臨床決策與措辭進一步分離:先進行私有推理,讀取狀態並選擇臨床合適的動作,然後進行更狹窄的生成傳遞,從而減少模型注意力用於權衡規則的開銷。第三,當固定規則覆蓋模型的原始判斷時,允許模型記錄異議,而不是讓反對聲消失——這些異議被記錄但並不單方面行動,作為系統自我檢查的訊號。最後,他們移除了生成傳遞中可能傾斜語調的臨床標籤,僅保留行為描述。

論文還提供了一個操作定義來追蹤“洞察時刻”:當來訪者首次用自己的話語表達出之前只表現為行為的模式時,就發生了真正的變化。這現在成為一個特定且值得追蹤的訊號。

Chris Cheng總結道:“外部論文最有用的地方不是給我們一個新想法,而是從一個我們無法偽造的方向告訴我們,我們之前公開承諾的想法是否正確。這篇論文做到了。它在語言模型中找到的工作空間,正是我們為客戶端狀態構建的形狀,也是療法一直在試圖擴大的形狀。這不是一個比喻,而是從三個不同房間看到的同一個機制。”