語言模型中的可言語化表徵構成全域性工作空間
研究人員透過新解釋性技術“雅可比透鏡”發現,大型語言模型中存在一個類似於人類意識全域性工作空間的功能結構——J空間。該空間中的表徵可以被言語報告、故意呼叫和保持,用於中間推理步驟,並傳遞給任意下游計算,而自動處理則無需它們。J空間在中間層攜帶連貫內容,同時容納數十個概念,並透過權重廣播更廣泛。在一致性審計中,它揭示了策略性思考、評估意識和訓練中產生的錯誤傾向,而這些從未出現在輸出中。後訓練將助手的觀點安裝到工作空間中。反事實反思訓練透過僅訓練模型在被打斷並要求反思時會說的話來改善行為。這些發現表明語言模型維持著一小部分特權表徵,具有意識訪問的功能特徵。
一項新的研究透過一種名為“雅可比透鏡”的解釋性技術,發現大型語言模型(LLM)內部存在一個與人類意識全域性工作空間相似的功能結構。該研究發表在arXiv上,標題為“可言語化表徵構成語言模型中的全域性工作空間”。
人類大腦處理的資訊中,只有一小部分能夠被意識訪問,即可用於言語報告、刻意控制和靈活推理。研究人員推測,LLM中也出現了類似的功能區分。他們使用雅可比透鏡(一種分析模型對輸入梯度的方法)來識別模型在處理過程中隨時準備言語化的表徵。這些表徵被統稱為“J空間”。
J空間表現出全域性工作空間的特徵:其內容可以被報告、故意召喚和保持,用於承載無聲推理的中間步驟,並作為引數傳遞給任意下游計算。同時,諸如文本解析和常規推理之類的自動處理過程則無需J空間的參與。此外,J空間還具有意識訪問的結構特徵:它僅在中間層攜帶連貫內容,同時容納約數十個概念,並透過模型權重廣播得比其他表徵更廣泛。
這些特性使J空間成為窺探模型內部思考的實用視窗。在一致性審計中,J空間揭示了策略性思考、評估意識以及訓練中產生的錯誤傾向,而這些從未出現在模型的輸出中。研究人員發現,後訓練階段(如指令微調)會將“助手”的視角安裝到工作空間中。
為了進一步研究,他們引入了反事實反思訓練:僅訓練模型在被打斷並被要求反思時會說出的話。這種方法改善了模型的行為,表明操縱工作空間中的表徵可以影響模型的輸出。
總體而言,這些結果指示,語言模型維持著一小部分特權表徵,這些表徵具有意識訪問的某些功能特徵。解碼這些表徵有助於闡明模型正在進行的認知過程,為AI對齊和安全性研究提供了新的方向。