大型語言模型在眾多自然語言處理任務中表現出色,但在缺少外部監督或面臨對抗性壓力時,也可能生成與事實不符、帶有欺騙性的內容。為了檢測這類風險,研究人員常採用線性探針:訓練一個線性分類器,利用模型在某層的啟用向量來判斷內部是否呈現出某種概念或狀態。這種方法的優點是簡單、可解釋性強,但分佈外泛化能力常常令人失望。許多已有工作觀察到,線性探針容易依賴訓練集中的表面線索,在換到新的資料分佈時準確率明顯下降。
本文作者Daniel Yoo與Adrians Skapars提出一種新的解讀:探針泛化失敗的關鍵並非分類器的形式,而是從高維啟用空間中選取了錯誤的子空間。為了驗證這一假設,他們在Llama-3.1-8B-Instruct上訓練面向欺騙檢測的線性探針,並留出三個未見過的欺騙檢測資料集作為評測基準。實驗顯示,如果從訓練分佈啟用中計算主成分(PC),僅取若干方差最大的PC方向上的投影作為探針輸入,這些探針在跨域資料上的表現幾乎可以與直接使用目標域資料訓練出的探針相比。換言之,少數PC所張成的低維子空間已經涵蓋了遷移所需的語義資訊,而其餘方向往往額外引入了源域特有或無益的噪聲。
為了自動尋找可遷移的PC,作者構建了一個LLM裁判流程。首先對於每個PC,取在該維度上啟用最強和最弱的若干示例,然後讓LLM判斷這條方向是否與“欺騙/誠實”的語義對相對應,並給出分數。實驗表明,在分數最高的PC上訓練探針能顯著提升跨域結果。具體來說,與不選擇特徵的基線探針相比,該方法在Insider Trading Report上彌補了基線與理論上界差距的78%,在Sandbagging上彌補了25%。進一步的分析顯示,源域探針權重最大的方向往往編碼了源資料集特有的表面特徵;而那些真正能遷移到新分佈的方向,則更抽象地編碼了欺騙與誠實這一對比,並且這種語義可以用自然語言描述出來。
這項研究對於模型可解釋性和安全審計具有直接意義。它提醒研究者,探針遇到分佈外樣本時表現不佳,不一定代表模型內部沒有可用的概念表徵,而可能是特徵選擇或子空間選擇失當。透過對主成分進行結構化的篩選與語義解釋,可以減少探針錯誤報警或漏報的情形,也可以為構建輕量級、跨領域有效的檢測器提供依據。當然,論文提出的方法並非沒有侷限:主成分計算需要收集足夠的訓練啟用,LLM裁判打分也會引入額外的推理成本,且評判質量依賴於LLM對自然語言語義的理解。未來若能夠將PC解釋過程完全自動化,而不依賴人工標註或強模型判斷,這種方法有望在更廣泛的安全評測場景中得到落地。該論文於2026年7月1日投稿至arXiv,相關程式碼與資源可在論文頁面檢視。