算術啟發式神經元是否具有形式不變性?對LLM中符號、文本和程式碼的機制分析
本研究透過機制可解釋性方法,分析Llama-3模型在符號算術、自然語言應用題和Python程式碼三種形式下的算術計算機制,發現一組緊湊的共享神經元在三種形式中均被啟用,且跨格式失敗源於啟用狀態而非不同電路,表明LLM的算術計算在神經元層面具有形式不變性。
大型語言模型(LLM)在一種問題表述上成功,但在等價表述上失敗的現象引發了對其內部計算機制的深入探究。例如,一個模型可能正確回答“25+37等於多少?”卻無法解決“小明有25個蘋果,小紅有37個蘋果,他們一共有多少個蘋果?”這類自然語言問題。長期以來,研究人員對這類跨格式失敗的根本原因存在爭議:是模型使用了完全不同的內部電路,還是同一共享電路在不同輸入形式下處於不同的啟用狀態?
近期機制可解釋性研究表明,LLM中的算術計算源於一組稀疏的MLP神經元編碼的“啟發式包”,這些神經元代表不同的算術策略,如進位法、分解法等。然而,這些啟發式神經元是否在不同問題形式中具有形式不變性,仍是一個開放問題。
本研究由Sharath Naganna等人開展,對Llama-3系列模型(包括不同規模)進行了系統分析。他們採用歸因修補和啟用修補相結合的兩階段管道,識別出每種形式下的算術啟發式神經元。首先,透過歸因修補定位對算術輸出貢獻最大的神經元;然後,透過啟用修補驗證這些神經元的功能必要性。實驗發現,存在一組緊湊的神經元集在符號算術(如“25+37”)、自然語言應用題(如上述蘋果問題)和Python程式碼(如“print(25+37)”)三種形式中均被啟用。
透過靶向干預,研究人員證實該共享電路對於後層的算術計算既是必要的也是充分的。進一步實驗顯示,將共享神經元在一種形式成功執行時的啟用狀態轉移到另一種形式的失敗執行中,能夠恢復大部分錯誤預測——加法與減法的恢復率超過97%。這一結果表明,跨格式失敗並非源於不同的內部電路,而是同一共享電路在不同啟用狀態下的表現。此外,共享神經元在三種形式中始終屬於相同的啟發式家族,進一步證實了LLM算術計算在神經元層面的形式不變性。
該研究的發現具有重要意義。首先,它揭示了LLM在處理不同形式的算術問題時,底層機制具有高度的一致性,這為理解模型的泛化能力提供了新的視角。其次,它表明模型在一種形式上的失敗可以透過調整共享神經元的啟用狀態來糾正,這為提升模型魯棒性提供了潛在方法。例如,可以透過干預特定神經元的啟用來改善模型在自然語言任務上的算術表現。該研究也為未來探索其他認知能力(如推理、規劃)的跨格式不變性奠定了基礎。