貝葉斯風洞用於模型選擇
本研究探討Transformer能否執行貝葉斯模型選擇,即從數據中識別正確的假設類。通過引入貝葉斯風洞環境,使用固定點自由對合等控制設置,作者發現小型Transformer能在純關係任務中實現接近貝葉斯最優的性能,但在需要算術運算時,使用不透明符號會徹底失敗,且該邊界在擴大模型規模後依然存在。對前沿LLM的探測顯示其定性上符合貝葉斯行為,但校準差距較大。
大型語言模型(LLM)的核心能力之一是在不確定性下進行推理。先前工作已證明Transformer能在固定假設類內執行精確的貝葉斯濾波,但一個更根本的問題仍未解決:它們能否進行貝葉斯模型選擇——即從數據中識別出正確的假設類?為此,arXiv:2607.19379論文提出了一種名為“模型選擇貝葉斯風洞”的受控實驗環境,其中可解析計算假設類上的真實後驗分佈。
研究者利用固定點自由對合(滿足f(f(x))=x的純關係函數)作為測試案例。一個僅含280萬個參數的Transformer模型在整數和不透明符號兩種 tokens 下,均實現了與貝葉斯最優解之間僅0.01比特的熵差異(三顆隨機種子)。這一結果拓展至非嵌套比較:在對合與3循環(兩者互無包含關係)的選擇中,模型後驗的平均絕對誤差低於0.001,表明其超越了簡單的簡潔性或子集偏好,真正實現了模型選擇。
然而,當判別統計量涉及算術運算時,情況截然不同。在模加法(旋轉)或模乘法(f(x)=cx mod p)任務中,模型在使用整數tokens時成功進行模型選擇,但使用不透明符號時完全失敗。這一邊界極為魯棒:即使將模型參數從280萬擴展至3.16億(112倍擴大),失敗模式依舊不變。對照實驗表明,關鍵因素在於符號的穩定性:採用固定重標記的不透明tokens能夠成功(熵平均絕對誤差0.009位),説明穩定的語義而非整數的身份標識才是電路編譯的基礎。進一步的頭部分理診斷將失敗定位在頭部求逆與算術的組合環節,而非頭部解析本身。
最後,研究者測試了前沿的通用LLM(例如GPT-4級別模型)在相同任務上的表現。這些模型展現出定性的貝葉斯推理行為,但後驗校準存在約55倍的顯著差距(通過有損探針測量,故數值為方向性而非精確值)。該結果表明,當前通用LLM尚不具備與專用較小模型同等的貝葉斯模型選擇能力。
這項工作揭示了Transformer在模型選擇中的巨大潛力與關鍵侷限,為構建更可靠、可解釋的AI系統提供了重要見解。風洞方法也為未來研究提供了一個標準化評估框架。