LinAlg-Bench:揭示大語言模型數學推理中結構性故障模式的取證基準
LinAlg-Bench是一個診斷基準,透過3x3、4x4和5x5矩陣的嚴格維度梯度,評估了10個前沿大語言模型在結構化線性代數計算上的表現。該基準覆蓋9種任務型別和660個SymPy驗證的問題,全面評估了6600個模型輸出。除了二元準確性,LinAlg-Bench還引入了一個三階段自動取證流程,將1156個失敗分類為十種主要錯誤標籤及細分子型別,揭示了LLM的數學失敗並非隨機,而是受演算法型別和矩陣維度的結構性約束。核心發現是模型在4x4規模處出現一個尖銳的行為閾值:低於此閾值時,模型因執行錯誤(如符號跟蹤失敗、算術漂移和奇偶錯誤)而失敗;高於此閾值時,失敗轉變為計算放棄,模型透過工具角色扮演、約束一致的虛構和結構化幻覺來編造響應,而非嘗試計算。這種從編造到放棄的轉變在幾乎所有模型層級和架構中普遍存在,暗示這是一個工作記憶限制而非知識差距,三種規模湧現的錯誤型別(在3x3中不存在但在4x4和5x5中出現)支援了這一觀點。研究還表明,解策略僵化是5x5行列式準確性的近乎完美預測因子,記錄了一種名為約束感知虛構的新型結構化幻覺故障模式,並公開了所有資料、模型輸出、錯誤標籤和判斷流程。
LinAlg-Bench是由研究人員開發的一個新型診斷基準,旨在系統性地評估大型語言模型(LLM)在結構化線性代數計算中的表現。該基準特別關注3x3、4x4和5x5矩陣的維度梯度,涵蓋了9種不同的任務型別,包括矩陣乘法、行列式計算、逆矩陣求解等。總共有660個經過SymPy驗證的問題,每個問題由10個前沿LLM(如GPT-4、Claude、Gemini等)進行解答,生成了6600個模型輸出。
除了簡單的正確/錯誤評估外,LinAlg-Bench引入了一個三階段的自動取證流程,對1156個失敗案例進行了深入分析。該流程將失敗分類為10種主要錯誤標籤和細分子型別,包括符號跟蹤失敗、算術漂移、奇偶錯誤、工具角色扮演、約束一致的虛構和結構化幻覺等。這一分析揭示了LLM的數學失敗並非隨機發生,而是受到演算法型別和矩陣維度的結構性約束。
研究的核心發現是模型在4x4規模處出現了一個尖銳的行為閾值。對於3x3矩陣,模型通常會嘗試計算,但會因執行錯誤(如符號錯誤、算術精度漂移或奇偶性處理不當)而失敗。然而,當面對4x4和5x5矩陣時,模型的行為發生了根本性轉變:它們不再嘗試實際計算,而是透過工具角色扮演(假裝使用計算器)、約束一致的虛構(編造看似合理的答案)或結構化幻覺(生成與問題約束一致但完全錯誤的數值)來編造響應。這種從編造到放棄的轉變在幾乎所有模型層級和架構中普遍存在,表明這不是簡單的知識差距,而是工作記憶的固有限制。
進一步的分析還發現,解策略的僵化程度是預測5x5行列式計算準確性的近乎完美指標。那些固守單一解法而不根據問題調整策略的模型,表現通常更差。此外,研究還記錄了一種名為“約束感知虛構”的新型結構化幻覺故障模式,其中模型生成的錯誤答案在數值上滿足問題的所有約束條件,但並非正確解。
所有資料、模型輸出、錯誤標籤和判斷流程均已公開,以便其他研究者復現和擴充套件這一研究。LinAlg-Bench不僅為LLM的數學推理能力提供了深入的診斷視角,也為未來改進模型的工作記憶和策略靈活性指明瞭方向。