AI News HubLIVE
站內改寫1 分鐘閱讀

LEAD:突破長程推理中的不可恢復瓶頸

大型語言模型在執行長程任務時即使有高級策略也會出現不穩定。研究發現,雖然分解對穩定性至關重要,但過度分解會導致“不可恢復瓶頸”,即在少數“困難”步驟上的一致錯誤變得不可逆轉。為此,提出了前瞻增強原子分解(LEAD),通過結合短期未來驗證和聚合重疊樣本來提供足夠的隔離和局部上下文,從而糾正錯誤。該方法使o4-mini模型在Checkers Jumping問題中解決了n=13的複雜度,而極端分解在n=11時就失敗。

在大型語言模型(LLM)中,執行需要多步推理的長程任務仍然是一個重大挑戰。即使提供了高級策略,模型也常常在複雜問題上失敗。EPFL的研究人員Denys Pushkin和Emmanuel Abbé在最新研究中指出,問題並非源於缺乏策略,而是在於任務分解的方式。他們通過控制算法謎題(如Checkers Jumping)的評估,深入探討了分解的穩定性與侷限性。

團隊發現,分解對於穩定性至關重要,但過度分解會引發一個被稱為“不可恢復瓶頸”的問題。該瓶頸源於錯誤分佈的高度不均勻性:在少數“困難”步驟上的一致錯誤會變得不可逆轉,因為模型沒有足夠的上下文來自我糾正。具體來説,在Checkers Jumping問題中,當使用極端分解時,模型在複雜度n=11時就開始頻繁失敗,錯誤主要集中在少數關鍵步驟上。

為應對這一挑戰,研究者提出了前瞻增強原子分解(LEAD)。LEAD在分解的基礎上加入了短期未來驗證,即讓模型在每一步執行前先模擬未來幾步的結果,從而提前發現潛在錯誤。同時,LEAD聚合了多個重疊的rollout結果,通過對比不同視圖來增強魯棒性。這種方法既保持了分解帶來的穩定性,又保留了足夠的局部上下文,使得錯誤可以被檢測和糾正。

實驗表明,使用LEAD後,o4-mini模型能夠解決複雜度高達n=13的Checkers Jumping問題,而傳統的極端分解方法在n=11時就已失敗。LEAD不僅提升了可解決問題的複雜度,還顯著提高了模型的穩定性和準確率。

這一成果對於提升LLM在長程推理任務中的可靠性具有重要意義,尤其是在需要精確多步執行的場景中,如數學證明、程序合成和機器人規劃。LEAD提供了一種平衡分解與上下文保留的實用思路,為未來更復雜的長程推理任務奠定了基礎。此外,該研究還揭示了LLM在長程執行中不穩定的根本原因之一,即錯誤分佈的不均勻性,為後續研究提供了新的方向。