AI News HubLIVE
站内改写1 分钟阅读

LEAD:突破长程推理中的不可恢复瓶颈

大型语言模型在执行长程任务时即使有高级策略也会出现不稳定。研究发现,虽然分解对稳定性至关重要,但过度分解会导致“不可恢复瓶颈”,即在少数“困难”步骤上的一致错误变得不可逆转。为此,提出了前瞻增强原子分解(LEAD),通过结合短期未来验证和聚合重叠样本来提供足够的隔离和局部上下文,从而纠正错误。该方法使o4-mini模型在Checkers Jumping问题中解决了n=13的复杂度,而极端分解在n=11时就失败。

在大型语言模型(LLM)中,执行需要多步推理的长程任务仍然是一个重大挑战。即使提供了高级策略,模型也常常在复杂问题上失败。EPFL的研究人员Denys Pushkin和Emmanuel Abbé在最新研究中指出,问题并非源于缺乏策略,而是在于任务分解的方式。他们通过控制算法谜题(如Checkers Jumping)的评估,深入探讨了分解的稳定性与局限性。

团队发现,分解对于稳定性至关重要,但过度分解会引发一个被称为“不可恢复瓶颈”的问题。该瓶颈源于错误分布的高度不均匀性:在少数“困难”步骤上的一致错误会变得不可逆转,因为模型没有足够的上下文来自我纠正。具体来说,在Checkers Jumping问题中,当使用极端分解时,模型在复杂度n=11时就开始频繁失败,错误主要集中在少数关键步骤上。

为应对这一挑战,研究者提出了前瞻增强原子分解(LEAD)。LEAD在分解的基础上加入了短期未来验证,即让模型在每一步执行前先模拟未来几步的结果,从而提前发现潜在错误。同时,LEAD聚合了多个重叠的rollout结果,通过对比不同视图来增强鲁棒性。这种方法既保持了分解带来的稳定性,又保留了足够的局部上下文,使得错误可以被检测和纠正。

实验表明,使用LEAD后,o4-mini模型能够解决复杂度高达n=13的Checkers Jumping问题,而传统的极端分解方法在n=11时就已失败。LEAD不仅提升了可解决问题的复杂度,还显著提高了模型的稳定性和准确率。

这一成果对于提升LLM在长程推理任务中的可靠性具有重要意义,尤其是在需要精确多步执行的场景中,如数学证明、程序合成和机器人规划。LEAD提供了一种平衡分解与上下文保留的实用思路,为未来更复杂的长程推理任务奠定了基础。此外,该研究还揭示了LLM在长程执行中不稳定的根本原因之一,即错误分布的不均匀性,为后续研究提供了新的方向。