执行轨迹推理时对齐的“束带”设计研究
本文研究了大型语言模型代理中束带工程(harness engineering)的推理时对齐技术。束带通过任务分解和引导执行来提升长期性能,但更精细的设计并非总是更好。论文从推理时轨迹对齐的角度,揭示了过度分解、过度剪枝和幻觉执行等失败模式,并通过实验表明,部分束带(仅指定初始步骤)可能比完整结构化工作流更有效。
近日,一篇题为《Harnesses for Inference-Time Alignment over Execution Trajectories》的论文在arXiv上发布,作者包括Boyuan Wang等五人。该论文聚焦于大型语言模型(LLM)代理中的束带工程(harness engineering)技术,这是一种重要的推理时对齐方法,旨在通过任务分解和引导执行来提升代理的长期表现。
束带工程的核心思想是在推理阶段对LLM代理的执行轨迹进行干预。论文将束带机制拆分为两个独立的部分:任务分解(task decomposition)和引导执行(guided execution)。任务分解将复杂任务结构化为一组子目标,而引导执行则在执行过程中调整局部动作分布。这种分离视角使得研究者能够量化工作流粒度、重试预算以及引导引起的动作权重重新调整对束带性能极限的影响。
然而,研究揭示了一个反直觉的现象:更精细的束带设计并非总是更好。论文定义并验证了三种典型的失败模式:过度分解(over-decomposition)——将任务拆得过细导致效率下降;过度剪枝(over-pruning)——过于激进的引导可能排除正确路径;以及幻觉执行(hallucinated execution)——束带引导代理执行不存在的子目标。这些现象在受控合成实验和真实终端代理基准测试中均得到验证。
基于理论分析,论文提出了一个重要的实践洞见:有效的束带可以是部分的。即,只需指定任务初始的几个步骤,让代理自主完成剩余执行,这种方法在通过率上甚至超过完全结构化的工作流。这一发现挑战了当前追求全流程精细控制的设计趋势。
该研究的实验部分涵盖了合成环境以及真实的终端代理任务,例如文件操作、命令执行等场景。实验结果表明,部分束带在多个基准测试中均表现出更好的鲁棒性和成功率。论文作者认为,这一工作为推理时对齐提供了新的理论框架和实用指导,有助于未来设计更高效、更可靠的LLM代理系统。