執行軌跡推理時對齊的“束帶”設計研究
本文研究了大型語言模型代理中束帶工程(harness engineering)的推理時對齊技術。束帶通過任務分解和引導執行來提升長期性能,但更精細的設計並非總是更好。論文從推理時軌跡對齊的角度,揭示了過度分解、過度剪枝和幻覺執行等失敗模式,並通過實驗表明,部分束帶(僅指定初始步驟)可能比完整結構化工作流更有效。
近日,一篇題為《Harnesses for Inference-Time Alignment over Execution Trajectories》的論文在arXiv上發佈,作者包括Boyuan Wang等五人。該論文聚焦於大型語言模型(LLM)代理中的束帶工程(harness engineering)技術,這是一種重要的推理時對齊方法,旨在通過任務分解和引導執行來提升代理的長期表現。
束帶工程的核心思想是在推理階段對LLM代理的執行軌跡進行干預。論文將束帶機制拆分為兩個獨立的部分:任務分解(task decomposition)和引導執行(guided execution)。任務分解將複雜任務結構化為一組子目標,而引導執行則在執行過程中調整局部動作分佈。這種分離視角使得研究者能夠量化工作流粒度、重試預算以及引導引起的動作權重重新調整對束帶性能極限的影響。
然而,研究揭示了一個反直覺的現象:更精細的束帶設計並非總是更好。論文定義並驗證了三種典型的失敗模式:過度分解(over-decomposition)——將任務拆得過細導致效率下降;過度剪枝(over-pruning)——過於激進的引導可能排除正確路徑;以及幻覺執行(hallucinated execution)——束帶引導代理執行不存在的子目標。這些現象在受控合成實驗和真實終端代理基準測試中均得到驗證。
基於理論分析,論文提出了一個重要的實踐洞見:有效的束帶可以是部分的。即,只需指定任務初始的幾個步驟,讓代理自主完成剩餘執行,這種方法在通過率上甚至超過完全結構化的工作流。這一發現挑戰了當前追求全流程精細控制的設計趨勢。
該研究的實驗部分涵蓋了合成環境以及真實的終端代理任務,例如文件操作、命令執行等場景。實驗結果表明,部分束帶在多個基準測試中均表現出更好的魯棒性和成功率。論文作者認為,這一工作為推理時對齊提供了新的理論框架和實用指導,有助於未來設計更高效、更可靠的LLM代理系統。