跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

自进化LLM智能体的框架优化价值所在:局部化收益与预算均分陷阱

文章摘要

一项新的 arXiv 研究提出 HARNESSEVO,将 LLM 智能体的文本“harness”拆分为角色、任务策略、工具/格式规则、反思/控制四个可独立演化的槽位,并用留一入/留一出归因衡量各槽位贡献。在 ALFWorld 上,完整流程的成功率相比扁平字符串演化没有显著提升(0.657 对 0.642),但几乎全部增益都集中在反思/控制槽(+0.119)。若将 64 次 rollout 均分到四个槽位,每次仅 16 次、低于有效搜索下限,所有槽位会冻结;把预算集中到高价值槽位后,用更少预算达到 0.761。WebShop 中所有方法表现持平,说明这种缺失不是因为预算饥饿,而是任务中缺少可语言化的反复性控制失败。

来源arXiv Computational Linguistics作者: Michael Nguyen, Wei Chen Tan, Nurul Aisyah Hassan, Arvind Raman, Li Hua Lim, Ahmad Faiz Razak
自进化LLM智能体的框架优化价值所在:局部化收益与预算均分陷阱
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

一篇由 Michael Nguyen 与五位合作者提交至 arXiv 的预印本研究(编号 2609.02889)挑战了自进化 LLM 智能体研究中的一个常见假设:把包裹冻结模型的整套文本提示视为一个连续、扁平的字符串来演化。作者提出,这种“一键式”改写掩盖了不同提示组件之间的差异,使研究者无法判断改进究竟来自何处。为此,他们提出 HARNESSEVO,将智能体的文本 harness 解耦为四个可以独立演化的槽位:角色设定、任务策略、工具/格式规则、反思与控制。

为了在相同计算预算下公平比较,研究者使用同一个反思式优化器,并引入 leave-one-in(只允许某个槽位进化)与 leave-one-out(从完整流程中移除某个槽位)的归因方法。在 ALFWorld 基准上、使用冻结的 7B 参数骨干模型时,HARNESSEVO 的端到端二值成功率为 0.657,对比原始 harness 与扁平字符串演化的 0.642,并没有获得统计上显著的整体提升。但槽位层面的归因显示,几乎所有有效价值都集中在反思/控制槽:单独演化这一槽位可带来 +0.119 的提升,而其他三个槽位单独演化时均为无效改进。

论文还解释了为何常见的“均匀切分预算”会适得其反。假设一次优化过程共有 64 次 rollout,若像许多管线那样平均分给四个槽位,每个槽位只能获得 16 次,低于该反思式优化器的有效搜索下限。结果是每个槽位都停留在空种子状态,看起来仿佛所有组件都不值得优化。相反,当研究者把预算集中在归因分数最高的反思/控制槽后,之前在平均分配中被抵消的收益被重新找回,并在只用拆分预算一半的情况下把成功率提升到 0.761。这一结果说明,计算资源均分并不是一种中性的选择,而是会主动削弱结构化智能体演化的效果。

值得注意的是,上述现象并非普遍规律,而是依赖任务类型。在 WebShop 实验中,所有槽位都保持空种子冻结状态,所有演化方法的表现也几乎相同。作者认为,WebShop 任务中并不存在反复出现、能够被语言化并被反思优化器利用的控制失败,因此问题不在预算不足或搜索能力受限,而是缺少真正可优化的对象。综合结果,研究者提出了三点建议:智能体框架的优化价值是高度局部化的;把预算均匀分配到不同提示组件可能弊大于利;在开展结构化智能体演化之前,应当先做信用分配,优先把资源投给真正造成失败的核心槽位,而不是试图均匀打磨所有提示。

展开要点与分析

文章情报

工程师进阶

要点

  • HARNESSEVO 将智能体的文本框架拆分为角色、任务策略、工具/格式规则、反思/控制四个可独立演化的槽位,并通过 leave-one-in/out 归因衡量各槽位贡献。
  • ALFWorld 上整体成功率与扁平字符串演化无显著差异(0.657 对 0.642),但几乎全部收益集中在反思/控制槽(+0.119),其他槽位单独演化为零。
  • 将 64 次 rollout 均分给四个槽位会让每个槽位低于搜索下限而冻结;集中预算到反思/控制槽可达到 0.761,且用更少预算。
  • WebShop 中所有槽位都冻结、所有方法持平,表明任务中缺少可被反思优化器利用的反复性控制失败,而非预算不足。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。