一篇由 Michael Nguyen 与五位合作者提交至 arXiv 的预印本研究(编号 2609.02889)挑战了自进化 LLM 智能体研究中的一个常见假设:把包裹冻结模型的整套文本提示视为一个连续、扁平的字符串来演化。作者提出,这种“一键式”改写掩盖了不同提示组件之间的差异,使研究者无法判断改进究竟来自何处。为此,他们提出 HARNESSEVO,将智能体的文本 harness 解耦为四个可以独立演化的槽位:角色设定、任务策略、工具/格式规则、反思与控制。
为了在相同计算预算下公平比较,研究者使用同一个反思式优化器,并引入 leave-one-in(只允许某个槽位进化)与 leave-one-out(从完整流程中移除某个槽位)的归因方法。在 ALFWorld 基准上、使用冻结的 7B 参数骨干模型时,HARNESSEVO 的端到端二值成功率为 0.657,对比原始 harness 与扁平字符串演化的 0.642,并没有获得统计上显著的整体提升。但槽位层面的归因显示,几乎所有有效价值都集中在反思/控制槽:单独演化这一槽位可带来 +0.119 的提升,而其他三个槽位单独演化时均为无效改进。
论文还解释了为何常见的“均匀切分预算”会适得其反。假设一次优化过程共有 64 次 rollout,若像许多管线那样平均分给四个槽位,每个槽位只能获得 16 次,低于该反思式优化器的有效搜索下限。结果是每个槽位都停留在空种子状态,看起来仿佛所有组件都不值得优化。相反,当研究者把预算集中在归因分数最高的反思/控制槽后,之前在平均分配中被抵消的收益被重新找回,并在只用拆分预算一半的情况下把成功率提升到 0.761。这一结果说明,计算资源均分并不是一种中性的选择,而是会主动削弱结构化智能体演化的效果。
值得注意的是,上述现象并非普遍规律,而是依赖任务类型。在 WebShop 实验中,所有槽位都保持空种子冻结状态,所有演化方法的表现也几乎相同。作者认为,WebShop 任务中并不存在反复出现、能够被语言化并被反思优化器利用的控制失败,因此问题不在预算不足或搜索能力受限,而是缺少真正可优化的对象。综合结果,研究者提出了三点建议:智能体框架的优化价值是高度局部化的;把预算均匀分配到不同提示组件可能弊大于利;在开展结构化智能体演化之前,应当先做信用分配,优先把资源投给真正造成失败的核心槽位,而不是试图均匀打磨所有提示。