一篇由 Michael Nguyen 與五位合作者提交至 arXiv 的預印本研究(編號 2609.02889)挑戰了自進化 LLM 智能體研究中的一個常見假設:把包裹凍結模型的整套文本提示視為一個連續、扁平的字符串來演化。作者提出,這種“一鍵式”改寫掩蓋了不同提示組件之間的差異,使研究者無法判斷改進究竟來自何處。為此,他們提出 HARNESSEVO,將智能體的文本 harness 解耦為四個可以獨立演化的槽位:角色設定、任務策略、工具/格式規則、反思與控制。
為了在相同計算預算下公平比較,研究者使用同一個反思式優化器,並引入 leave-one-in(只允許某個槽位進化)與 leave-one-out(從完整流程中移除某個槽位)的歸因方法。在 ALFWorld 基準上、使用凍結的 7B 參數骨幹模型時,HARNESSEVO 的端到端二值成功率為 0.657,對比原始 harness 與扁平字符串演化的 0.642,並沒有獲得統計上顯著的整體提升。但槽位層面的歸因顯示,幾乎所有有效價值都集中在反思/控制槽:單獨演化這一槽位可帶來 +0.119 的提升,而其他三個槽位單獨演化時均為無效改進。
論文還解釋了為何常見的“均勻切分預算”會適得其反。假設一次優化過程共有 64 次 rollout,若像許多管線那樣平均分給四個槽位,每個槽位只能獲得 16 次,低於該反思式優化器的有效搜索下限。結果是每個槽位都停留在空種子狀態,看起來彷彿所有組件都不值得優化。相反,當研究者把預算集中在歸因分數最高的反思/控制槽後,之前在平均分配中被抵消的收益被重新找回,並在只用拆分預算一半的情況下把成功率提升到 0.761。這一結果説明,計算資源均分並不是一種中性的選擇,而是會主動削弱結構化智能體演化的效果。
值得注意的是,上述現象並非普遍規律,而是依賴任務類型。在 WebShop 實驗中,所有槽位都保持空種子凍結狀態,所有演化方法的表現也幾乎相同。作者認為,WebShop 任務中並不存在反覆出現、能夠被語言化並被反思優化器利用的控制失敗,因此問題不在預算不足或搜索能力受限,而是缺少真正可優化的對象。綜合結果,研究者提出了三點建議:智能體框架的優化價值是高度局部化的;把預算均勻分配到不同提示組件可能弊大於利;在開展結構化智能體演化之前,應當先做信用分配,優先把資源投給真正造成失敗的核心槽位,而不是試圖均勻打磨所有提示。