跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

自進化LLM智慧體的框架最佳化價值所在:區域性化收益與預算均分陷阱

文章摘要

一項新的 arXiv 研究提出 HARNESSEVO,將 LLM 智慧體的文本“harness”拆分為角色、任務策略、工具/格式規則、反思/控制四個可獨立演化的槽位,並用留一入/留一齣歸因衡量各槽位貢獻。在 ALFWorld 上,完整流程的成功率相比扁平字串演化沒有顯著提升(0.657 對 0.642),但幾乎全部增益都集中在反思/控制槽(+0.119)。若將 64 次 rollout 均分到四個槽位,每次僅 16 次、低於有效搜尋下限,所有槽位會凍結;把預算集中到高價值槽位後,用更少預算達到 0.761。WebShop 中所有方法表現持平,說明這種缺失不是因為預算飢餓,而是任務中缺少可語言化的反覆性控制失敗。

來源arXiv Computational Linguistics作者: Michael Nguyen, Wei Chen Tan, Nurul Aisyah Hassan, Arvind Raman, Li Hua Lim, Ahmad Faiz Razak
自進化LLM智慧體的框架最佳化價值所在:區域性化收益與預算均分陷阱
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

一篇由 Michael Nguyen 與五位合作者提交至 arXiv 的預印本研究(編號 2609.02889)挑戰了自進化 LLM 智慧體研究中的一個常見假設:把包裹凍結模型的整套文本提示視為一個連續、扁平的字串來演化。作者提出,這種“一鍵式”改寫掩蓋了不同提示元件之間的差異,使研究者無法判斷改進究竟來自何處。為此,他們提出 HARNESSEVO,將智慧體的文本 harness 解耦為四個可以獨立演化的槽位:角色設定、任務策略、工具/格式規則、反思與控制。

為了在相同計算預算下公平比較,研究者使用同一個反思式最佳化器,並引入 leave-one-in(只允許某個槽位進化)與 leave-one-out(從完整流程中移除某個槽位)的歸因方法。在 ALFWorld 基準上、使用凍結的 7B 引數骨幹模型時,HARNESSEVO 的端到端二值成功率為 0.657,對比原始 harness 與扁平字串演化的 0.642,並沒有獲得統計上顯著的整體提升。但槽位層面的歸因顯示,幾乎所有有效價值都集中在反思/控制槽:單獨演化這一槽位可帶來 +0.119 的提升,而其他三個槽位單獨演化時均為無效改進。

論文還解釋了為何常見的“均勻切分預算”會適得其反。假設一次最佳化過程共有 64 次 rollout,若像許多管線那樣平均分給四個槽位,每個槽位只能獲得 16 次,低於該反思式最佳化器的有效搜尋下限。結果是每個槽位都停留在空種子狀態,看起來彷彿所有元件都不值得最佳化。相反,當研究者把預算集中在歸因分數最高的反思/控制槽後,之前在平均分配中被抵消的收益被重新找回,並在只用拆分預算一半的情況下把成功率提升到 0.761。這一結果說明,計算資源均分並不是一種中性的選擇,而是會主動削弱結構化智慧體演化的效果。

值得注意的是,上述現象並非普遍規律,而是依賴任務型別。在 WebShop 實驗中,所有槽位都保持空種子凍結狀態,所有演化方法的表現也幾乎相同。作者認為,WebShop 任務中並不存在反覆出現、能夠被語言化並被反思最佳化器利用的控制失敗,因此問題不在預算不足或搜尋能力受限,而是缺少真正可最佳化的物件。綜合結果,研究者提出了三點建議:智慧體框架的最佳化價值是高度區域性化的;把預算均勻分配到不同提示元件可能弊大於利;在開展結構化智慧體演化之前,應當先做信用分配,優先把資源投給真正造成失敗的核心槽位,而不是試圖均勻打磨所有提示。

展開要點與分析

文章情報

工程師進階

要點

  • HARNESSEVO 將智慧體的文本框架拆分為角色、任務策略、工具/格式規則、反思/控制四個可獨立演化的槽位,並透過 leave-one-in/out 歸因衡量各槽位貢獻。
  • ALFWorld 上整體成功率與扁平字串演化無顯著差異(0.657 對 0.642),但幾乎全部收益集中在反思/控制槽(+0.119),其他槽位單獨演化為零。
  • 將 64 次 rollout 均分給四個槽位會讓每個槽位低於搜尋下限而凍結;集中預算到反思/控制槽可達到 0.761,且用更少預算。
  • WebShop 中所有槽位都凍結、所有方法持平,表明任務中缺少可被反思最佳化器利用的反覆性控制失敗,而非預算不足。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。