關於代理工具呼叫與強化學習訓練的有效性與效率
該論文系統分析了大型語言模型代理中工具呼叫的有效性和效率問題。在有效性方面,作者發現評估結果對隨機種子、系統提示、多輪模板構建等看似微小且常被文件化的實現細節高度敏感,導致排行榜排名不可靠。在效率方面,作者識別出標準強化學習訓練中的計算浪費來源,並提出了兩種加速技術,在不降低效能的前提下顯著縮短訓練時間。
近日,一篇被ICML 2026接收的論文《On Effectiveness and Efficiency of Agentic Tool-calling and RL Training》由Tong Liu等七位作者共同發表,深入探討了大型語言模型(LLM)代理中工具呼叫的測量與學習問題。工具呼叫作為LLM代理的核心能力,使其能夠超越引數化知識執行復雜任務。然而,如何準確評估和高效學習這一能力仍是當前研究的難點。
在有效性方面,研究團隊系統審視了現有的工具呼叫評估流程,發現許多看似微不足道的實現選擇會對結果產生顯著影響。這些選擇包括隨機種子的設定、系統提示的措辭、多輪對話模板的構建方式以及歷史互動或推理記錄的傳遞方法。作者指出,這些細節在現有文獻中往往缺乏明確記錄,而在多輪互動場景下,由於缺乏嚴格標準化,當前排行榜上的排名可能無法真實反映模型的真實能力。這一發現對社群設計可靠基準測試提出了重要警示。
在效率方面,論文深入分析了用於工具呼叫的標準強化學習(RL)方法,並識別出兩處主要計算浪費。第一,在資料收集(rollout)階段,大量提示並未產生有效的學習訊號,導致計算資源被浪費。第二,在策略更新階段,最佳化過程本身計算成本高昂。針對這些問題,作者提出了兩種新技術:一種透過選擇性取樣減少無效提示,另一種透過更高效的策略最佳化演算法降低更新成本。實驗表明,這些方法能夠在不犧牲效能的前提下實現顯著的訓練加速。
該工作為構建更高效、更可靠的LLM代理提供了重要指導,同時也提醒社群在評估模型工具呼叫能力時需更加關注實驗細節的標準化。