关于代理工具调用与强化学习训练的有效性与效率
该论文系统分析了大型语言模型代理中工具调用的有效性和效率问题。在有效性方面,作者发现评估结果对随机种子、系统提示、多轮模板构建等看似微小且常被文档化的实现细节高度敏感,导致排行榜排名不可靠。在效率方面,作者识别出标准强化学习训练中的计算浪费来源,并提出了两种加速技术,在不降低性能的前提下显著缩短训练时间。
近日,一篇被ICML 2026接收的论文《On Effectiveness and Efficiency of Agentic Tool-calling and RL Training》由Tong Liu等七位作者共同发表,深入探讨了大型语言模型(LLM)代理中工具调用的测量与学习问题。工具调用作为LLM代理的核心能力,使其能够超越参数化知识执行复杂任务。然而,如何准确评估和高效学习这一能力仍是当前研究的难点。
在有效性方面,研究团队系统审视了现有的工具调用评估流程,发现许多看似微不足道的实现选择会对结果产生显著影响。这些选择包括随机种子的设定、系统提示的措辞、多轮对话模板的构建方式以及历史交互或推理记录的传递方法。作者指出,这些细节在现有文献中往往缺乏明确记录,而在多轮交互场景下,由于缺乏严格标准化,当前排行榜上的排名可能无法真实反映模型的真实能力。这一发现对社区设计可靠基准测试提出了重要警示。
在效率方面,论文深入分析了用于工具调用的标准强化学习(RL)方法,并识别出两处主要计算浪费。第一,在数据收集(rollout)阶段,大量提示并未产生有效的学习信号,导致计算资源被浪费。第二,在策略更新阶段,优化过程本身计算成本高昂。针对这些问题,作者提出了两种新技术:一种通过选择性采样减少无效提示,另一种通过更高效的策略优化算法降低更新成本。实验表明,这些方法能够在不牺牲性能的前提下实现显著的训练加速。
该工作为构建更高效、更可靠的LLM代理提供了重要指导,同时也提醒社区在评估模型工具调用能力时需更加关注实验细节的标准化。