AI News HubLIVE
站内改写2 分钟阅读

LLM智能体系统中技能的规模定律

一项研究揭示了LLM智能体系统中技能库规模的缩放定律:路由误差随库大小对数增长,而正确执行可改善下游决策。通过优化,路由准确率从71.3%提升至91.7%,任务通过率显著提升。

来源arXiv Computational Linguistics作者: Charles Chen, Qiming Yu, Yuhang Gu, Zhuoye Huang, Hanjing Li, Hongyu Liu, Simin Liu, Jinhao Liu, Dengyun Peng, Jiangyi Wang, Zheng Yan, Fanqing Meng, Ethan Qin, Carl Che, Mengkang Hu

近日,一篇发表在arXiv上的研究论文《The Scaling Laws of Skills in LLM Agent Systems》系统探讨了LLM智能体系统中技能库的规模定律。该研究由Charles Chen等15位作者共同完成,通过对15个前沿LLM、1141个真实世界技能以及超过300万次路由或执行决策的分析,揭示了两条相互耦合的定律,为设计和优化大规模智能体系统提供了理论基础。

首先,路由定律指出,单步路由的准确率随着技能库规模的增大而对数衰减,在所有模型上的拟合优度R²均高于0.97。随着技能库变大,错误模式经历了三个阶段:最初是局部技能之间的竞争,然后演变为跨技能家族的漂移,最终被过于通用的“黑洞技能”捕获——这些技能虽然泛化能力强,但往往导致错误的路由选择。这一发现揭示了为什么简单地增加技能数量反而会降低系统性能。

其次,执行定律表明,在状态实现之前,联合路由近似满足乘法关系,即路由和执行是耦合的。重要的是,正确的执行可以将困难的下游决策准确率提升约4倍,这意味着在执行阶段纠正路由错误是可行的。一个关键参数——路由对数衰减速率的斜率b——同时控制着这两条定律:通过路由侧的拟合可以预测执行侧的挽救效果,说明相同的库属性既影响执行前的崩溃也影响下游的可恢复性。

基于这些定律的优化方法将保留路由准确率从71.3%提升至91.7%,劫持率从22.4%降低至4.1%,并在下游ClawBench和ClawMark执行任务中表现出正向迁移,平均通过率分别从49.3%提升至61.6%和从28.4%提升至34.5%。这些改进表明,通过优化技能库的结构、粒度和曝光策略,可以显著提升智能体系统的整体性能。

这项研究强调,智能体的性能不仅依赖于模型本身的能力,还深深受到技能库的组织方式的影响。对于AI工程师和系统设计者来说,这意味着在构建大规模智能体系统时,需要仔细考虑技能库的设计,包括如何定义技能粒度、如何组织技能家族以及如何曝光技能给路由机制。这些发现为未来开发更高效、更可靠的智能体系统提供了重要的指导。