AI News HubLIVE
站内改写2 分钟阅读

SkillSmith:将智能体技能编译为边界引导的运行时接口

SkillSmith是一种边界优先的编译-运行时框架,通过从技能中提取细粒度操作边界,将技能包离线编译为最小可执行接口。在运行时,智能体仅访问和执行相关组件,避免了不必要的上下文注入和重复推理。在SkillsBench基准上,令牌使用量减少57.44%,思考迭代减少42.99%,求解时间减少50.57%(2.02倍加速),成本减少57.44%。此外,强模型生成的编译制品可被更小或更高效的模型复用,提升任务准确率。

来源arXiv AI作者: Duling Xu, Zheng Chen, Zaifeng Pan, Jiawei Guan, Dong Dong, Jialin Li, Bangzheng Pu

近年来,基于大型语言模型(LLM)的智能体系统在多个领域得到了广泛应用。这类系统通常依赖“技能”(skills)——预定义的功能模块——来完成特定任务。在现有框架中,技能往往以上下文指导的形式被注入到智能体的推理循环中:一旦运行时任务匹配到某个技能,该技能的完整描述便被送入模型,由模型进行推理和规划。然而,这种执行范式存在两个显著的冗余问题。首先,无关上下文的注入:与当前任务无关的技能内容也被一并输入,浪费了令牌预算。其次,重复的技能特定推理:每当任务触发技能时,模型都需要重新进行类似的推理步骤,导致不必要的计算开销。

为了解决这些效率瓶颈,来自研究团队的Duling Xu等人提出了SkillSmith——一种边界优先的编译-运行时框架。该框架的核心思想是:在离线阶段对技能包进行深度分析,提取其中细粒度的操作边界(例如输入输出规范、依赖关系、执行条件),然后将整个技能包编译为一个最小的可执行接口。这个接口只暴露与当前任务直接相关的操作,而隐藏了其他冗余内容。在运行时,智能体不再需要加载完整的技能描述,而是根据任务需求动态地访问并执行接口中的相关组件。这一设计极大地压缩了每次推理所需的上下文长度,并消除了重复的推理步骤。

研究团队在专门构建的SkillsBench基准上对SkillSmith进行了全面评估。与直接使用原始技能的标准方法相比,SkillSmith在求解阶段实现了多项效率提升:令牌使用量减少了57.44%,思考迭代次数降低了42.99%,求解时间缩短了50.57%(即速度提升2.02倍),与令牌相关的货币成本也下降了57.44%。这些数据充分证明了SkillSmith在降低推理开销方面的巨大潜力。

更值得关注的是,SkillSmith的编译制品具有跨模型复用的特性。由较强模型(如GPT-4级别的模型)生成的编译接口,可以被更小或更高效的运行时模型直接使用。在某些场景中,当原始技能的解释失败时,复用编译制品甚至能够提升任务的准确率。这一特性为不同规模模型之间的协作开辟了新的可能性,意味着企业可以在推理时使用成本更低的模型,同时保持甚至提升效果。

SkillSmith的相关论文已发表在arXiv上,源代码和数据集也已通过GitHub开源。这项工作不仅为降低LLM智能体的推理成本提供了切实可行的解决方案,也为未来构建更高效、更灵活的智能体系统奠定了重要的基础。研究者表示,下一步将探索将该框架应用于更复杂的多技能协作场景,并进一步提升编译阶段的自动化程度。