无环境合成数据生成:为API调用智能体训练
苹果研究团队提出一种无需真实环境的合成数据生成方法,利用LLM作为数字世界模型,仅通过API规范生成高质量轨迹。在AppWorld和OfficeBench上微调模型取得显著性能提升,为API智能体训练提供了可扩展的解决方案。
训练能够调用应用程序编程接口(API)的大型语言模型(LLM)智能体需要大量高质量的轨迹数据。然而,传统的数据收集方法通常要求具备完整的执行环境,包括可运行的API和预先填充真实数据的后端数据库,这严重限制了数据规模的可扩展性。为了突破这一瓶颈,苹果机器学习研究团队提出了一种无需真实环境的合成数据生成方法。
该方法的核心思想是将LLM本身用作动态的数字世界模型。给定仅包含API规范的输入,系统会自动生成模拟智能体与有状态环境之间交互的轨迹。具体流程包括:首先,由一个LLM生成一系列可基于给定API完成的任务;接着,一个教师智能体逐步解决每个任务,同时另一个LLM模拟器根据任务上下文和模拟历史生成连贯的合成API响应;最后,一个LLM评判器过滤轨迹,确保数据集质量。
研究团队在AppWorld和OfficeBench这两个具有挑战性的基准上进行了评估,这些基准涵盖信息检索和状态变更两类任务。实验结果表明,使用合成数据微调的模型在性能上取得了显著提升,证明了即使没有可执行环境,也能生成有效的监督信号来训练API调用智能体。这项工作为跨不同API生态系统的智能体训练提供了一种实用且可扩展的解决方案。
此外,本文还引用了相关研究,如面向长时交互的强化学习方法和层级动态提示压缩技术,这些工作共同推动了LLM智能体在实际应用中的发展。