AI News HubLIVE
站內改寫1 分鐘閱讀

無環境合成數據生成:為API調用智能體訓練

蘋果研究團隊提出一種無需真實環境的合成數據生成方法,利用LLM作為數字世界模型,僅通過API規範生成高質量軌跡。在AppWorld和OfficeBench上微調模型取得顯著性能提升,為API智能體訓練提供了可擴展的解決方案。

訓練能夠調用應用程序編程接口(API)的大型語言模型(LLM)智能體需要大量高質量的軌跡數據。然而,傳統的數據收集方法通常要求具備完整的執行環境,包括可運行的API和預先填充真實數據的後端數據庫,這嚴重限制了數據規模的可擴展性。為了突破這一瓶頸,蘋果機器學習研究團隊提出了一種無需真實環境的合成數據生成方法。

該方法的核心思想是將LLM本身用作動態的數字世界模型。給定僅包含API規範的輸入,系統會自動生成模擬智能體與有狀態環境之間交互的軌跡。具體流程包括:首先,由一個LLM生成一系列可基於給定API完成的任務;接着,一個教師智能體逐步解決每個任務,同時另一個LLM模擬器根據任務上下文和模擬歷史生成連貫的合成API響應;最後,一個LLM評判器過濾軌跡,確保數據集質量。

研究團隊在AppWorld和OfficeBench這兩個具有挑戰性的基準上進行了評估,這些基準涵蓋信息檢索和狀態變更兩類任務。實驗結果表明,使用合成數據微調的模型在性能上取得了顯著提升,證明了即使沒有可執行環境,也能生成有效的監督信號來訓練API調用智能體。這項工作為跨不同API生態系統的智能體訓練提供了一種實用且可擴展的解決方案。

此外,本文還引用了相關研究,如面向長時交互的強化學習方法和層級動態提示壓縮技術,這些工作共同推動了LLM智能體在實際應用中的發展。