AI News HubLIVE
站內改寫1 分鐘閱讀

無環境合成資料生成:為API呼叫智慧體訓練

蘋果研究團隊提出一種無需真實環境的合成資料生成方法,利用LLM作為數字世界模型,僅透過API規範生成高質量軌跡。在AppWorld和OfficeBench上微調模型取得顯著效能提升,為API智慧體訓練提供了可擴充套件的解決方案。

訓練能夠呼叫應用程式程式設計介面(API)的大型語言模型(LLM)智慧體需要大量高質量的軌跡資料。然而,傳統的資料收集方法通常要求具備完整的執行環境,包括可執行的API和預先填充真實資料的後端資料庫,這嚴重限制了資料規模的可擴充套件性。為了突破這一瓶頸,蘋果機器學習研究團隊提出了一種無需真實環境的合成資料生成方法。

該方法的核心思想是將LLM本身用作動態的數字世界模型。給定僅包含API規範的輸入,系統會自動生成模擬智慧體與有狀態環境之間互動的軌跡。具體流程包括:首先,由一個LLM生成一系列可基於給定API完成的任務;接著,一個教師智慧體逐步解決每個任務,同時另一個LLM模擬器根據任務上下文和模擬歷史生成連貫的合成API響應;最後,一個LLM評判器過濾軌跡,確保資料集質量。

研究團隊在AppWorld和OfficeBench這兩個具有挑戰性的基準上進行了評估,這些基準涵蓋資訊檢索和狀態變更兩類任務。實驗結果表明,使用合成資料微調的模型在效能上取得了顯著提升,證明了即使沒有可執行環境,也能生成有效的監督訊號來訓練API呼叫智慧體。這項工作為跨不同API生態系統的智慧體訓練提供了一種實用且可擴充套件的解決方案。

此外,本文還引用了相關研究,如面向長時互動的強化學習方法和層級動態提示壓縮技術,這些工作共同推動了LLM智慧體在實際應用中的發展。