AI News HubLIVE
站內改寫2 分鐘閱讀

Echoverse:為計算機使用代理打造的深度、不斷進化的環境

計算機使用AI代理在多步驟工作流中面臨挑戰。Echoverse通過在逼真的合成環境中訓練代理,幫助它們隨着任務、測試和環境的演變而不斷改進,重點關注深度而非數量。

來源Microsoft Research Blog作者: Akshay Nambi, Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Yash Lara, Ahmed Awadallah, Ece Kamar

Echoverse是微軟研究院推出的一套用於訓練計算機使用代理的深度、不斷進化的合成環境系統。與傳統的依賴於大量訓練任務的方法不同,Echoverse強調環境的質量和深度,通過構建行為逼真的合成世界來提升代理的能力。這些世界不僅複製了真實應用的行為邏輯,還保持了狀態的一致性,使得代理能夠從真實的因果反饋中學習。

研究團隊構建了12個訓練世界,其中10個為深度領域世界,涵蓋電子郵件、日曆、銀行、醫療記錄、論壇、音樂、旅行等多個領域;另外2個為能力世界,專注於訓練代理在特定UI元素(如日期選擇器、嵌套過濾器)上的操作。這些世界均基於真實數據或嚴格生成的種子數據,並配備了基於數據庫的客觀驗證器,確保評估的準確性。

實驗結果顯示,一個9B參數的模型在經過這些世界的訓練後,其性能從36.5%提升至67.1%,僅比GPT-5.4低14個百分點。研究還發現,高模擬保真度至關重要:在淺層世界上訓練的模型出現了性能退化,而在深層世界上訓練的模型則持續進步。此外,針對代理經常失敗的具體UI元素進行針對性訓練,能夠顯著提升代理在未見領域的泛化能力。

Echoverse的核心創新在於其“共同進化”的循環:每次對代理的評估同時也會改進環境本身。當代理在某項任務上失敗時,系統會分析失敗原因,並相應修復環境、任務或驗證器。這樣,代理和環境在每次迭代中都能共同進步。這種閉環反饋機制使得訓練效果不斷疊加,而不會像傳統靜態基準測試那樣飽和。研究團隊認為,真正的槓桿作用不在於增加更多世界,而在於持續改進現有的世界。

世界構建流程包括兩個階段:首先,基於種子場景生成應用規範,並將其編譯為可自動檢查的聲明,然後生成FastAPI和SQLite後端及React前端,並通過持續修復直到所有聲明通過。第二階段是擴展語料庫:將每個任務重新綁定到實時數據庫,通過分析器面板檢查實體的真實性和目標的合理性,並使用瀏覽器測試確保任務可完成。每個失敗都會被標記並分配到相應層進行修復,直到通過率停止提升。這樣,環境和任務共同進化,不斷強化。

驗證器基於數據庫提供了客觀的答案鍵。對於讀取操作,通過與存儲值的語義等價進行評分;對於寫入操作,通過數據庫差異來判斷狀態變化;對於讀寫操作,則取兩者中的較低分。這種評分機制難以被操縱,並且統一適用於所有領域。

完整的領域世界涵蓋了通信協作(EchoMail、EchoCalendar、EchoChat)、技術創建(EchoML、EchoForge)、監管記錄(EchoBank、EchoCare)、社區媒體(EchoForum、EchoTunes)和旅行(EchoStay)等類別。每個世界都忠實再現了真實產品的工作流程,包括權限、共享狀態和審計歷史等複雜結構。例如,EchoStay基於InsideAirbnb的真實數據,擁有超過87條路由和23個數據庫表,模擬了從搜索到支付的全流程。這種深度使得代理能夠學習到真實世界中的因果關係。

能力世界則專注於代理經常失敗的具體交互,如日期選擇器和嵌套過濾器。通過在這些控制元素上進行多種形式的練習,代理學會了在未見過的領域中操作它們。這種針對性訓練極大地提高了泛化能力。

共同進化的循環是Echoverse的核心:每次評估不僅產生訓練數據,還會暴露世界、任務或驗證器中的缺陷,這些缺陷會被自動修復,從而使得下一輪訓練的信號更加鋭利。這種閉環使得訓練效果累積,而不會陷入飽和。

總之,Echoverse通過強調深度、針對性和共同進化,為計算機使用代理的訓練提供了新的方向。它證明了高質量合成環境的價值,並展示瞭如何通過持續改進來推動模型能力的提升。該研究還開源了部分世界,以促進社區進一步探索。