Echoverse:為計算機使用代理打造的深度、不斷進化的環境
計算機使用AI代理在多步驟工作流中面臨挑戰。Echoverse透過在逼真的合成環境中訓練代理,幫助它們隨著任務、測試和環境的演變而不斷改進,重點關注深度而非數量。
Echoverse是微軟研究院推出的一套用於訓練計算機使用代理的深度、不斷進化的合成環境系統。與傳統的依賴於大量訓練任務的方法不同,Echoverse強調環境的質量和深度,透過構建行為逼真的合成世界來提升代理的能力。這些世界不僅複製了真實應用的行為邏輯,還保持了狀態的一致性,使得代理能夠從真實的因果反饋中學習。
研究團隊構建了12個訓練世界,其中10個為深度領域世界,涵蓋電子郵件、日曆、銀行、醫療記錄、論壇、音樂、旅行等多個領域;另外2個為能力世界,專注於訓練代理在特定UI元素(如日期選擇器、巢狀過濾器)上的操作。這些世界均基於真實資料或嚴格生成的種子資料,並配備了基於資料庫的客觀驗證器,確保評估的準確性。
實驗結果顯示,一個9B引數的模型在經過這些世界的訓練後,其效能從36.5%提升至67.1%,僅比GPT-5.4低14個百分點。研究還發現,高模擬保真度至關重要:在淺層世界上訓練的模型出現了效能退化,而在深層世界上訓練的模型則持續進步。此外,針對代理經常失敗的具體UI元素進行針對性訓練,能夠顯著提升代理在未見領域的泛化能力。
Echoverse的核心創新在於其“共同進化”的迴圈:每次對代理的評估同時也會改進環境本身。當代理在某項任務上失敗時,系統會分析失敗原因,並相應修復環境、任務或驗證器。這樣,代理和環境在每次迭代中都能共同進步。這種閉環反饋機制使得訓練效果不斷疊加,而不會像傳統靜態基準測試那樣飽和。研究團隊認為,真正的槓桿作用不在於增加更多世界,而在於持續改進現有的世界。
世界構建流程包括兩個階段:首先,基於種子場景生成應用規範,並將其編譯為可自動檢查的宣告,然後生成FastAPI和SQLite後端及React前端,並透過持續修復直到所有宣告透過。第二階段是擴充套件語料庫:將每個任務重新繫結到即時資料庫,透過分析器面板檢查實體的真實性和目標的合理性,並使用瀏覽器測試確保任務可完成。每個失敗都會被標記並分配到相應層進行修復,直到透過率停止提升。這樣,環境和任務共同進化,不斷強化。
驗證器基於資料庫提供了客觀的答案鍵。對於讀取操作,透過與儲存值的語義等價進行評分;對於寫入操作,透過資料庫差異來判斷狀態變化;對於讀寫操作,則取兩者中的較低分。這種評分機制難以被操縱,並且統一適用於所有領域。
完整的領域世界涵蓋了通訊協作(EchoMail、EchoCalendar、EchoChat)、技術建立(EchoML、EchoForge)、監管記錄(EchoBank、EchoCare)、社群媒體(EchoForum、EchoTunes)和旅行(EchoStay)等類別。每個世界都忠實再現了真實產品的工作流程,包括許可權、共享狀態和審計歷史等複雜結構。例如,EchoStay基於InsideAirbnb的真實資料,擁有超過87條路由和23個資料庫表,模擬了從搜尋到支付的全流程。這種深度使得代理能夠學習到真實世界中的因果關係。
能力世界則專注於代理經常失敗的具體互動,如日期選擇器和巢狀過濾器。透過在這些控制元素上進行多種形式的練習,代理學會了在未見過的領域中操作它們。這種針對性訓練極大地提高了泛化能力。
共同進化的迴圈是Echoverse的核心:每次評估不僅產生訓練資料,還會暴露世界、任務或驗證器中的缺陷,這些缺陷會被自動修復,從而使得下一輪訓練的訊號更加銳利。這種閉環使得訓練效果累積,而不會陷入飽和。
總之,Echoverse透過強調深度、針對性和共同進化,為計算機使用代理的訓練提供了新的方向。它證明了高質量合成環境的價值,並展示瞭如何透過持續改進來推動模型能力的提升。該研究還開源了部分世界,以促進社群進一步探索。