AI News HubLIVE
站内改写2 分钟阅读

Echoverse:为计算机使用代理打造的深度、不断进化的环境

计算机使用AI代理在多步骤工作流中面临挑战。Echoverse通过在逼真的合成环境中训练代理,帮助它们随着任务、测试和环境的演变而不断改进,重点关注深度而非数量。

来源Microsoft Research Blog作者: Akshay Nambi, Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Yash Lara, Ahmed Awadallah, Ece Kamar

Echoverse是微软研究院推出的一套用于训练计算机使用代理的深度、不断进化的合成环境系统。与传统的依赖于大量训练任务的方法不同,Echoverse强调环境的质量和深度,通过构建行为逼真的合成世界来提升代理的能力。这些世界不仅复制了真实应用的行为逻辑,还保持了状态的一致性,使得代理能够从真实的因果反馈中学习。

研究团队构建了12个训练世界,其中10个为深度领域世界,涵盖电子邮件、日历、银行、医疗记录、论坛、音乐、旅行等多个领域;另外2个为能力世界,专注于训练代理在特定UI元素(如日期选择器、嵌套过滤器)上的操作。这些世界均基于真实数据或严格生成的种子数据,并配备了基于数据库的客观验证器,确保评估的准确性。

实验结果显示,一个9B参数的模型在经过这些世界的训练后,其性能从36.5%提升至67.1%,仅比GPT-5.4低14个百分点。研究还发现,高模拟保真度至关重要:在浅层世界上训练的模型出现了性能退化,而在深层世界上训练的模型则持续进步。此外,针对代理经常失败的具体UI元素进行针对性训练,能够显著提升代理在未见领域的泛化能力。

Echoverse的核心创新在于其“共同进化”的循环:每次对代理的评估同时也会改进环境本身。当代理在某项任务上失败时,系统会分析失败原因,并相应修复环境、任务或验证器。这样,代理和环境在每次迭代中都能共同进步。这种闭环反馈机制使得训练效果不断叠加,而不会像传统静态基准测试那样饱和。研究团队认为,真正的杠杆作用不在于增加更多世界,而在于持续改进现有的世界。

世界构建流程包括两个阶段:首先,基于种子场景生成应用规范,并将其编译为可自动检查的声明,然后生成FastAPI和SQLite后端及React前端,并通过持续修复直到所有声明通过。第二阶段是扩展语料库:将每个任务重新绑定到实时数据库,通过分析器面板检查实体的真实性和目标的合理性,并使用浏览器测试确保任务可完成。每个失败都会被标记并分配到相应层进行修复,直到通过率停止提升。这样,环境和任务共同进化,不断强化。

验证器基于数据库提供了客观的答案键。对于读取操作,通过与存储值的语义等价进行评分;对于写入操作,通过数据库差异来判断状态变化;对于读写操作,则取两者中的较低分。这种评分机制难以被操纵,并且统一适用于所有领域。

完整的领域世界涵盖了通信协作(EchoMail、EchoCalendar、EchoChat)、技术创建(EchoML、EchoForge)、监管记录(EchoBank、EchoCare)、社区媒体(EchoForum、EchoTunes)和旅行(EchoStay)等类别。每个世界都忠实再现了真实产品的工作流程,包括权限、共享状态和审计历史等复杂结构。例如,EchoStay基于InsideAirbnb的真实数据,拥有超过87条路由和23个数据库表,模拟了从搜索到支付的全流程。这种深度使得代理能够学习到真实世界中的因果关系。

能力世界则专注于代理经常失败的具体交互,如日期选择器和嵌套过滤器。通过在这些控制元素上进行多种形式的练习,代理学会了在未见过的领域中操作它们。这种针对性训练极大地提高了泛化能力。

共同进化的循环是Echoverse的核心:每次评估不仅产生训练数据,还会暴露世界、任务或验证器中的缺陷,这些缺陷会被自动修复,从而使得下一轮训练的信号更加锐利。这种闭环使得训练效果累积,而不会陷入饱和。

总之,Echoverse通过强调深度、针对性和共同进化,为计算机使用代理的训练提供了新的方向。它证明了高质量合成环境的价值,并展示了如何通过持续改进来推动模型能力的提升。该研究还开源了部分世界,以促进社区进一步探索。