跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

加州大学伯克利分校发布 CUA-Lite:统一计算机使用智能体沙盒、数据、评估与强化学习的开放平台

文章摘要

加州大学伯克利分校研究团队发布 CUA-Lite,这是一个面向计算机使用智能体(CUA)的开放平台,将智能体、环境、轨迹数据和训练/评估框架统一到同一动作空间与数据模式之下。其 Lite.OSWorld 用 Docker 容器替代原有的 QEMU/KVM 虚拟机,内存占用从 4.1GB 降至 0.9GB,在 13 个模型上跑分与 OSWorld VM 一致,并附带 3 万+可验证任务、15+ 基准与 10+ 智能体。

来源MarkTechPost作者: Asif Razzaq
加州大学伯克利分校发布 CUA-Lite:统一计算机使用智能体沙盒、数据、评估与强化学习的开放平台
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

来自加州大学伯克利分校的一个研究团队发布了 CUA-Lite,一个面向计算机使用智能体(computer-use agents)的开放平台。团队的核心论点不是模型本身,而是基础设施:训练和评测这样的智能体通常需要四类组件——智能体、环境、轨迹数据,以及用于评估和训练这些组件的框架;而目前这些组件分散在不同代码库中,接口互不兼容。CUA-Lite 则把它们统一到同一套动作空间、同一种数据模式和同一条命令下,覆盖桌面端、浏览器和移动端。

在可部署性上,项目通过 uv sync --all-extras 安装,运行于 Python 3.12;轻量沙盒可以跑在任何 Docker 主机上,不需要 /dev/kvm,因此云主机、CI runner 和嵌套容器都能直接使用。

平台最具体的成果是 Lite.OSWorld。原版 OSWorld 提供一个完整的 Ubuntu 桌面,但每个任务以 QEMU/KVM 虚拟机方式分发,依赖嵌套虚拟化,而多数托管基础设施并不提供这种能力。CUA-Lite 在普通 Docker 容器内的 GNOME 桌面上重制了相同的任务集和评估器。对比上,OSWorld 需要 4.1GB 内存,Lite.OSWorld 只需 0.9GB;冷启动从 29.9 秒降到 23.8 秒;并行能力约提升 4.6 倍。至于用容器替代虚拟机是否会影响保真度,团队在 13 个模型上验证,Lite.OSWorld 的分数与 OSWorld 虚拟机一致,意味着在容器中获得的分值或训练信号可以迁移到真实基准。

该基础还衍生出一系列沙盒:Lite.ScaleCUA、Lite.CUAGym 和 Lite.CUAWorld。最后者扩展到约 40 个应用,包括 Blender、QGIS 和 VS Code。平台总计提供 3 万多个可验证任务。

数据层面,CUA-Lite 提出 LiteSample,一个在环境、智能体和任务类型间共享的监督式学习模式,使用纯 parquet 加图片格式。已有 10 多个 CUA 数据集被预处理为 LiteSample 并免费发布在 Hugging Face 上,包括 Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey 和 Multimodal-Mind2Web 等。此外,团队让前沿教师模型在沙盒中滚动生成了新的 rollout 数据集,用于蒸馏到较小模型。由于不同模型家族对脚手架要求不同,框架提供了每个模型的适配器,将统一的 LiteSample 打包成各模型的训练格式,包括历史折叠(history collapsing),让多个步骤共享一次前向传播。

在训练与评估方面,lite.gym 以截图为输入、动作为输出,每种平台提供统一动作空间。内置 10 多个智能体(GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B、MAI-UI 等),并集成 15 多个基准,涵盖 grounding(ScreenSpot-Pro、OSWorld-G)、桌面(OSWorld、OSWorld-2、WindowsAgentArena、CUABench)、浏览器(WebArena、VisualWebArena、MiniWoB、WebVoyager、Online-Mind2Web、WebGym)和移动端(AndroidWorld、AndroidLab、MobileWorld、MobileGym)。切换 scripts/rollout.py 中的 --model-id--env-id 即可完成大部分工作。

同样的循环也可用于训练。SFT 示例中,团队以 Lite.ScaleCUA 桌面轨迹对 Qwen3-VL-2B-Instruct 进行微调,在包含 332 个任务的 lite.osworld 评估子集上,平均回合回报从 0.138 提升到 0.237。README 特别说明这是单次报告配置、在两张 GPU 上得到,并非独立复现结果。RL 方面,环境内评分后的 rollouts 驱动基于 Slime 的 GRPO 更新,并提供一个 MobileGym 示例,覆盖 28 个应用中的 416 个移动任务。

需要提醒的是,虽然平台面向任何 Docker 主机即可部署,但仓库目前没有发布明确的开源许可证,商业使用前仍需确认条款。

展开要点与分析

文章情报

工程师进阶

要点

  • CUA-Lite 将智能体、环境、轨迹、训练/评估统一到单一动作空间和 LiteSample 数据模式。
  • Lite.OSWorld 用 Docker 容器取代每任务虚拟机:内存 0.9GB vs 4.1GB,并行实例约 4.6 倍,13 个模型上分数与 OSWorld 虚拟机一致。
  • 平台提供 30k+ 可验证任务、15+ 基准、10+ 智能体,20+ 数据集在 Hugging Face 免费发布。
  • 仓库尚未附明确许可证,商业使用前需确认条款。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。