来自加州大学伯克利分校的一个研究团队发布了 CUA-Lite,一个面向计算机使用智能体(computer-use agents)的开放平台。团队的核心论点不是模型本身,而是基础设施:训练和评测这样的智能体通常需要四类组件——智能体、环境、轨迹数据,以及用于评估和训练这些组件的框架;而目前这些组件分散在不同代码库中,接口互不兼容。CUA-Lite 则把它们统一到同一套动作空间、同一种数据模式和同一条命令下,覆盖桌面端、浏览器和移动端。
在可部署性上,项目通过 uv sync --all-extras 安装,运行于 Python 3.12;轻量沙盒可以跑在任何 Docker 主机上,不需要 /dev/kvm,因此云主机、CI runner 和嵌套容器都能直接使用。
平台最具体的成果是 Lite.OSWorld。原版 OSWorld 提供一个完整的 Ubuntu 桌面,但每个任务以 QEMU/KVM 虚拟机方式分发,依赖嵌套虚拟化,而多数托管基础设施并不提供这种能力。CUA-Lite 在普通 Docker 容器内的 GNOME 桌面上重制了相同的任务集和评估器。对比上,OSWorld 需要 4.1GB 内存,Lite.OSWorld 只需 0.9GB;冷启动从 29.9 秒降到 23.8 秒;并行能力约提升 4.6 倍。至于用容器替代虚拟机是否会影响保真度,团队在 13 个模型上验证,Lite.OSWorld 的分数与 OSWorld 虚拟机一致,意味着在容器中获得的分值或训练信号可以迁移到真实基准。
该基础还衍生出一系列沙盒:Lite.ScaleCUA、Lite.CUAGym 和 Lite.CUAWorld。最后者扩展到约 40 个应用,包括 Blender、QGIS 和 VS Code。平台总计提供 3 万多个可验证任务。
数据层面,CUA-Lite 提出 LiteSample,一个在环境、智能体和任务类型间共享的监督式学习模式,使用纯 parquet 加图片格式。已有 10 多个 CUA 数据集被预处理为 LiteSample 并免费发布在 Hugging Face 上,包括 Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey 和 Multimodal-Mind2Web 等。此外,团队让前沿教师模型在沙盒中滚动生成了新的 rollout 数据集,用于蒸馏到较小模型。由于不同模型家族对脚手架要求不同,框架提供了每个模型的适配器,将统一的 LiteSample 打包成各模型的训练格式,包括历史折叠(history collapsing),让多个步骤共享一次前向传播。
在训练与评估方面,lite.gym 以截图为输入、动作为输出,每种平台提供统一动作空间。内置 10 多个智能体(GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B、MAI-UI 等),并集成 15 多个基准,涵盖 grounding(ScreenSpot-Pro、OSWorld-G)、桌面(OSWorld、OSWorld-2、WindowsAgentArena、CUABench)、浏览器(WebArena、VisualWebArena、MiniWoB、WebVoyager、Online-Mind2Web、WebGym)和移动端(AndroidWorld、AndroidLab、MobileWorld、MobileGym)。切换 scripts/rollout.py 中的 --model-id 和 --env-id 即可完成大部分工作。
同样的循环也可用于训练。SFT 示例中,团队以 Lite.ScaleCUA 桌面轨迹对 Qwen3-VL-2B-Instruct 进行微调,在包含 332 个任务的 lite.osworld 评估子集上,平均回合回报从 0.138 提升到 0.237。README 特别说明这是单次报告配置、在两张 GPU 上得到,并非独立复现结果。RL 方面,环境内评分后的 rollouts 驱动基于 Slime 的 GRPO 更新,并提供一个 MobileGym 示例,覆盖 28 个应用中的 416 个移动任务。
需要提醒的是,虽然平台面向任何 Docker 主机即可部署,但仓库目前没有发布明确的开源许可证,商业使用前仍需确认条款。