來自加州大學伯克利分校的一個研究團隊釋出了 CUA-Lite,一個面向計算機使用智慧體(computer-use agents)的開放平臺。團隊的核心論點不是模型本身,而是基礎設施:訓練和評測這樣的智慧體通常需要四類元件——智慧體、環境、軌跡資料,以及用於評估和訓練這些元件的框架;而目前這些元件分散在不同程式碼庫中,介面互不相容。CUA-Lite 則把它們統一到同一套動作空間、同一種資料模式和同一條命令下,覆蓋桌面端、瀏覽器和移動端。
在可部署性上,專案透過 uv sync --all-extras 安裝,執行於 Python 3.12;輕量沙盒可以跑在任何 Docker 主機上,不需要 /dev/kvm,因此雲主機、CI runner 和巢狀容器都能直接使用。
平臺最具體的成果是 Lite.OSWorld。原版 OSWorld 提供一個完整的 Ubuntu 桌面,但每個任務以 QEMU/KVM 虛擬機器方式分發,依賴巢狀虛擬化,而多數託管基礎設施並不提供這種能力。CUA-Lite 在普通 Docker 容器內的 GNOME 桌面上重製了相同的任務集和評估器。對比上,OSWorld 需要 4.1GB 記憶體,Lite.OSWorld 只需 0.9GB;冷啟動從 29.9 秒降到 23.8 秒;並行能力約提升 4.6 倍。至於用容器替代虛擬機器是否會影響保真度,團隊在 13 個模型上驗證,Lite.OSWorld 的分數與 OSWorld 虛擬機器一致,意味著在容器中獲得的分值或訓練訊號可以遷移到真實基準。
該基礎還衍生出一系列沙盒:Lite.ScaleCUA、Lite.CUAGym 和 Lite.CUAWorld。最後者擴充套件到約 40 個應用,包括 Blender、QGIS 和 VS Code。平臺總計提供 3 萬多個可驗證任務。
資料層面,CUA-Lite 提出 LiteSample,一個在環境、智慧體和任務型別間共享的監督式學習模式,使用純 parquet 加圖片格式。已有 10 多個 CUA 資料集被預處理為 LiteSample 並免費釋出在 Hugging Face 上,包括 Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey 和 Multimodal-Mind2Web 等。此外,團隊讓前沿教師模型在沙盒中滾動生成了新的 rollout 資料集,用於蒸餾到較小模型。由於不同模型家族對腳手架要求不同,框架提供了每個模型的介面卡,將統一的 LiteSample 打包成各模型的訓練格式,包括歷史摺疊(history collapsing),讓多個步驟共享一次前向傳播。
在訓練與評估方面,lite.gym 以截圖為輸入、動作為輸出,每種平臺提供統一動作空間。內建 10 多個智慧體(GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B、MAI-UI 等),並整合 15 多個基準,涵蓋 grounding(ScreenSpot-Pro、OSWorld-G)、桌面(OSWorld、OSWorld-2、WindowsAgentArena、CUABench)、瀏覽器(WebArena、VisualWebArena、MiniWoB、WebVoyager、Online-Mind2Web、WebGym)和移動端(AndroidWorld、AndroidLab、MobileWorld、MobileGym)。切換 scripts/rollout.py 中的 --model-id 和 --env-id 即可完成大部分工作。
同樣的迴圈也可用於訓練。SFT 示例中,團隊以 Lite.ScaleCUA 桌面軌跡對 Qwen3-VL-2B-Instruct 進行微調,在包含 332 個任務的 lite.osworld 評估子集上,平均回合回報從 0.138 提升到 0.237。README 特別說明這是單次報告配置、在兩張 GPU 上得到,並非獨立復現結果。RL 方面,環境內評分後的 rollouts 驅動基於 Slime 的 GRPO 更新,並提供一個 MobileGym 示例,覆蓋 28 個應用中的 416 個移動任務。
需要提醒的是,雖然平臺面向任何 Docker 主機即可部署,但倉庫目前沒有釋出明確的開源許可證,商業使用前仍需確認條款。