跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

加州大學伯克利分校發佈 CUA-Lite:統一計算機使用智能體沙盒、數據、評估與強化學習的開放平台

文章摘要

加州大學伯克利分校研究團隊發佈 CUA-Lite,這是一個面向計算機使用智能體(CUA)的開放平台,將智能體、環境、軌跡數據和訓練/評估框架統一到同一動作空間與數據模式之下。其 Lite.OSWorld 用 Docker 容器替代原有的 QEMU/KVM 虛擬機,內存佔用從 4.1GB 降至 0.9GB,在 13 個模型上跑分與 OSWorld VM 一致,並附帶 3 萬+可驗證任務、15+ 基準與 10+ 智能體。

來源MarkTechPost作者: Asif Razzaq
加州大學伯克利分校發佈 CUA-Lite:統一計算機使用智能體沙盒、數據、評估與強化學習的開放平台
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

來自加州大學伯克利分校的一個研究團隊發佈了 CUA-Lite,一個面向計算機使用智能體(computer-use agents)的開放平台。團隊的核心論點不是模型本身,而是基礎設施:訓練和評測這樣的智能體通常需要四類組件——智能體、環境、軌跡數據,以及用於評估和訓練這些組件的框架;而目前這些組件分散在不同代碼庫中,接口互不兼容。CUA-Lite 則把它們統一到同一套動作空間、同一種數據模式和同一條命令下,覆蓋桌面端、瀏覽器和移動端。

在可部署性上,項目通過 uv sync --all-extras 安裝,運行於 Python 3.12;輕量沙盒可以跑在任何 Docker 主機上,不需要 /dev/kvm,因此雲主機、CI runner 和嵌套容器都能直接使用。

平台最具體的成果是 Lite.OSWorld。原版 OSWorld 提供一個完整的 Ubuntu 桌面,但每個任務以 QEMU/KVM 虛擬機方式分發,依賴嵌套虛擬化,而多數託管基礎設施並不提供這種能力。CUA-Lite 在普通 Docker 容器內的 GNOME 桌面上重製了相同的任務集和評估器。對比上,OSWorld 需要 4.1GB 內存,Lite.OSWorld 只需 0.9GB;冷啓動從 29.9 秒降到 23.8 秒;並行能力約提升 4.6 倍。至於用容器替代虛擬機是否會影響保真度,團隊在 13 個模型上驗證,Lite.OSWorld 的分數與 OSWorld 虛擬機一致,意味着在容器中獲得的分值或訓練信號可以遷移到真實基準。

該基礎還衍生出一系列沙盒:Lite.ScaleCUA、Lite.CUAGym 和 Lite.CUAWorld。最後者擴展到約 40 個應用,包括 Blender、QGIS 和 VS Code。平台總計提供 3 萬多個可驗證任務。

數據層面,CUA-Lite 提出 LiteSample,一個在環境、智能體和任務類型間共享的監督式學習模式,使用純 parquet 加圖片格式。已有 10 多個 CUA 數據集被預處理為 LiteSample 並免費發佈在 Hugging Face 上,包括 Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey 和 Multimodal-Mind2Web 等。此外,團隊讓前沿教師模型在沙盒中滾動生成了新的 rollout 數據集,用於蒸餾到較小模型。由於不同模型家族對腳手架要求不同,框架提供了每個模型的適配器,將統一的 LiteSample 打包成各模型的訓練格式,包括歷史摺疊(history collapsing),讓多個步驟共享一次前向傳播。

在訓練與評估方面,lite.gym 以截圖為輸入、動作為輸出,每種平台提供統一動作空間。內置 10 多個智能體(GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B、MAI-UI 等),並集成 15 多個基準,涵蓋 grounding(ScreenSpot-Pro、OSWorld-G)、桌面(OSWorld、OSWorld-2、WindowsAgentArena、CUABench)、瀏覽器(WebArena、VisualWebArena、MiniWoB、WebVoyager、Online-Mind2Web、WebGym)和移動端(AndroidWorld、AndroidLab、MobileWorld、MobileGym)。切換 scripts/rollout.py 中的 --model-id--env-id 即可完成大部分工作。

同樣的循環也可用於訓練。SFT 示例中,團隊以 Lite.ScaleCUA 桌面軌跡對 Qwen3-VL-2B-Instruct 進行微調,在包含 332 個任務的 lite.osworld 評估子集上,平均回合回報從 0.138 提升到 0.237。README 特別説明這是單次報告配置、在兩張 GPU 上得到,並非獨立復現結果。RL 方面,環境內評分後的 rollouts 驅動基於 Slime 的 GRPO 更新,並提供一個 MobileGym 示例,覆蓋 28 個應用中的 416 個移動任務。

需要提醒的是,雖然平台面向任何 Docker 主機即可部署,但倉庫目前沒有發佈明確的開源許可證,商業使用前仍需確認條款。

展開要點與分析

文章情報

工程師進階

要點

  • CUA-Lite 將智能體、環境、軌跡、訓練/評估統一到單一動作空間和 LiteSample 數據模式。
  • Lite.OSWorld 用 Docker 容器取代每任務虛擬機:內存 0.9GB vs 4.1GB,並行實例約 4.6 倍,13 個模型上分數與 OSWorld 虛擬機一致。
  • 平台提供 30k+ 可驗證任務、15+ 基準、10+ 智能體,20+ 數據集在 Hugging Face 免費發佈。
  • 倉庫尚未附明確許可證,商業使用前需確認條款。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。