本文にスキップ
AI News HubLIVE
サイト内リライト3 分で読了

UCバークレー、コンピューター利用エージェントのサンドボックス・データ・評価・RLを統合するオープンプラットフォーム「CUA-Lite」を公開

記事の要約

UCバークレーの研究チームが公開したCUA-Liteは、コンピューター利用エージェント(CUA)を構成するエージェント、環境、軌跡、評価・訓練フレームワークを、単一のアクション空間と単一のデータスキーマに統一するオープンプラットフォーム。Lite.OSWorldはOSWorldのタスクをQEMU/KVM VMではなくDockerコンテナで実行し、メモリを4.1GBから0.9GBに削減。13モデルでVMと同等のスコアを達成し、3万以上の検証可能なタスク、15以上のベンチマーク、10以上のエージェントを備える。

ソースMarkTechPost著者: Asif Razzaq
UCバークレー、コンピューター利用エージェントのサンドボックス・データ・評価・RLを統合するオープンプラットフォーム「CUA-Lite」を公開
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

カリフォルニア大学バークレー校の研究チームは、コンピューター利用エージェント(CUA)のためのオープンプラットフォーム「CUA-Lite」を公開しました。その背後にある主張はモデル中心ではなくインフラ中心です。CUAの訓練とベンチマークにはエージェント、環境、軌跡(トレース)、そしてそれらを評価・訓練するフレームワークという4つの要素が必要ですが、現状はそれぞれが別々のリポジトリに分かれ、互換性のないインターフェースを持っています。CUA-Liteはこれらを、デスクトップ・ブラウザ・モバイルにわたって、1つのアクション空間、1つのデータスキーマ、1つのコマンドの背後にまとめます。

展開可能性も重視されています。スタックはPython 3.12上でuv sync --all-extrasによりインストールでき、軽量サンドボックスは/dev/kvmを必要としないDockerホスト上で動作するため、クラウドインスタンスやCIランナー、入れ子コンテナでも利用可能です。

最も具体的な貢献はLite.OSWorldです。OSWorldは忠実なUbuntuデスクトップを提供しますが、タスクごとに完全なQEMU/KVM仮想マシンとして配布され、多くのマネージドインフラでは提供されないネスト仮想化が必要でした。CUA-Liteは同じタスクスイートと評価器を、通常のDockerコンテナ上のGNOMEデスクトップで再現します。OSWorldと比較すると、メモリ使用量は4.1GBから0.9GBに削減され、コールドスタートは29.9秒から23.8秒に短縮、並列実行は約4.6倍に向上し、タスクスイートは同一です。VMをコンテナに置き換える際の忠実度が懸念されますが、チームは13モデルにわたってLite.OSWorldのスコアがOSWorld VMと一致することを確認しており、コンテナで得たスコアや訓練シグナルは実際のベンチマークに転移します。この基盤はLite.ScaleCUA、Lite.CUAGym、Lite.CUAWorldといったサンドボックス群にも展開され、後者はBlender、QGIS、VS Codeなど約40のアプリケーションをカバーします。プラットフォーム全体で3万以上の検証可能なタスクを提供するとされています。

データ層では、CUA-LiteはLiteSampleというスキーマを導入します。これは全環境・エージェント・タスクタイプで共有される教師あり学習用のスキーマで、parquetと画像だけで構成されます。Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey、Multimodal-Mind2Webなど10以上の既存CUAデータセットがこの形式に変換され、Hugging Faceで無料公開されています。さらに、フロンティア教師モデルをサンドボックス上でロールアウトして生成した新しいデータセットも追加され、小型の学生モデルへの蒸留に使えます。モデルによって要求される足場(scaffolding)は異なるため、フレームワークは各モデル向けのアダプタを備え、統一LiteSampleを各モデルの訓練形式に変換します。複数ステップを1回のフォワードパスで処理できるよう履歴を畳み込む機能も含まれます。

エージェントと環境は lite.gym で接続されます。スクリーンショットが入力、アクションが出力で、プラットフォームごとに1つのアクション空間を持ちます。GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B、MAI-UIなど10以上のエージェントが組み込まれ、15以上のベンチマークが統合されています。統合ベンチマークには、グラウンディング(ScreenSpot-Pro、OSWorld-G)、デスクトップ(OSWorld、OSWorld-2、WindowsAgentArena、CUABench)、ブラウザ(WebArena、VisualWebArena、MiniWoB、WebVoyager、Online-Mind2Web、WebGym)、モバイル(AndroidWorld、AndroidLab、MobileWorld、MobileGym)が含まれます。scripts/rollout.py--model-id--env-idを切り替えるだけでインターフェースが完了します。

同じループは訓練にも使えます。SFTでは、Lite.ScaleCUAのデスクトップ軌跡を使ってQwen3-VL-2B-Instructを微調整し、332タスクのlite.osworld評価分割で平均エピソードリターンを0.138から0.237へ向上させたと報告されています。これは2枚のGPU上での単一の報告構成であり、独立に再現された結果ではないとREADMEに明記されています。RLでは、環境でスコアリングされたロールアウトがSlime上のGRPO更新を駆動し、28アプリにわたる416のモバイルタスクを取り扱うMobileGymの実例も提供されています。

なお、リポジトリには明示的なライセンスがまだ付与されていないため、商用利用前に規約を確認する必要があります。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • CUA-Liteはエージェント・環境・軌跡・訓練/評価を単一のアクション空間とLiteSampleスキーマに統合する。
  • Lite.OSWorldはVMなしでOSWorldタスクをDocker上で実行。メモリ0.9GB(従来4.1GB)、約4.6倍の並列性、13モデルでVMと同等スコア。
  • 30k以上の検証可能なタスク、15以上のベンチマーク、10以上のエージェント、20以上のデータセットをHugging Faceで無料公開。
  • リポジトリに明示的なライセンスが無いため、商用利用前に利用条件を確認する必要がある。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。