AI News HubLIVE
サイト内リライト5 分で読了

Google DeepMind、全身制御・巧緻性・マルチロボット協調のための3つの物理AIモデルを発表

Google DeepMindは、次世代ロボットのためのインテリジェンスレイヤー「Gemini Robotics 2」をリリースした。今回のリリースでは、全身人型制御のための視覚-言語-動作モデル、具現化推論とタスクオーケストレーションのためのGemini Robotics ER 2、そして数時間で新しいロボットボディに適応するオンデバイスVLAの3つのモデルが提供される。1つのチェックポイントでApptronik Apollo 2とFranka Duoを駆動する。一般公開されているのはER 2のみ。

ソースMarkTechPost著者: Asif Razzaq

Google DeepMindは、次世代ロボットのためのインテリジェンスレイヤー「Gemini Robotics 2」をリリースしました。今回のリリースにより、ロボットの能力はテーブルトップ操作から全身制御、五指の巧緻操作、マルチロボット協調へと拡張されます。このバージョンは3つの独立したモデルで構成され、それぞれ異なるアクセスレベルが設定されています。

現在のロボットのほとんどは、狭く反復的なタスクシーケンスのために事前プログラムまたは遠隔操作されています。予測不能な環境に適応できず、スキルがロボットボディ間で転送されることもほとんどありません。Gemini Robotics 2は、これら3つの制限を同時に解決することを目指しています。

3つのモデルの詳細

Gemini Robotics 2は視覚-言語-動作(VLA)モデルです。視覚と言語入力をモーター制御信号に変換します。完全な人型ロボット(足の指先まで)や他の二腕ロボットを駆動できます。また、多指ハンドとパラレルグリッパーの両方で巧緻操作を処理します。

Gemini Robotics ER 2は具現化推論(ER)モデルです。高レベルの頭脳として機能する視覚言語モデルです。人間とコミュニケーションし、物理世界を理解し、数分間に及ぶマルチステップタスクを計画します。モデルカードによると、ER 2はGemini 3.5 Flashをベースにしており、テキスト、画像、ビデオ、オーディオをインターリーブして受け付け、最大128kのコンテキストウィンドウを持ち、最大64Kトークンのテキストを出力します。

Gemini Robotics On-Device 2は、ロボット上でローカルに実行するように最適化された効率的なVLAモデルです。モデルカードには、Gemini Robotics 1.5テクノロジーとGoogleのオンデバイスGemmaモデルに基づいていると記載されています。入力はテキスト、画像、ロボットのプロプリオセプションの数値で、出力はロボットのアクションの数値です。

このタスク分割はシステム設計にとって重要です。ER 2がタスクを計画・追跡し、モーター実行をツールとして宣言されたVLAに委ねます。開発者は低レベルの制御インターフェース(VLAモデルやナビゲーションAPIなど)を呼び出し可能なツールとして登録し、マルチモーダルビデオ、オーディオ、テキストをモデルに直接ストリーミングします。

Apptronik Apollo 2での全身制御

以前のGemini Roboticsモデルは、テーブルトップタスクのために人型ロボットの上半身のみを制御していました。Gemini Robotics 2は初めて全身の動きに制御を拡張します。

実例ではApptronikのApollo 2が使用されました。「じょうろを一番下の棚の緑の箱に入れて」という指示に対して、Apolloはテーブルまで歩いてじょうろを拾い上げ、数歩歩いて棚の前に移動し、オブジェクトを目的地に置きました。

Google DeepMindは、ロボットの移動速度に関してまだ改善の余地があると率直に述べています。

ハンドとグリッパーにわたる巧緻性

Gemini Robotics 2は、Apollo 2上の5本指、22自由度のSharpaWaveハンドを制御できます。結び目を作る、ジップロックバッグを密封するなどの動作が報告されています。同じモデルは、Franka Duoプラットフォーム上の標準的な2本指パラレルグリッパーも操作し、精密な梱包などのタスクを実行します。

報告された成功率は、3つのエンボディメント(SharpaWaveハンドを備えたApollo 2、Inspireハンドを備えたApollo 2、Robotiqグリッパーを備えたFranka Duo)を制御する1つのモデルチェックポイントからのものです。

ER 2: 時間的インテリジェンスとツールオーケストレーション

開発者Xの投稿は、めったにベンチマークされない問題、つまりタスクが実際にいつ完了したかを知ることに焦点を当てています。進行状況分類:ビデオフィードの各フレームは、0-20%から80-100%までの5つの進行レベルに割り当てられます。Gemini Robotics ER 2はこのタスクで57.4%の精度に達しました。Google DeepMindは、これが前世代モデルや競合するフロンティアモデルを上回ると報告しています。モーメントファインディング:モデルが重要なイベントが発生した正確なフレームを識別できるかを測定します。例としては、コーヒーカップに注ぐのを止める瞬間があります。ER 2は91.3%の精度、平均絶対距離0.96秒を達成しました。Google DeepMindは、はるかに大きなモデルカテゴリと競合し、実行速度は4倍であると報告しています。ツールオーケストレーション:ER 2は、実際のVLA、シミュレーションVLA、人間による遠隔操作の3つの制御モードで評価され、すべてでGemini Robotics ER 1.6を上回りました。

ER 2は双方向ストリーミングエンドポイントを介してGemini Live APIと統合されています。目的は、マルチステップ実行を中断する「考えて止まる」ポーズを排除することです。また、Google検索やユーザー定義関数などのツールをネイティブに呼び出すこともできます。

3つの空間能力がアップグレードされました。成功・失敗検出は、静的なスナップショットではなく生のビデオフィードで実行されるようになり、実行中のこぼれや滑りを捕捉します。一般的な計器読み取りは、円形のダイヤルからデジタルディスプレイ、線形スケール、定規、液体温度計に拡張され、10種類の計器タイプでテストされました。空間的視覚質問応答は、Geminiのマルチモーダル進歩を通じて改善されました。

Google DeepMindはBoston DynamicsのSpotを使ったデモを構築し、ER 2を使用してSpotのナビゲーションとマニピュレータAPIをオーケストレーションしました。サンプルコードはrobotics-samplesリポジトリで入手できます。

マルチロボット協調

Gemini Robotics 2は、異なるタイプのロボット間の協調を導入します。その理由は、単一のロボットがすべてのタスクに適しているわけではないからです。車輪付きローバーは屋内作業に適し、人型ロボットは不整地をよりうまく処理します。ロボットは共有された意味理解を通じてサブタスクを引き継ぎます。デモではApptronikのApollo 2とFranka F3 Duoがペアリングされました。

On-Device 2: 新しいロボットボディへの適応

Gemini Robotics On-Device 2は、ネットワーク遅延や接続性に依存できないアプリケーションを対象としています。ネイティブにマルチエンボディメントであり、Gemini Robotics 1.5のモーション転送技術を継承しています。

Google DeepMindは、新しい双腕エンボディメントへの適応が通常数時間、典型的には200未満の例で完了すると報告しています。これは、形状、センサー、自由度が大幅に異なるエンボディメントにも当てはまります。デモプラットフォームにはDexmate、SO101、Trossenが含まれます。

モデルカードには、後訓練でのみ導入されたプラットフォームにおけるOn-Device 1とのデータスケーリング比較が掲載されています: SO101: On-Device 2は6.7%から53.3%に向上、On-Device 1は0.0%から6.7%。 Dexmate: On-Device 2は24.4%から75.6%に向上、On-Device 1は13.3%から33.3%。

モデルカードはまた、On-Device 2は分布外のタスクへの一般化と高自由度ロボットの制御において限界があると述べています。

利用可能性

Gemini Robotics ER 2はGemini APIとGoogle AI Studioを通じて公開プレビューとして提供され、Gemini Enterprise Agent Platformでプライベートプレビューも可能です。 Gemini Robotics 2 (VLA)は初期アクセスパートナー向け。 Gemini Robotics On-Device 2は信頼できるテスター向け。

AI Studioの起動リンクではモデル文字列gemini-robotics-er-2-previewが使用されます。入門ノートブックはrobotics-samplesリポジトリにあります。

インタラクティブ説明

出典:Gemini Robotics 2発表、Gemini Robotics ER 2開発者投稿、ER 2モデルカード、On-Device 2モデルカード、ASIMOV-Agenticデータセットとセーフティ技術レポート。