AI News HubLIVE
サイト内リライト4 分で読了

NVIDIA、4Bパラメータのオープンワールドモデル「Cosmos 3 Edge」を発表:デバイス上でロボットの動作を推論・生成

NVIDIAは、デバイス上で動作するように構築された40億パラメータのオープンワールドモデル「Cosmos 3 Edge」をリリースしました。これは、ロボットやビジョンAIエージェントが周囲を理解し、リアルタイムで推論し、ローカルでロボットの動作を生成するのを支援します。Cosmos 3ファミリーには、2026年5月31日にGTC Taipeiで出荷されたCosmos 3 Nano(16B)とCosmos 3 Super(64B)が含まれます。Edgeは3番目で最小のティアであり、Superの約16分の1のサイズです。工場、倉庫、病院などのエッジ環境で動作する機械向けに、メモリ制約のあるシステムでデータセンター級のパフォーマンスを提供します。

ソースMarkTechPost著者: Asif Razzaq

NVIDIAは、デバイス上で動作するように設計された40億パラメータのオープンワールドモデル「Cosmos 3 Edge」をリリースしました。このモデルは、ロボットやビジョンAIエージェントが環境を理解し、リアルタイムで推論し、ローカルでロボットの動作を生成することを可能にします。

Cosmos 3ファミリーは、2026年5月31日にGTC Taipeiで発表されたCosmos 3 Nano(160億パラメータ)とCosmos 3 Super(640億パラメータ)に続くものです。Edgeは3番目で最小のモデルであり、Superの約16分の1のサイズです。このモデルは、工場、倉庫、病院などのエッジ環境に特化して設計されており、メモリ制約のあるシステム上でデータセンター級のパフォーマンスを提供することを目的としています。

ワールドモデルの役割は重要です。ワールドモデルは、環境が時間とともにどのように変化するかを学習し、物体、動き、空間関係、およびアクションの効果を表現します。例えば、ロボットが物体に手を伸ばす場合、物体を認識するだけでなく、物体の位置、グリッパーの動き、接触時の結果を追跡する必要があります。ワールドモデルはこれらの関係を推論し、アクションの視覚的結果を予測したり、変化を引き起こしたアクションを推論したり、目標を達成するためのアクションを生成したりできます。Cosmos 3 Edgeは、これらの機能を単一のデバイス上モデルに統合し、共有表現によりシステムが現在の世界状態を理解し、可能性のある未来をシミュレーションし、それらの未来をアクションに結び付けることを可能にします。

アーキテクチャ面では、Cosmos 3は2つのタワーからなるMixture-of-Transformers設計を採用しています。自己回帰タワーは視覚とテキストのトークンを処理して理解と推論を行い、拡散タワーは視覚、音声、アクションのトークンを処理して予測、生成、ニューラルシミュレーションを行います。2つのタワーは独立した正規化層と多層パーセプトロンを持ちますが、マルチモーダルアテンション層を共有しており、言語、ビデオ、音声、アクション間で情報を整列させます。これにより、モデルは出力を生成する前にシーンを推論できます。アテンションパターンは各モダリティに適応します:言語は因果アテンション(各トークンは以前のトークンのみに注目)、拡散トークンは利用可能なコンテキストに広く注目し、一貫した予測と生成をサポートします。タスクに応じて、モデルは自己回帰タワーから推論トークン、または拡散タワーからノイズ除去されたビデオとアクションのトークンを出力します。Cosmos 3 Edgeは、推論器として20億パラメータの高密度トランスフォーマーを使用し、Cosmos GitHubリポジトリによれば、画像およびビデオ入力にはQwen3-VL互換のメッセージ規則に従います。

物理システムはアクションを異なる方法で記述します:車両は自己姿勢と移動、カメラはカメラモーション、ロボットアームはエンドエフェクタの姿勢、グリッパーは把持状態を追加します。Cosmos 3はこれらの具現化を共通のアクション表現にマッピングします。アクションは、並進、回転、操作状態を捉えるコンパクトな幾何学的ベクトルとしてエンコードされます。これにより、制御と世界の視覚的構造が結び付けられ、モデルはピクセル変化を物理的な動きと制御入力に関連付けます。生成されたビデオは単なる予測ではなく、アクションに応じて世界がどのように変化すべきかを表します。サポートされるアクション次元は具現化に依存し、カメラモーション(9D)、自動運転車(9D)、自己中心モーション(57D)、単腕ロボット(10D)、両腕ロボット(20D)、人型ロボット(29D)などが含まれます。

ポリシーモードでは、Cosmos 3 Edgeはアクションとその期待される視覚的結果を予測します。現在の状態が入力され、アクションとその視覚的結果が出力されます。アクションの流れは双方向であり、モデルはアクションの効果を予測することも、効果からアクションを推論することもできます。これにより、ワールドモデリングがロボットポリシーのトレーニングと評価に直接結び付けられます。NVIDIAはまた、DROIDデータセットで後訓練されたロボット操作ポリシー「Cosmos 3 Edge Policy (DROID)」をリリースしており、ピックアンドプレースタスク向けで、後訓練スクリプトが含まれています。開発者は、小規模なH100クラスターまたはNVIDIA DGX Stationで微調整してからデプロイできます。

デプロイ可能性に関して、Cosmos 3 EdgeはNVIDIAエッジコンピュータ全体でメモリ効率の高い推論を提供します。対象には、NVIDIA RTX PRO GPU、NVIDIA DGX、GeForce RTX GPU、および新しく発表されたJetson T2000およびT3000モジュールを含むNVIDIA Jetsonが含まれます。後訓練されたワールドアクションモデル(WAM)として、ロボット制御解像度640×360で動作し、NVIDIA Jetson Thor上で1推論あたり32アクションを生成し、15 Hzのリアルタイム制御を実現します。生成において、Edgeティアは256pおよび480p解像度、12~30 fps、50~150フレームをサポートします。オープンなCosmosフレームワークを使用することで、開発者は約1日で特定の具現化とセンサーセットに合わせてCosmos 3 Edgeを後訓練できます。NVIDIAは、GeForce RTX 3070以上をプロトタイピングのローカルエントリポイントとして位置付けています。

主なポイント:Cosmos 3 Edgeは40億パラメータ(20億高密度推論器)のデバイス上実行可能なオープンワールドモデルで、7月20日にHugging Faceでリリースされました。Mixture-of-Transformers設計は、自己回帰推論タワーと拡散生成タワーを共有マルチモーダルアテンションで統合します。Jetson Thor上で640×360制御解像度、1推論あたり32アクション、15 Hzリアルタイム制御を実現。アクションは、カメラ、車両、単腕、両腕、人型ロボットにわたる共通の並進/回転/操作表現にマッピングされます。ベンチマーク(VANTAGE-Benchで4Bで1位)は社内で主張されており、モデルはLinux Foundation OpenMDW-1.1の下で出荷されます。出典:Hugging Faceローンチポスト、Cosmos3-Edgeモデルカード、Cosmos 3コレクション、NVIDIAテクニカルレポート(PDF)、Cosmos GitHub、NVIDIA開発者ブログ、Jetson Thorブログ、NVIDIAニュースルーム:日本連合。