AMD ROCmベースの視覚・言語・動作操作のためのReal2Sim2Realパイプライン
本論文は、データセンターのトレーニングシリコン、Radeon PROのシミュレーション/レンダリングGPU、Ryzen AIエッジコンピュートをカバーする、完全にAMDアクセラレートされたエンドツーエンドの技術スタックを提示します。4つのプログレッシブデモを通じて、VLAポリシーのトレーニングとデプロイにCUDAエコシステムが必須ではないことを示します。
フィジカルAI——大規模視覚・言語・動作(VLA)モデルと実世界で動作するエンボディエージェントの統合——は、AIの次なる主要なフロンティアとして浮上しています。業界リーダーのJensen Huang氏は2025年GTCパリで「次の大きなものはフィジカルAI、身体を持つAIだ」と述べ、AMDのLisa Su博士は2026年CESで「私たちはフィジカルAIの世界に入りつつある。これはAIが現実世界に入る瞬間だ」と強調しました。本論文は、エンボディ操作のための完全なAMDアクセラレートエンドツーエンド技術スタックを提案します。このスタックは、データセンターのトレーニングシリコン、Radeon PROシミュレーション/レンダリングGPU、Ryzen AIエッジコンピュートを、オープンソースのROCmソフトウェアスタックで統合します。研究チームは、VLAベースの操作ポリシーのトレーニングとデプロイにCUDAロックインが必要ないことを実証しています。
論文では4つの段階的なデモを紹介しています。第1に、SmolVLAでトレーニングされたSim-to-Real操作パイプラインを実際のFrankaアームに展開し、シミュレーションから現実へのシームレスな移行を示しました。第2に、意味的で言語に基づいたオブジェクト選択タスク(「3つの中から1つ」)で、ロボットが自然言語の指示に従って正しいオブジェクトを選択できることを実証しました。第3に、実際のシーンの3Dガウススプラッティング(3DGS)再構成とGenesis物理エンジンを融合したReal2Sim合成データ生成パイプラインを構築し、自動的にアノテーションされたシミュレーションデータを生成してポリシートレーニングに活用しました。第4に、複数のハードウェアプラットフォームでベンチマークされた四足および人型ロボットの大規模強化学習を実行し、AMD RDNA4およびRDNA3.5 GPU上でのトレーニング性能を比較しました。
すべてのパイプラインは、RDNA4(Radeon AI PRO R9700)およびRDNA3.5(Radeon PRO W7900)ハードウェア上でROCm+PyTorchにネイティブ動作し、無料のRadeon Cloud Platformで完全に再現可能です。この研究は、AMDエコシステム内でのエンボディAI研究に新たな可能性を開くだけでなく、高性能なエンボディAIシステムの構築が専用ハードウェアに依存しないことをコミュニティに示しました。研究者は関連コードと設定を公開し、より多くの開発者がAMDアクセラレートされたフィジカルAI研究に参加することを促進しています。