AI News HubLIVE
站內改寫1 分鐘閱讀

基於AMD ROCm的視覺-語言-動作操控Real2Sim2Real流程

本文提出了一個完全AMD加速的端到端技術棧,用於具身操控,覆蓋數據中心訓練、Radeon PRO模擬/渲染GPU和Ryzen AI邊緣計算,統一於開源ROCm軟件棧。展示了四個漸進式演示,證明VLA策略的訓練和部署無需CUDA生態。

來源arXiv Robotics作者: Qing Yang, Xun Wang, Ziguan Wang, Zhenjiang Li, Hongqiang Wang, Dongdong Weng

物理AI——將大型視覺-語言-動作(VLA)模型與在真實世界中行動的具身智能體相結合——已成為AI的下一個重要前沿。黃仁勳在2025年GTC巴黎大會上指出“下一個大事件是物理AI,有身體的AI”,而AMD CEO Lisa蘇博士在2026年CES上也強調“我們正在進入物理AI的世界,這是AI進入現實世界的時刻”。本文提出了一套完整的端到端AMD加速技術棧,用於具身操控。該技術棧整合了數據中心訓練芯片、Radeon PRO模擬/渲染GPU以及Ryzen AI邊緣計算,統一由開源ROCm軟件棧驅動。研究團隊證明,訓練和部署基於VLA的操控策略並不需要鎖定在CUDA生態中。

論文展示了四個漸進式演示。第一,一個基於SmolVLA訓練的Sim-to-Real操控流程,部署在物理Franka機械臂上,展示了從仿真到現實的無縫遷移。第二,一個語義化的、基於語言的目標選擇任務,稱為“三選一”,機器人能夠根據自然語言指令從多個物體中選出正確的目標。第三,一個Real2Sim合成數據生成流程,將真實場景的3D高斯潑濺(3DGS)重建與Genesis物理引擎相融合,自動生成帶標註的仿真數據用於策略訓練。第四,在多個硬件平台上進行基準測試的四足和人形機器人大規模強化學習,包括在AMD RDNA4和RDNA3.5 GPU上的訓練性能對比。

所有流程均在ROCm+PyTorch環境下,於RDNA4(Radeon AI PRO R9700)和RDNA3.5(Radeon PRO W7900)硬件上原生運行,並且可以在免費的Radeon雲平台上完全復現。這項工作不僅為AMD生態系統中的具身AI研究開闢了新的可能性,也向社區證明了構建高性能具身智能系統並不依賴專有硬件平台。研究者將相關代碼和配置公開,鼓勵更多開發者參與到AMD加速的物理AI研究中來。