基于AMD ROCm的视觉-语言-动作操控Real2Sim2Real流程
本文提出了一个完全AMD加速的端到端技术栈,用于具身操控,覆盖数据中心训练、Radeon PRO模拟/渲染GPU和Ryzen AI边缘计算,统一于开源ROCm软件栈。展示了四个渐进式演示,证明VLA策略的训练和部署无需CUDA生态。
物理AI——将大型视觉-语言-动作(VLA)模型与在真实世界中行动的具身智能体相结合——已成为AI的下一个重要前沿。黄仁勋在2025年GTC巴黎大会上指出“下一个大事件是物理AI,有身体的AI”,而AMD CEO Lisa苏博士在2026年CES上也强调“我们正在进入物理AI的世界,这是AI进入现实世界的时刻”。本文提出了一套完整的端到端AMD加速技术栈,用于具身操控。该技术栈整合了数据中心训练芯片、Radeon PRO模拟/渲染GPU以及Ryzen AI边缘计算,统一由开源ROCm软件栈驱动。研究团队证明,训练和部署基于VLA的操控策略并不需要锁定在CUDA生态中。
论文展示了四个渐进式演示。第一,一个基于SmolVLA训练的Sim-to-Real操控流程,部署在物理Franka机械臂上,展示了从仿真到现实的无缝迁移。第二,一个语义化的、基于语言的目标选择任务,称为“三选一”,机器人能够根据自然语言指令从多个物体中选出正确的目标。第三,一个Real2Sim合成数据生成流程,将真实场景的3D高斯泼溅(3DGS)重建与Genesis物理引擎相融合,自动生成带标注的仿真数据用于策略训练。第四,在多个硬件平台上进行基准测试的四足和人形机器人大规模强化学习,包括在AMD RDNA4和RDNA3.5 GPU上的训练性能对比。
所有流程均在ROCm+PyTorch环境下,于RDNA4(Radeon AI PRO R9700)和RDNA3.5(Radeon PRO W7900)硬件上原生运行,并且可以在免费的Radeon云平台上完全复现。这项工作不仅为AMD生态系统中的具身AI研究开辟了新的可能性,也向社区证明了构建高性能具身智能系统并不依赖专有硬件平台。研究者将相关代码和配置公开,鼓励更多开发者参与到AMD加速的物理AI研究中来。