AI News HubLIVE
站内改写2 分钟阅读

HumanoidVLN:面向多样人形机器人的物理仿真视觉-语言导航基准

HumanoidVLN 是基于 NVIDIA Isaac Sim 的物理仿真平台与基准测试,针对人形机器人视觉-语言导航(VLN)设计。它支持四种不同身高(1.17m–1.80m)、下肢自由度 10–12 的人形机器人,通过分层控制栈实现双足运动。基准包含 933 个碰撞感知参考轨迹,每个轨迹配备一条细粒度指令和三种风格化变体。实验中 JanusVLN 平均成功率最高(43.55%),20 个场景虚实迁移测试中导航误差相关度达 r=0.935。

来源arXiv Robotics作者: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

现有的视觉-语言导航(VLN)基准大多围绕轮式智能体设计,无法覆盖人形机器人在物理世界中面临的独特挑战。双足运动带来的动力学约束、不同平台之间的人形形态差异,以及行进过程中相机抖动造成的观察失真,都使得人形机器人在执行 VLN 任务时更加复杂。为此,来自多所机构的研究团队提出了 HumanoidVLN——一个物理接地的人形机器人 VLN 仿真平台和基准测试,为这一方向提供了统一评估框架。

HumanoidVLN 构建于 NVIDIA Isaac Sim 之上,采用可扩展的人形机器人配置。研究者已在四种机器人上完成演示:Unitree G1、Unitree H1、Internal-A 和 Internal-B。这些机器人身高范围覆盖 1.17 米至 1.80 米,下肢自由度从 10 到 12 不等。平台使用分层控制栈,将强化学习运动策略与可替换的 PD 或 MPC 路径跟踪器相结合,使得新机器人或新的 VLN 模型可以低成本集成。目前,研究团队已验证该平台与 NaVILA、DualVLN、StreamVLN 和 JanusVLN 等主流 VLN 模型的兼容性。

在环境构建方面,HumanoidVLN 从艺术家设计的场景和 3D 高斯泼溅(3D Gaussian Splatting)重建结果中筛选可用空间,要求可导航面积超过 100 平方米。指令数据采用多智能体流水线生成:由生成器产生指令,审查器校验,改写器生成不同风格的变体,并加入人工审核环节。最终得到 933 个碰撞感知的参考轨迹,每个轨迹配有细粒度指令,以及正式、自然、随意三种粗粒度风格变体。

在四个 VLN 模型和四种人形机器人组合的实验评估中,JanusVLN 表现最佳,平均成功率达到 43.55%,nDTW 达到 48.38。为了评估仿真到现实的可迁移性,研究团队使用 DualVLN 和 Unitree G1 人形机器人进行了 20 个场景的试点实验。结果显示,仿真中的导航误差与真实世界结果高度相关(r=0.935),平均绝对误差为 0.68 米,平均轨迹相似度为 0.782(±0.188)nDTW。这组实验揭示了 VLN 模型、控制器和人形机器人在真实物理执行条件下的相互作用。

论文由 Quan-Dung Pham 等 11 位作者完成,于 2026 年 8 月 13 日提交至 arXiv,分类为机器人学(cs.RO),编号 arXiv:2608.12860。研究团队表示,代码、基准数据和相关资料将在论文被接受后于项目网站 https://humanoid-vln.github.io/ 发布。