HumanoidVLN:面向多樣人形機器人的物理模擬視覺-語言導航基準
HumanoidVLN 是基於 NVIDIA Isaac Sim 的物理模擬平臺與基準測試,針對人形機器人視覺-語言導航(VLN)設計。它支援四種不同身高(1.17m–1.80m)、下肢自由度 10–12 的人形機器人,透過分層控制棧實現雙足運動。基準包含 933 個碰撞感知參考軌跡,每個軌跡配備一條細粒度指令和三種風格化變體。實驗中 JanusVLN 平均成功率最高(43.55%),20 個場景虛實遷移測試中導航誤差相關度達 r=0.935。
現有的視覺-語言導航(VLN)基準大多圍繞輪式智慧體設計,無法覆蓋人形機器人在物理世界中面臨的獨特挑戰。雙足運動帶來的動力學約束、不同平臺之間的人形形態差異,以及行進過程中相機抖動造成的觀察失真,都使得人形機器人在執行 VLN 任務時更加複雜。為此,來自多所機構的研究團隊提出了 HumanoidVLN——一個物理接地的人形機器人 VLN 模擬平臺和基準測試,為這一方向提供了統一評估框架。
HumanoidVLN 構建於 NVIDIA Isaac Sim 之上,採用可擴充套件的人形機器人配置。研究者已在四種機器人上完成演示:Unitree G1、Unitree H1、Internal-A 和 Internal-B。這些機器人身高範圍覆蓋 1.17 米至 1.80 米,下肢自由度從 10 到 12 不等。平臺使用分層控制棧,將強化學習運動策略與可替換的 PD 或 MPC 路徑跟蹤器相結合,使得新機器人或新的 VLN 模型可以低成本整合。目前,研究團隊已驗證該平臺與 NaVILA、DualVLN、StreamVLN 和 JanusVLN 等主流 VLN 模型的相容性。
在環境構建方面,HumanoidVLN 從藝術家設計的場景和 3D 高斯潑濺(3D Gaussian Splatting)重建結果中篩選可用空間,要求可導航面積超過 100 平方米。指令資料採用多智慧體流水線生成:由生成器產生指令,審查器校驗,改寫器生成不同風格的變體,並加入人工稽核環節。最終得到 933 個碰撞感知的參考軌跡,每個軌跡配有細粒度指令,以及正式、自然、隨意三種粗粒度風格變體。
在四個 VLN 模型和四種人形機器人組合的實驗評估中,JanusVLN 表現最佳,平均成功率達到 43.55%,nDTW 達到 48.38。為了評估模擬到現實的可遷移性,研究團隊使用 DualVLN 和 Unitree G1 人形機器人進行了 20 個場景的試點實驗。結果顯示,模擬中的導航誤差與真實世界結果高度相關(r=0.935),平均絕對誤差為 0.68 米,平均軌跡相似度為 0.782(±0.188)nDTW。這組實驗揭示了 VLN 模型、控制器和人形機器人在真實物理執行條件下的相互作用。
論文由 Quan-Dung Pham 等 11 位作者完成,於 2026 年 8 月 13 日提交至 arXiv,分類為機器人學(cs.RO),編號 arXiv:2608.12860。研究團隊表示,程式碼、基準資料和相關資料將在論文被接受後於專案網站 https://humanoid-vln.github.io/ 釋出。