機器人學習正變得越來越依賴大規模、多樣化的示教數據。無論是讓機器人學會抓取、組裝還是操作日常物體,都需要覆蓋豐富場景和行為的示範數據來訓練策略。然而,直接從物理機器人上採集數據不僅成本高昂,且很難覆蓋真實世界中分佈長尾的各種任務。這種數據瓶頸嚴重限制了機器人技能的泛化能力。為此,來自 arXiv 的一項論文提出了名為 RoboTok 的互聯網規模數據引擎,目標是把互聯網上海量的視頻內容轉化為機器人可用的訓練信號。
RoboTok 的工作方式在概念上很直接:給定一段人類操作視頻作為查詢,它會在網絡視頻中檢索與該操作任務相關的示範視頻,然後用這些檢索到的視頻來訓練靈巧機器人策略。關鍵的挑戰在於,互聯網視頻中的示範來自不同的人、不同的拍攝環境和視角,如何判斷兩段視頻是否展示了相同的操作行為?RoboTok 的解決方案是學習一個潛在運動空間表示。具體來説,研究者首先利用姿態估計手段,將三維手部軌跡轉換到以執行者為中心的參考座標系中,然後在這個座標系中學習手部運動的空間表示。由於這一表示與絕對相機位置解耦,它能夠在不同攝像機視角、場景外貌以及人體遮擋等條件下,對不同演示中的操作行為進行可靠的相似度比較。同時,該表示刻意保持緊湊,使得在超大規模視頻集合中進行快速最近鄰搜索和持續的新數據索引成為可能,系統可以隨着視頻庫增長而不斷擴展。
為了驗證有效性,研究團隊在檢索基準和下游機器人策略性能上,將 RoboTok 與現有的機器人數據檢索方案進行了對比。結果表明,RoboTok 能夠檢索到更多與查詢任務相關的操作演示,並且將這些演示用於策略學習後,機器人在真實下游任務上的成功率也得到一致提升。這項工作的意義在於,它首次系統性地驗證了“手部姿態軌跡感知的檢索”這一技術路線:通過理解視頻中人的手部動作,網絡視頻可以成為一種規模可擴展、可持續增長的機器人學習監督來源,有望大幅降低機器人示教數據的採集門檻,推動機器人學習向更開放、更廣泛的任務空間邁進。