機器人學習正變得越來越依賴大規模、多樣化的示教資料。無論是讓機器人學會抓取、組裝還是操作日常物體,都需要覆蓋豐富場景和行為的示範資料來訓練策略。然而,直接從物理機器人上採集資料不僅成本高昂,且很難覆蓋真實世界中分佈長尾的各種任務。這種資料瓶頸嚴重限制了機器人技能的泛化能力。為此,來自 arXiv 的一項論文提出了名為 RoboTok 的網際網路規模資料引擎,目標是把網際網路上海量的影片內容轉化為機器人可用的訓練訊號。
RoboTok 的工作方式在概念上很直接:給定一段人類操作影片作為查詢,它會在網路影片中檢索與該操作任務相關的示範影片,然後用這些檢索到的影片來訓練靈巧機器人策略。關鍵的挑戰在於,網際網路影片中的示範來自不同的人、不同的拍攝環境和視角,如何判斷兩段影片是否展示了相同的操作行為?RoboTok 的解決方案是學習一個潛在運動空間表示。具體來說,研究者首先利用姿態估計手段,將三維手部軌跡轉換到以執行者為中心的參考座標系中,然後在這個座標系中學習手部運動的空間表示。由於這一表示與絕對相機位置解耦,它能夠在不同攝像機視角、場景外貌以及人體遮擋等條件下,對不同演示中的操作行為進行可靠的相似度比較。同時,該表示刻意保持緊湊,使得在超大規模影片集合中進行快速最近鄰搜尋和持續的新資料索引成為可能,系統可以隨著影片庫增長而不斷擴充套件。
為了驗證有效性,研究團隊在檢索基準和下游機器人策略效能上,將 RoboTok 與現有的機器人資料檢索方案進行了對比。結果表明,RoboTok 能夠檢索到更多與查詢任務相關的操作演示,並且將這些演示用於策略學習後,機器人在真實下游任務上的成功率也得到一致提升。這項工作的意義在於,它首次系統性地驗證了“手部姿態軌跡感知的檢索”這一技術路線:透過理解影片中人的手部動作,網路影片可以成為一種規模可擴充套件、可持續增長的機器人學習監督來源,有望大幅降低機器人示教資料的採集門檻,推動機器人學習向更開放、更廣泛的任務空間邁進。