跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

RoboTok:面向人類演示檢索與靈巧操作學習的互聯網規模數據引擎

文章摘要

RoboTok 是一個能從互聯網視頻中檢索人類操作演示的數據引擎。給定一段查詢視頻,它利用以執行者為中心的三維手部軌跡構建潛在動作空間,從而在視角、場景與遮擋變化下高效匹配相關演示。實驗顯示,RoboTok 的檢索結果更相關,並且能顯著提高機器人下游任務的成功率,為機器人學習提供了可擴展的互聯網級數據來源。

來源arXiv Computer Vision作者: Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul, Gaotian Wang, Bowen Wen, Chen Wei, Kaiyu Hang
RoboTok:面向人類演示檢索與靈巧操作學習的互聯網規模數據引擎
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

機器人學習正變得越來越依賴大規模、多樣化的示教數據。無論是讓機器人學會抓取、組裝還是操作日常物體,都需要覆蓋豐富場景和行為的示範數據來訓練策略。然而,直接從物理機器人上採集數據不僅成本高昂,且很難覆蓋真實世界中分佈長尾的各種任務。這種數據瓶頸嚴重限制了機器人技能的泛化能力。為此,來自 arXiv 的一項論文提出了名為 RoboTok 的互聯網規模數據引擎,目標是把互聯網上海量的視頻內容轉化為機器人可用的訓練信號。

RoboTok 的工作方式在概念上很直接:給定一段人類操作視頻作為查詢,它會在網絡視頻中檢索與該操作任務相關的示範視頻,然後用這些檢索到的視頻來訓練靈巧機器人策略。關鍵的挑戰在於,互聯網視頻中的示範來自不同的人、不同的拍攝環境和視角,如何判斷兩段視頻是否展示了相同的操作行為?RoboTok 的解決方案是學習一個潛在運動空間表示。具體來説,研究者首先利用姿態估計手段,將三維手部軌跡轉換到以執行者為中心的參考座標系中,然後在這個座標系中學習手部運動的空間表示。由於這一表示與絕對相機位置解耦,它能夠在不同攝像機視角、場景外貌以及人體遮擋等條件下,對不同演示中的操作行為進行可靠的相似度比較。同時,該表示刻意保持緊湊,使得在超大規模視頻集合中進行快速最近鄰搜索和持續的新數據索引成為可能,系統可以隨着視頻庫增長而不斷擴展。

為了驗證有效性,研究團隊在檢索基準和下游機器人策略性能上,將 RoboTok 與現有的機器人數據檢索方案進行了對比。結果表明,RoboTok 能夠檢索到更多與查詢任務相關的操作演示,並且將這些演示用於策略學習後,機器人在真實下游任務上的成功率也得到一致提升。這項工作的意義在於,它首次系統性地驗證了“手部姿態軌跡感知的檢索”這一技術路線:通過理解視頻中人的手部動作,網絡視頻可以成為一種規模可擴展、可持續增長的機器人學習監督來源,有望大幅降低機器人示教數據的採集門檻,推動機器人學習向更開放、更廣泛的任務空間邁進。

展開要點與分析

文章情報

投資人進階

要點

  • 機器人學習需要大量多樣化演示,但真實機器人數據採集昂貴且難以覆蓋長尾任務。
  • RoboTok 通過查詢人類操作視頻,從互聯網視頻中檢索相關演示來訓練靈巧機器人策略。
  • 核心技術是基於三維手部軌跡的潛在運動空間表示,對視角、外觀和遮擋具有魯棒性。
  • 在檢索基準和下游機器人策略上,RoboTok 均優於現有方法。

技術影響

可能影響合規要求、模型發佈節奏、數據治理和企業採購。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。