机器人学习正变得越来越依赖大规模、多样化的示教数据。无论是让机器人学会抓取、组装还是操作日常物体,都需要覆盖丰富场景和行为的示范数据来训练策略。然而,直接从物理机器人上采集数据不仅成本高昂,且很难覆盖真实世界中分布长尾的各种任务。这种数据瓶颈严重限制了机器人技能的泛化能力。为此,来自 arXiv 的一项论文提出了名为 RoboTok 的互联网规模数据引擎,目标是把互联网上海量的视频内容转化为机器人可用的训练信号。
RoboTok 的工作方式在概念上很直接:给定一段人类操作视频作为查询,它会在网络视频中检索与该操作任务相关的示范视频,然后用这些检索到的视频来训练灵巧机器人策略。关键的挑战在于,互联网视频中的示范来自不同的人、不同的拍摄环境和视角,如何判断两段视频是否展示了相同的操作行为?RoboTok 的解决方案是学习一个潜在运动空间表示。具体来说,研究者首先利用姿态估计手段,将三维手部轨迹转换到以执行者为中心的参考坐标系中,然后在这个坐标系中学习手部运动的空间表示。由于这一表示与绝对相机位置解耦,它能够在不同摄像机视角、场景外貌以及人体遮挡等条件下,对不同演示中的操作行为进行可靠的相似度比较。同时,该表示刻意保持紧凑,使得在超大规模视频集合中进行快速最近邻搜索和持续的新数据索引成为可能,系统可以随着视频库增长而不断扩展。
为了验证有效性,研究团队在检索基准和下游机器人策略性能上,将 RoboTok 与现有的机器人数据检索方案进行了对比。结果表明,RoboTok 能够检索到更多与查询任务相关的操作演示,并且将这些演示用于策略学习后,机器人在真实下游任务上的成功率也得到一致提升。这项工作的意义在于,它首次系统性地验证了“手部姿态轨迹感知的检索”这一技术路线:通过理解视频中人的手部动作,网络视频可以成为一种规模可扩展、可持续增长的机器人学习监督来源,有望大幅降低机器人示教数据的采集门槛,推动机器人学习向更开放、更广泛的任务空间迈进。