跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

RoboTok:面向人类演示检索与灵巧操作学习的互联网规模数据引擎

文章摘要

RoboTok 是一个能从互联网视频中检索人类操作演示的数据引擎。给定一段查询视频,它利用以执行者为中心的三维手部轨迹构建潜在动作空间,从而在视角、场景与遮挡变化下高效匹配相关演示。实验显示,RoboTok 的检索结果更相关,并且能显著提高机器人下游任务的成功率,为机器人学习提供了可扩展的互联网级数据来源。

来源arXiv Computer Vision作者: Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul, Gaotian Wang, Bowen Wen, Chen Wei, Kaiyu Hang
RoboTok:面向人类演示检索与灵巧操作学习的互联网规模数据引擎
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

机器人学习正变得越来越依赖大规模、多样化的示教数据。无论是让机器人学会抓取、组装还是操作日常物体,都需要覆盖丰富场景和行为的示范数据来训练策略。然而,直接从物理机器人上采集数据不仅成本高昂,且很难覆盖真实世界中分布长尾的各种任务。这种数据瓶颈严重限制了机器人技能的泛化能力。为此,来自 arXiv 的一项论文提出了名为 RoboTok 的互联网规模数据引擎,目标是把互联网上海量的视频内容转化为机器人可用的训练信号。

RoboTok 的工作方式在概念上很直接:给定一段人类操作视频作为查询,它会在网络视频中检索与该操作任务相关的示范视频,然后用这些检索到的视频来训练灵巧机器人策略。关键的挑战在于,互联网视频中的示范来自不同的人、不同的拍摄环境和视角,如何判断两段视频是否展示了相同的操作行为?RoboTok 的解决方案是学习一个潜在运动空间表示。具体来说,研究者首先利用姿态估计手段,将三维手部轨迹转换到以执行者为中心的参考坐标系中,然后在这个坐标系中学习手部运动的空间表示。由于这一表示与绝对相机位置解耦,它能够在不同摄像机视角、场景外貌以及人体遮挡等条件下,对不同演示中的操作行为进行可靠的相似度比较。同时,该表示刻意保持紧凑,使得在超大规模视频集合中进行快速最近邻搜索和持续的新数据索引成为可能,系统可以随着视频库增长而不断扩展。

为了验证有效性,研究团队在检索基准和下游机器人策略性能上,将 RoboTok 与现有的机器人数据检索方案进行了对比。结果表明,RoboTok 能够检索到更多与查询任务相关的操作演示,并且将这些演示用于策略学习后,机器人在真实下游任务上的成功率也得到一致提升。这项工作的意义在于,它首次系统性地验证了“手部姿态轨迹感知的检索”这一技术路线:通过理解视频中人的手部动作,网络视频可以成为一种规模可扩展、可持续增长的机器人学习监督来源,有望大幅降低机器人示教数据的采集门槛,推动机器人学习向更开放、更广泛的任务空间迈进。

展开要点与分析

文章情报

投资人进阶

要点

  • 机器人学习需要大量多样化演示,但真实机器人数据采集昂贵且难以覆盖长尾任务。
  • RoboTok 通过查询人类操作视频,从互联网视频中检索相关演示来训练灵巧机器人策略。
  • 核心技术是基于三维手部轨迹的潜在运动空间表示,对视角、外观和遮挡具有鲁棒性。
  • 在检索基准和下游机器人策略上,RoboTok 均优于现有方法。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。