跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

对象概念从运动中涌现:一种无需标注的视觉预训练方法

文章摘要

这项研究提出一种受生物学启发的框架,利用视频中的运动边界和光流生成伪实例掩码,训练单图像编码器学习对象中心表征,无需人工标注或相机标定。实验在7,163小时视频上扩展到4.21亿帧,并在深度估计、3D目标检测、3D占用预测和端到端规划等任务上达到或超过基线。

来源arXiv Computer Vision作者: Boshi Li, Xiaohui Wang, Xiaoyang Wu, Zhichao Li, Ya Yang, Naiyan Wang
对象概念从运动中涌现:一种无需标注的视觉预训练方法
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

物体概念能否仅从运动中涌现?一篇于2026年9月3日提交至arXiv的论文给出了肯定答案。该论文编号为2609.04348,标题为《Object Concepts Emerge from Motion》,由Boshi Li和其他五位作者合作完成,属于计算机视觉与模式识别(cs.CV)领域。研究团队提出一种受生物学启发的框架,用于学习面向单一图像的以物体为中心的视觉表征。他们指出,尽管现有视觉预训练方法能够捕捉丰富的语义类别,却常常无法保持单个实例的独立身份和时空连续性,这对于物理世界的感知至关重要。近年来,自监督学习在视觉表征领域取得了显著进展,然而其中大多侧重于图像分类或语义分割,对需要精确几何与实例感知的三维视觉任务仍显不足。该框架的关键在于利用运动边界作为物体级分组的线索:借助现成的光流算法和聚类技术,在原始视频上生成伪实例掩码;随后,这些掩码通过像素级的成对度量学习监督一个单图像编码器,使其无需依赖人类标注或相机标定即可运作。作者从生物视觉系统获得灵感——人类和动物能够通过运动信息快速分离物体,即使没有语义标注也能形成稳定的物体概念。具体流程中,首先对视频帧计算光流,将运动边界聚类得到粗糙的伪实例掩码,并以此训练单图像编码器输出实例嵌入。为缓解伪标签噪声,团队提出“运动验证自训练”,将模型当前提案与运动证据相互校验,从而扩展并清洗训练数据。数据显示,研究者首先从7163小时的行车记录和网络视频中收集了1.95亿个伪标记帧,再进一步将监督规模扩展到4.21亿帧。模型方面,他们训练了最大至Swin-H的编码器,并将所学表征蒸馏至一系列Swin骨干网络,服务于轻量级推理。实验部分覆盖单目深度估计、三维目标检测、三维占据预测以及端到端规划等,结果表明该方法相对有监督与自监督基线取得相当或更优性能,尤其是在几何与实例敏感的基准上表现出强迁移优势。在公开基准中,新模型在物体边界和实例级任务上明显优于依赖语义分类的预训练方法,且由于不需要相机标定,可直接应用于互联网级视频,为通用视觉预训练提供了新数据来源。论文总结道,运动派生的监督信号可训练静态图像编码器表征视觉实例,为可扩展视觉预训练打开了新方向。根据arXiv提交记录,第一版(v1)于2026年9月3日18:11:53 UTC由Boshi Li提交,文档大小约9972KB,并已获得DataCite DOI(待注册)。论文页面提供PDF、实验性HTML、TeX源代码以及参考文献与引用工具,还包含alphaXiv、CatalyzeX、Hugging Face等资源链接。当前浏览上下文为cs.CV的新近论文(2026年9月)。

展开要点与分析

文章情报

工程师进阶

要点

  • 利用光流和聚类生成伪实例掩码,以运动边界作为对象分组的监督信号。
  • 先获得1.95亿伪标记帧,再通过运动验证自训练扩展到4.21亿帧。
  • 训练至Swin-H并蒸馏到Swin骨干,在几何与实例敏感任务上表现突出。
  • 证明运动派生的监督能让静态图像编码器学会实例级对象表征。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。