跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

對象概念從運動中湧現:一種無需標註的視覺預訓練方法

文章摘要

這項研究提出一種受生物學啓發的框架,利用視頻中的運動邊界和光流生成偽實例掩碼,訓練單圖像編碼器學習對象中心表徵,無需人工標註或相機標定。實驗在7,163小時視頻上擴展到4.21億幀,並在深度估計、3D目標檢測、3D佔用預測和端到端規劃等任務上達到或超過基線。

來源arXiv Computer Vision作者: Boshi Li, Xiaohui Wang, Xiaoyang Wu, Zhichao Li, Ya Yang, Naiyan Wang
對象概念從運動中湧現:一種無需標註的視覺預訓練方法
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

物體概念能否僅從運動中湧現?一篇於2026年9月3日提交至arXiv的論文給出了肯定答案。該論文編號為2609.04348,標題為《Object Concepts Emerge from Motion》,由Boshi Li和其他五位作者合作完成,屬於計算機視覺與模式識別(cs.CV)領域。研究團隊提出一種受生物學啓發的框架,用於學習面向單一圖像的以物體為中心的視覺表徵。他們指出,儘管現有視覺預訓練方法能夠捕捉豐富的語義類別,卻常常無法保持單個實例的獨立身份和時空連續性,這對於物理世界的感知至關重要。近年來,自監督學習在視覺表徵領域取得了顯著進展,然而其中大多側重於圖像分類或語義分割,對需要精確幾何與實例感知的三維視覺任務仍顯不足。該框架的關鍵在於利用運動邊界作為物體級分組的線索:藉助現成的光流算法和聚類技術,在原始視頻上生成偽實例掩碼;隨後,這些掩碼通過像素級的成對度量學習監督一個單圖像編碼器,使其無需依賴人類標註或相機標定即可運作。作者從生物視覺系統獲得靈感——人類和動物能夠通過運動信息快速分離物體,即使沒有語義標註也能形成穩定的物體概念。具體流程中,首先對視頻幀計算光流,將運動邊界聚類得到粗糙的偽實例掩碼,並以此訓練單圖像編碼器輸出實例嵌入。為緩解偽標籤噪聲,團隊提出“運動驗證自訓練”,將模型當前提案與運動證據相互校驗,從而擴展並清洗訓練數據。數據顯示,研究者首先從7163小時的行車記錄和網絡視頻中收集了1.95億個偽標記幀,再進一步將監督規模擴展到4.21億幀。模型方面,他們訓練了最大至Swin-H的編碼器,並將所學表徵蒸餾至一系列Swin骨幹網絡,服務於輕量級推理。實驗部分覆蓋單目深度估計、三維目標檢測、三維佔據預測以及端到端規劃等,結果表明該方法相對有監督與自監督基線取得相當或更優性能,尤其是在幾何與實例敏感的基準上表現出強遷移優勢。在公開基準中,新模型在物體邊界和實例級任務上明顯優於依賴語義分類的預訓練方法,且由於不需要相機標定,可直接應用於互聯網級視頻,為通用視覺預訓練提供了新數據來源。論文總結道,運動派生的監督信號可訓練靜態圖像編碼器表徵視覺實例,為可擴展視覺預訓練打開了新方向。根據arXiv提交記錄,第一版(v1)於2026年9月3日18:11:53 UTC由Boshi Li提交,文檔大小約9972KB,並已獲得DataCite DOI(待註冊)。論文頁面提供PDF、實驗性HTML、TeX源代碼以及參考文獻與引用工具,還包含alphaXiv、CatalyzeX、Hugging Face等資源鏈接。當前瀏覽上下文為cs.CV的新近論文(2026年9月)。

展開要點與分析

文章情報

工程師進階

要點

  • 利用光流和聚類生成偽實例掩碼,以運動邊界作為對象分組的監督信號。
  • 先獲得1.95億偽標記幀,再通過運動驗證自訓練擴展到4.21億幀。
  • 訓練至Swin-H並蒸餾到Swin骨幹,在幾何與實例敏感任務上表現突出。
  • 證明運動派生的監督能讓靜態圖像編碼器學會實例級對象表徵。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。