物体概念は本当に運動から生まれるのか。2026年9月3日にarXivへ投稿された論文は、その問いに肯定的な答えを示している。論文IDは2609.04348、タイトルは「Object Concepts Emerge from Motion」であり、Boshi Li氏を含む6名の著者による共同研究である。カテゴリはコンピュータビジョンとパターン認識(cs.CV)。研究チームは、生物学的に着想を得たフレームワークを提案し、単一の静止画像から物体中心の視覚表現を学習することを目指している。従来の視覚事前学習手法は、意味的カテゴリの把握に優れる一方で、個々のインスタンスの同一性や一貫性を保つことが難しいという問題がある。この枠組みでは、動きの境界(モーションバウンダリ)を物体レベルのグループ化の手がかりとして用いる。既製のオプティカルフローとクラスタリングにより擬似インスタンスマスクを生成し、それを使ってピクセル単位のペアワイズ距離学習を実行し、単一画像エンコーダを教師あり学習する。このアプローチは人間のアノテーションもカメラ校正も不要である。著者らは、まず7,163時間のドライブ動画とウェブ動画から1億9,500万フレームの擬似ラベル付きデータを取得し、さらに「Motion-Verified Self-Training」と呼ばれる手法によりモデルの提案と動きの証拠を組み合わせて、4億2,100万フレームに教師情報を拡張した。エンコーダはSwin-Hまで大規模化し、得られた表現を一連のSwinバックボーンに蒸留している。評価では、単眼深度推定、3D物体検出、3D占有予測、エンドツーエンドのプランニングなどのタスクを実施。その結果、教師ありおよび自己教師あり事前学習ベースラインと比較して、遜色ないかそれ以上の性能を達成し、特に幾何学的・インスタンスに敏感なタスクで強い転移学習が見られた。これらの結果は、動き由来の監視信号が静的画像エンコーダに視覚インスタンスの表現を教えられることを示しており、スケーラブルな視覚事前学習の補完的な方向性を提供している。本論文は、2026年9月3日18:11:53 UTCにBoshi Li氏によって最初の版(v1)が提出され、ファイルサイズは約9,972KB。DataCite DOIも発行予定(登録待ち)。arXivページではPDF、実験的なHTML、TeXソースが参照できるほか、関連文献や引用ツール、alphaXiv、CatalyzeX、Hugging Faceなどの外部リソースへのリンクもまとめられている。現在のブラウズコンテキストはcs.CVの新着論文(2026年9月)である。
物体概念は運動から出現する:教師なし視覚事前学習の新フレームワーク
記事の要約
生の動画から運動境界を使った擬似インスタンスマスクを生成し、単一画像エンコーダに物体中心表現を学習させる生物学に着想を得たフレームワークを提案。アノテーションもカメラ校正も不要で、7,163時間の動画から4.21億フレームへと学習を拡張し、深さ推定や3D物体検出などで既存の事前学習ベースラインを凌駕する成果を示した。
物体概念は運動から出現する:教師なし視覚事前学習の新フレームワーク