ほとんどの視覚システムは画像内の物体が何かを教えてくれますが、単一の写真からその物体が三次元空間のどこにあり、どのくらいの大きさで、どのような向きであるかを教えてくれるものははるかに少ないです。これが空間知能の核心的な課題です:物体が何であるかを理解するだけでなく、それらが物理世界にどのように存在するかを理解することです。建設現場を走行する自動運転車、荷物を仕分ける倉庫ロボット、道路上に案内を重ねるARアプリなど、すべてが正確な3D理解を必要とし、しかも任意の物体と任意のカメラに対して機能する必要があります。
近年、自然言語を使用した2D画像の物体検出とラベリングは急速に進歩しました。しかし、単一画像から3D構造を復元することは本質的に困難であり、特にシステムが固定カテゴリリストを超えて動作し、異なるクエリ指定方法を処理し、異なる解像度、アスペクト比、光学特性を持つカメラに汎化する必要がある場合にはなおさらです。ほとんどの既存手法は、運転や室内シーンなどの狭いドメインしかカバーせず、単一のプロンプトタイプしかサポートしないか、特定のハードウェア構成を前提としており、利用可能な追加の深度手がかりを活用できるものはほとんどありません。
本日、Ai2は単眼3D検出のためのオープンモデルWildDet3Dをリリースします。単一のRGB画像が与えられると、3Dバウンディングボックスを予測し(物体の位置、サイズ、向きをメートル単位で推定)、テキストクエリ、ポイントプロンプト、2Dバウンディングボックスを含む複数のプロンプトタイプを受け入れます。「消火栓」のようなカテゴリを入力すると、シーン内のすべてのインスタンスを見つけ、物体をタップすると完全な3Dバウンディングボックスを返し、別のモデルからの2D検出結果を渡すとそれを3Dにリフトします。
WildDet3Dは、ファインチューニングなしで、切り抜かれたスマートフォン写真、広角アクションカメラフレーム、ロボットカメラフィードなど、さまざまな入力に対応できます。また、スパース深度、LiDAR、ToFなどの追加の幾何学的信号が利用可能な場合、WildDet3Dはそれらを統合して予測を強化します。
モデルとともに、WildDet3D-Dataもリリースされます:100万枚以上の画像、370万の検証済み3Dアノテーション(13K以上の物体カテゴリ)、10万枚以上の人間によるアノテーション画像、評価資料、インタラクティブデモを含みます。さらに、ライブカメラ入力とLiDAR深度を使用して3DバウンディングボックスをリアルタイムでARオーバーレイとしてレンダリングするiOSデモアプリもリリースされています。
WildDet3Dのアーキテクチャは、3つのコンポーネントが連携して動作します。まず、SAM3ビジョンバックボーンに基づく2D検出器が、3つのプロンプトタイプすべてを受け入れ、画像内の物体を識別します。次に、独立した幾何学バックエンド(凍結されたDINOv2エンコーダと学習可能な深度デコーダ)がピクセル単位の深度を推定し、幾何学的に意味のある特徴を生成します。これらの2つのブランチは効率性のために並行して実行されます。第三に、3D検出ヘッドがクロスアテンションを通じて2D検出結果と深度特徴を融合し、2Dエビデンスを位置、寸法、向きを含む完全な3Dバウンディングボックス予測にリフトします。
重要な設計上の選択は、幾何学バックエンドがモジュール式であることです。検出バックボーンから切り離されており、システム全体を再設計することなく異なる深度モデルを交換できます。バックエンドはまた、カメラ光線方向の球面調和符号化を使用してカメラ幾何学を直接特徴に組み込むレイ認識デコーダを使用しており、個別のカメラキャリブレーションブランチを不要にしています。推論時にスパースまたは部分的な深度データが利用可能な場合(LiDARセンサー、RGB-Dカメラ、ステレオ構成から)、それらはこのバックエンドにシームレスに供給され、パイプライン全体を変更することなくローカリゼーションを改善します。
ベンチマークでは、WildDet3DはOmni3D(6つの室内外データセット、50カテゴリにわたる標準単眼3D検出スイート)で、テキストプロンプトを使用して34.2 AP(平均精度)を達成し、従来の最良(3D-MOOD)から5.8ポイント向上しました。オラクルボックスプロンプトでは36.4 APでDetAny3Dを2.0ポイント上回りました。しかも、従来手法が80〜120エポック必要だったのに対して、わずか12トレーニングエポックでこれを達成しました。テスト時にスパース深度が提供されると、パフォーマンスはさらに向上します:テキストで41.6 AP、オラクルで45.8 APであり、深度センサーが一般的な室内データセットで最大のジャンプが見られます。
汎化能力をテストするため、WildDet3DをArgoverse2(自動運転、26カテゴリ)とScanNet(室内、18カテゴリ)でゼロショット評価しました。Argoverse2で40.3 ODS(オープン検出スコア)を達成し、従来の最良23.8をほぼ倍増、ScanNetでは48.9 ODSで17.4ポイントの向上を示しました。改善は特に新規カテゴリ(Omni3Dに存在しない物体)で顕著で、Argoverse2で38.6 ODS(従来14.8)、ScanNetで45.8 ODS(従来15.7)を記録し、モデルのビジュアルバックボーンが以前のアーキテクチャよりもはるかに効果的に未知の物体に転移することを示しています。
WildDet3Dは空間知能における意味のある進歩です。複数のプロンプトタイプを1つのモデルに統合し、3D検出をより拡張可能で実用的にします。オープンボキャブラリー3D知覚が狭い分類体系をはるかに超えて汎化できること、特にモデルが訓練されたことのないカテゴリで顕著であることを実証しています。単眼3Dシステムが利用可能な場合に豊富な幾何学を無視する必要がないこと、すなわち同じアーキテクチャがRGBのみから推論し、追加の深度手がかりがある場合にその恩恵を受けられることを示しています。そして、これを従来手法よりもはるかに少ないトレーニング計算量で達成しています。
今回のリリースには、WildDet3Dモデル、WildDet3D-Data、iOSアプリ、評価と実験のためのサポート資料、およびインタラクティブデモが含まれており、すべてオープンにアクセス可能です。空間知能はAIの進む先の中核です。ARアプリが道路上に案内を置くのを助ける同じモデルが、ロボットが棚にある荷物のサイズを推定したり、スマートグラス上の3D対応アプリケーションを動作させたりすることができ、そして最も興味深いアプリケーションはまだ誰も構築していないものだと考えています。