跳到主要內容
AI News HubLIVE
站內改寫3 分鐘閱讀

WildDet3D:單張圖片實現開放世界3D檢測

文章摘要

Ai2釋出WildDet3D,這是一種從單張RGB影像進行開放詞彙3D目標檢測的模型,支援文本、點和框提示,可跨攝像頭和物體類別泛化,並能在可利用時融合深度訊號。同時釋出WildDet3D-Data資料集,包含超過100萬張影像和370萬個3D標註,覆蓋13K個類別。該模型在Omni3D基準上達到34.2 AP(文本提示),並在多個零樣本資料集上表現優異。

來源Ai2 Blog
WildDet3D:單張圖片實現開放世界3D檢測
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

大多數視覺系統能夠告訴你影像中有什麼,但很少能從單張照片告訴你物體在三維空間中的位置、大小和朝向。這是空間智慧的核心挑戰:不僅要理解物體是什麼,還要理解它們如何在物理世界中存在。無論是導航在建築工地的自動駕駛車輛、分揀包裹的倉庫機器人,還是在街道上疊加導航指示的AR應用,都需要精確的3D理解,並且需要能夠處理任意物體和任意攝像頭。

近年來,在利用自然語言進行2D影像目標檢測方面取得了快速進展。但從單張影像恢復3D結構本質上更加困難,尤其是當系統需要超越固定類別列表、處理不同的查詢方式,並泛化到不同解析度、寬高比和光學特性的攝像頭時。大多數現有方法僅覆蓋狹窄領域(如駕駛或室內場景),支援單一提示型別,或假設特定的硬體配置——而且很少能利用可用的額外深度線索。

今天,Ai2釋出了WildDet3D,這是一個用於單目3D檢測的開放模型。給定一張RGB影像,它能預測3D邊界框——估計物體的位置、尺寸和朝向(以米制座標表示)——並接受多種提示型別,包括文本查詢、點提示和2D邊界框。輸入“消防栓”類別,它會找到場景中的每個例項;點選物體,它返回完整的3D邊界框;傳入其他模型的2D檢測結果,它將其提升到3D空間。

WildDet3D無需微調即可處理各種輸入,如裁剪的手機照片、廣角運動相機畫面或機器人攝像頭饋送。當有額外的幾何訊號(如稀疏深度、LiDAR、ToF)可用時,WildDet3D會將其融合以提升預測精度。

與模型一同釋出的還有WildDet3D-Data:超過100萬張影像,包含370萬個經過驗證的3D標註,涵蓋超過13K個物體類別,其中包含超過10萬張人工標註影像,以及評估資料和互動式演示。此外,還發布了一款iOS演示應用,利用即時攝像頭輸入和LiDAR深度,將3D邊界框作為AR疊加即時渲染。

WildDet3D的核心架構由三個元件協同工作。首先,基於SAM3視覺骨幹的2D檢測器接受所有三種提示型別並識別影像中的物體。其次,獨立的幾何後端——由一個凍結的DINOv2編碼器和一個可訓練的深度解碼器組成——估計逐畫素深度並生成幾何感知特徵。這兩個分支並行執行以提高效率。第三,3D檢測頭透過交叉注意力融合2D檢測結果與深度特徵,將2D證據提升為完整的3D邊界框預測,包括位置、尺寸和朝向。

一個關鍵設計是幾何後端是模組化的——與檢測骨幹解耦,因此可以在不重新設計整個系統的情況下更換不同的深度模型。後端還使用了射線感知解碼器,透過球諧編碼將相機幾何直接烘焙到其特徵中,無需單獨的相機標定分支。當推理時有稀疏或部分深度資料可用時,它們可以無縫地饋入後端,在不改變整體流程的情況下改進定位。

在基準測試方面,WildDet3D在Omni3D(跨六個室內外資料集、50個類別的標準單目3D檢測套件)上,使用文本提示達到34.2 AP(平均精度),比此前的最佳結果(3D-MOOD)高出5.8點;使用oracle框提示達到36.4 AP,超越DetAny3D 2.0點。而且僅需12個訓練週期,而先前方法需要80-120個週期。當測試時提供稀疏深度,效能進一步提升:文本提示41.6 AP,oracle框提示45.8 AP,特別是在深度感測器常見的室內資料集上提升最大。

為了測試泛化能力,WildDet3D在Argoverse2(自動駕駛,26個類別)和ScanNet(室內,18個類別)上進行了零樣本評估。在Argoverse2上達到40.3 ODS(開放檢測分數),幾乎翻倍了此前的最佳23.8;在ScanNet上達到48.9 ODS,提升17.4點。在從未在Omni3D中出現過的新穎類別上,改進尤為顯著:Argoverse2上38.6 ODS(此前14.8),ScanNet上45.8 ODS(此前15.7)。

WildDet3D代表了空間智慧領域的重大進步。它在一個模型中融合了多種提示型別,使3D檢測更具擴充套件性和實用性。它證明了開放詞彙3D感知可以遠遠泛化到狹窄的分類體系之外,尤其是在模型從未訓練過的類別上。它還展示了單目3D系統在可用時無需忽略更豐富的幾何資訊——同一架構可以從純RGB推理,並在存在額外深度線索時獲益。所有這些的實現了顯著少於先前方法的訓練計算量。

此次釋出包括WildDet3D模型、WildDet3D-Data資料集、iOS應用、評估支援資料和互動式演示——全部開放獲取。空間智慧是AI發展的核心。幫助AR應用在街道上疊加導航指示的同一模型,也可以幫助機器人估計貨架上包裹的尺寸,或者為智慧眼鏡上的3D感知應用提供動力——而我們認為最有趣的應用還沒有被構建出來。

展開要點與分析

文章情報

工程師進階

要點

  • 支援文本、點點選和2D框等多種提示方式
  • 在Omni3D基準上達到34.2 AP(文本提示),比此前最佳提升5.8點
  • 零樣本在Argoverse2和ScanNet上分別達到40.3和48.9 ODS
  • 同時釋出超100萬張影像的資料集和iOS AR演示應用

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。