跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

AquaBEV:基於3D聲納監督的單目水下BEV佔用預測

文章摘要

本文介紹AquaBEV,一種單目水下佔用預測模型,僅使用單個水下RGB圖像預測局部鳥瞰圖(BEV)佔用,並在訓練時利用3D成像聲納作為幾何監督。該模型採用無標定極座標表示和沿距離維度的因果解碼,在受控基準上以31.4 Visible IoU和38.6 Observed IoU實現最強遷移基線之上的4.0%和4.3%相對提升。

來源arXiv Robotics作者: Trung Tien Dong, Shengji Jin, Chen Chen, Yi Sheng, Xiaomin Lin
AquaBEV:基於3D聲納監督的單目水下BEV佔用預測
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

自主水下機器人在勘探、環境監測和水下檢測等任務中得到廣泛應用。為了保證安全導航,機器人需要理解周圍環境中哪些區域可通行、哪些區域被佔用。俯視圖(BEV)佔用表示可以為此類任務提供直觀的場景描述,但從單一水下RGB圖像預測這種表示並不容易:水下環境光照、散射和有限的感知距離弱化了外觀中的幾何線索,使得純視覺方法難以獲得可靠的深度和空間結構。來自3D成像聲納的幾何測量則能為該任務提供互補的監督信號。

近日發表於arXiv的論文“AquaBEV: Monocular Underwater BEV Occupancy with 3D Sonar Supervision”提出了一隻單目水下佔用預測模型。與依賴多視圖或深度傳感器的方案不同,AquaBEV僅需一張RGB圖像即可預測局部的BEV佔用結果,而在訓練過程中使用成對的3D成像聲納數據作為幾何監督。論文作者包括Trung Tien Dong等4位研究者,論文於2026年9月3日提交至arXiv(編號2609.04411)。

AquaBEV先將視覺特徵映射到無需標定的極座標表示中,再沿距離維度執行因果解碼,最終重建為笛卡爾座標系下的BEV輸出。這種設計避免了對顯式相機標定的依賴,並能為距離與空間結構的推理提供更具結構性的過程。

研究團隊還建立了受控的水下佔用基準,在統一協議下將多種代表性佔用預測方法適配到相同的“RGB到聲納”任務中。實驗結果顯示,AquaBEV在Visible IoU上達到31.4,在Observed IoU上達到38.6,相比最強的遷移基線分別取得4.0%和4.3%的相對提升,表明利用聲納監督可以有效提升單目水下BEV佔用的準確度。該論文的分類為機器人學(cs.RO)與計算機視覺(cs.CV),並已獲得arXiv分配的DOI(https://doi.org/10.48550/arXiv.2609.04411)。

展開要點與分析

文章情報

工程師進階

要點

  • AquaBEV從單張水下RGB圖像預測局部鳥瞰佔用,避開外觀特徵中有限且不可靠的幾何線索。
  • 訓練中採用3D成像聲納提供幾何監督,並結合無標定極座標表示與沿距離維度的因果解碼。
  • 該模型達到31.4 Visible IoU和38.6 Observed IoU,較最強遷移基線相對提升4.0%和4.3%。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。