自主水下機器人在勘探、環境監測和水下檢測等任務中得到廣泛應用。為了保證安全導航,機器人需要理解周圍環境中哪些區域可通行、哪些區域被佔用。俯檢視(BEV)佔用表示可以為此類任務提供直觀的場景描述,但從單一水下RGB影像預測這種表示並不容易:水下環境光照、散射和有限的感知距離弱化了外觀中的幾何線索,使得純視覺方法難以獲得可靠的深度和空間結構。來自3D成像聲納的幾何測量則能為該任務提供互補的監督訊號。
近日發表於arXiv的論文“AquaBEV: Monocular Underwater BEV Occupancy with 3D Sonar Supervision”提出了一隻單目水下佔用預測模型。與依賴多檢視或深度感測器的方案不同,AquaBEV僅需一張RGB影像即可預測區域性的BEV佔用結果,而在訓練過程中使用成對的3D成像聲納資料作為幾何監督。論文作者包括Trung Tien Dong等4位研究者,論文於2026年9月3日提交至arXiv(編號2609.04411)。
AquaBEV先將視覺特徵對映到無需標定的極座標表示中,再沿距離維度執行因果解碼,最終重建為笛卡爾座標系下的BEV輸出。這種設計避免了對顯式相機標定的依賴,並能為距離與空間結構的推理提供更具結構性的過程。
研究團隊還建立了受控的水下佔用基準,在統一協議下將多種代表性佔用預測方法適配到相同的“RGB到聲納”任務中。實驗結果顯示,AquaBEV在Visible IoU上達到31.4,在Observed IoU上達到38.6,相比最強的遷移基線分別取得4.0%和4.3%的相對提升,表明利用聲納監督可以有效提升單目水下BEV佔用的準確度。該論文的分類為機器人學(cs.RO)與計算機視覺(cs.CV),並已獲得arXiv分配的DOI(https://doi.org/10.48550/arXiv.2609.04411)。