跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

AquaBEV:基于3D声纳监督的单目水下BEV占用预测

文章摘要

本文介绍AquaBEV,一种单目水下占用预测模型,仅使用单个水下RGB图像预测局部鸟瞰图(BEV)占用,并在训练时利用3D成像声纳作为几何监督。该模型采用无标定极坐标表示和沿距离维度的因果解码,在受控基准上以31.4 Visible IoU和38.6 Observed IoU实现最强迁移基线之上的4.0%和4.3%相对提升。

来源arXiv Robotics作者: Trung Tien Dong, Shengji Jin, Chen Chen, Yi Sheng, Xiaomin Lin
AquaBEV:基于3D声纳监督的单目水下BEV占用预测
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

自主水下机器人在勘探、环境监测和水下检测等任务中得到广泛应用。为了保证安全导航,机器人需要理解周围环境中哪些区域可通行、哪些区域被占用。俯视图(BEV)占用表示可以为此类任务提供直观的场景描述,但从单一水下RGB图像预测这种表示并不容易:水下环境光照、散射和有限的感知距离弱化了外观中的几何线索,使得纯视觉方法难以获得可靠的深度和空间结构。来自3D成像声纳的几何测量则能为该任务提供互补的监督信号。

近日发表于arXiv的论文“AquaBEV: Monocular Underwater BEV Occupancy with 3D Sonar Supervision”提出了一只单目水下占用预测模型。与依赖多视图或深度传感器的方案不同,AquaBEV仅需一张RGB图像即可预测局部的BEV占用结果,而在训练过程中使用成对的3D成像声纳数据作为几何监督。论文作者包括Trung Tien Dong等4位研究者,论文于2026年9月3日提交至arXiv(编号2609.04411)。

AquaBEV先将视觉特征映射到无需标定的极坐标表示中,再沿距离维度执行因果解码,最终重建为笛卡尔坐标系下的BEV输出。这种设计避免了对显式相机标定的依赖,并能为距离与空间结构的推理提供更具结构性的过程。

研究团队还建立了受控的水下占用基准,在统一协议下将多种代表性占用预测方法适配到相同的“RGB到声纳”任务中。实验结果显示,AquaBEV在Visible IoU上达到31.4,在Observed IoU上达到38.6,相比最强的迁移基线分别取得4.0%和4.3%的相对提升,表明利用声纳监督可以有效提升单目水下BEV占用的准确度。该论文的分类为机器人学(cs.RO)与计算机视觉(cs.CV),并已获得arXiv分配的DOI(https://doi.org/10.48550/arXiv.2609.04411)。

展开要点与分析

文章情报

工程师进阶

要点

  • AquaBEV从单张水下RGB图像预测局部鸟瞰占用,避开外观特征中有限且不可靠的几何线索。
  • 训练中采用3D成像声纳提供几何监督,并结合无标定极坐标表示与沿距离维度的因果解码。
  • 该模型达到31.4 Visible IoU和38.6 Observed IoU,较最强迁移基线相对提升4.0%和4.3%。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。