跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

PAANI:面向河流机器人仿真的设备端视觉证据融合与可解释引导

文章摘要

PAANI 是一种面向河流监测机器人的设备端感知到引导架构,在 Arduino UNO Q 上结合 YOLO11n 检测器与 MobileNetV3 Small 语义分割器,通过时间戳对齐的证据融合和显式走廊策略提供可检查的引导。模型精度较高,但研究强调模型准确性与在板执行并不等同于已验证的水上避碰能力。

来源arXiv AI作者: Savio Cardoz, Santhiya Rajan
PAANI:面向河流机器人仿真的设备端视觉证据融合与可解释引导
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

河流监测机器人需要理解仅靠地理航点无法描述的障碍物和水域边界。在资源受限的平台上,将不完美的视觉预测转化为及时且可检查的引导是一项独特挑战:一个物体标签或转向命令本身并不能解释决策依据了哪些证据,也无法说明证据何时不可靠。为此,研究者提出了 PAANI——一种设备端从感知到引导的架构。

PAANI 在 Arduino UNO Q 上结合了项目训练的 YOLO11n 检测器和自定义的 MobileNetV3 Small 语义分割器,并采用时间戳对齐的证据融合。有界跟踪提供物体持续性,显式走廊策略则综合水面标签、被接受的检测结果、紧急程度和掩码不确定性。每条最终建议都会公开其贡献证据和政策原因。ROS 2 接口将本地 AI 流水线与独立的 Gazebo 船只、定位和控制测试平台连接起来。

训练使用 10,000 张 WaterScenes 图像进行四类检测,并使用 1,127 张 MaSTr1325 图像进行分割,其中包含 198 张分割验证图像。选定的 FP32 ONNX 模型占用 14.817 MB。检测器检查点在 0.5 IoU 下的测试 mAP 为 0.7388,而单独评估的矩形 ONNX 导出在 0.5 IoU 下的验证 mAP 为 0.7367。分割 ONNX 验证 mIoU 为 0.9750。一段五分钟的 UNO Q 记录显示,在配置为 0.5 Hz 的节奏下,流水线延迟的中位数和第 95 百分位分别为 467.8 毫秒和 580.3 毫秒。

评估还发现了黑色输入误分类问题,以及采样率不匹配导致诊断性表观运动估计器无法收集足够证据。这些结果支持一个可检查且可复用的边缘机器人基础,同时清楚地区分了模型准确性和在板执行与已验证的水上避碰能力。论文共 20 页、8 幅图、11 张表,包含系统和 AI 架构图、模型训练结果、定性评估以及 Arduino UNO Q 部署测量。项目代码、训练模型、ONNX 产物、日志和可复现性文档均可在论文给出的链接获取。该论文属于 cs.AI 领域,编号 arXiv:2609.22353,由 Santhiya Rajan 于 2026 年 9 月 17 日提交。

展开要点与分析

文章情报

投资人进阶

要点

  • PAANI 在 Arduino UNO Q 上融合 YOLO11n 检测与 MobileNetV3 Small 分割的视觉证据。
  • 系统采用时间戳对齐融合与显式走廊策略,每条建议都暴露其证据和政策原因。
  • 模型占用 14.817 MB,检测器 [email protected] 为 0.7388,分割 mIoU 为 0.9750。
  • 在 0.5 Hz 下中位延迟 467.8 ms,并发现黑色输入误分类和采样率不匹配问题。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。