河流监测机器人需要理解仅靠地理航点无法描述的障碍物和水域边界。在资源受限的平台上,将不完美的视觉预测转化为及时且可检查的引导是一项独特挑战:一个物体标签或转向命令本身并不能解释决策依据了哪些证据,也无法说明证据何时不可靠。为此,研究者提出了 PAANI——一种设备端从感知到引导的架构。
PAANI 在 Arduino UNO Q 上结合了项目训练的 YOLO11n 检测器和自定义的 MobileNetV3 Small 语义分割器,并采用时间戳对齐的证据融合。有界跟踪提供物体持续性,显式走廊策略则综合水面标签、被接受的检测结果、紧急程度和掩码不确定性。每条最终建议都会公开其贡献证据和政策原因。ROS 2 接口将本地 AI 流水线与独立的 Gazebo 船只、定位和控制测试平台连接起来。
训练使用 10,000 张 WaterScenes 图像进行四类检测,并使用 1,127 张 MaSTr1325 图像进行分割,其中包含 198 张分割验证图像。选定的 FP32 ONNX 模型占用 14.817 MB。检测器检查点在 0.5 IoU 下的测试 mAP 为 0.7388,而单独评估的矩形 ONNX 导出在 0.5 IoU 下的验证 mAP 为 0.7367。分割 ONNX 验证 mIoU 为 0.9750。一段五分钟的 UNO Q 记录显示,在配置为 0.5 Hz 的节奏下,流水线延迟的中位数和第 95 百分位分别为 467.8 毫秒和 580.3 毫秒。
评估还发现了黑色输入误分类问题,以及采样率不匹配导致诊断性表观运动估计器无法收集足够证据。这些结果支持一个可检查且可复用的边缘机器人基础,同时清楚地区分了模型准确性和在板执行与已验证的水上避碰能力。论文共 20 页、8 幅图、11 张表,包含系统和 AI 架构图、模型训练结果、定性评估以及 Arduino UNO Q 部署测量。项目代码、训练模型、ONNX 产物、日志和可复现性文档均可在论文给出的链接获取。该论文属于 cs.AI 领域,编号 arXiv:2609.22353,由 Santhiya Rajan 于 2026 年 9 月 17 日提交。