D3VL:利用语言模型理解3D时序数据和视频中的驾驶场景
本文提出D3VL,一种新型多模态大语言模型框架,融合2D和3D时序数据以提升自动驾驶场景理解。该模型在KITTI问答数据集上相比基线方法提升11%,并引入Waymo QA数据集扩展以评估3D和时间序列处理能力。
近年来,多模态大语言模型(MLLM)的突破性进展为端到端自动驾驶系统带来了新的可能性。然而,现有研究大多聚焦于基于2D图像和视频的MLLM,对3D传感器数据的利用相对有限。本文作者另辟蹊径,深入探讨了利用3D传感器(尤其是LiDAR和立体相机)的MLLM有效性。LiDAR数据因其稀疏性和非网格结构,在集成到MLLM时面临独特挑战,例如缺乏规则的像素排列和极高的数据冗余度。这导致相机与LiDAR数据的融合在现有的MLLM管道中鲜有尝试,但大多数自动驾驶系统依然依赖LiDAR感知。事实上,传统3D场景感知任务已经证明,融入3D数据能够显著提升性能。
为解决这一问题,作者提出了D3VL(Driving 3D Video Language),一种新颖的MLLM框架,通过简单统一的架构巧妙整合2D和3D时序数据。该模型的设计目标是回答涉及交通场景理解与安全性的复杂问题,例如预测行人轨迹、识别危险事件等。实验表明,在KITTI问答(QA)数据集上,D3VL在处理2D和3D时序数据时,相比基线方法取得了11%的性能提升。此外,论文还引入了Waymo QA数据集扩展,该扩展涵盖了多种驾驶条件(如城市道路、高速公路、夜间等),用于评估模型在多样化场景下处理3D和时间序列数据的能力。D3VL的实现代码和WaymoQA扩展已发布于补充网站。该工作已被IEEE IV 2026会议接收,标志着自动驾驶场景理解领域的一个重要进展。未来,该框架有望被应用于更广泛的自动驾驶任务,如路径规划和行为预测,进一步推动自动驾驶技术的实用化。