AI News HubLIVE
站内改写1 分钟阅读

DisasterTD:利用多模态大语言模型和跨视角地理定位进行灾难地名消歧

社交媒体的图像文本中常含有模糊的地理信息,难以精确定位。本研究提出DisasterTD框架,结合多模态大语言模型(MLLMs)的语义推理与跨视角地理定位,先提取地名并生成候选位置,再通过跨视角匹配(社交媒体图像、遥感图像、街景图像)验证和优化候选。在飓风哈维数据集上测试,其50米内定位准确率达47.01%,显著优于仅用MLLM或仅用跨视角的方法,尤其在模糊地名场景下提升最大。

来源arXiv Computer Vision作者: Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

在灾害应急响应中,社交媒体图像(SMI)提供了及时且细致的地面视角,这对于情境意识和应急响应非常有价值。然而,社交媒体中的地理位置引用往往模糊不清,使得准确定位充满挑战。针对这一问题,研究人员提出了DisasterTD框架,这是一种集成了多模态大语言模型(MLLMs)语义推理与跨视角地理定位的灾难地名消歧方案。

该框架首先利用MLLMs从嘈杂的文本输入中提取地名并生成候选地理位置。随后,通过社交媒体图像(SMI)、遥感图像(RSI)以及可选的街景图像(SVI)之间的跨视角匹配,对这些候选结果进行验证和优化。研究团队在飓风哈维数据集上评估了DisasterTD的性能,该数据集通过收集对应的RSI和SVI对SMI进行了增强,构建了一个用于灾害地理定位的跨视角基准。数据集根据地名清晰度和模糊度分为四个类别,从而可以对不同场景下的性能进行细致分析。

实验结果显示,DisasterTD在各项指标上均优于仅使用MLLM或仅使用跨视角方法且未进行消歧的基线系统。其地理定位准确率在1000米范围内达到71.62%,500米内为62.36%,250米内为57.99%,100米内为52.09%,50米内为47.01%。同时,平均误差和中位误差分别降低至11.33公里和0.68公里。最大的改进出现在模糊地名场景中,其中语义推理与跨视角证据的结合显著减少了候选分散和定位误差。这些发现证明了将基于MLLM的候选生成与跨视角验证相结合,对于实现细粒度灾害地理定位的有效性。

此外,DisasterTD框架具有实际应用价值。它能够帮助应急响应人员快速准确地定位社交媒体中提到的受灾地点,从而更有效地调配救援资源。跨视角匹配机制利用了不同视角图像的优势:社交媒体图像提供地面细节,遥感图像提供全局视野,街景图像提供地面参考,三者互补增强了定位可靠性。未来,该框架有望扩展到其他灾害类型和地理区域,进一步验证其泛化能力。