AI News HubLIVE
站內改寫1 分鐘閱讀

DisasterTD:利用多模態大語言模型和跨視角地理定位進行災難地名消歧

社交媒體的影像文本中常含有模糊的地理資訊,難以精確定位。本研究提出DisasterTD框架,結合多模態大語言模型(MLLMs)的語義推理與跨視角地理定位,先提取地名並生成候選位置,再透過跨視角匹配(社交媒體影像、遙感影像、街景影像)驗證和最佳化候選。在颶風哈維資料集上測試,其50米內定位準確率達47.01%,顯著優於僅用MLLM或僅用跨視角的方法,尤其在模糊地名場景下提升最大。

來源arXiv Computer Vision作者: Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

在災害應急響應中,社交媒體影像(SMI)提供了及時且細緻的地面視角,這對於情境意識和應急響應非常有價值。然而,社交媒體中的地理位置引用往往模糊不清,使得準確定位充滿挑戰。針對這一問題,研究人員提出了DisasterTD框架,這是一種整合了多模態大語言模型(MLLMs)語義推理與跨視角地理定位的災難地名消歧方案。

該框架首先利用MLLMs從嘈雜的文本輸入中提取地名並生成候選地理位置。隨後,透過社交媒體影像(SMI)、遙感影像(RSI)以及可選的街景影像(SVI)之間的跨視角匹配,對這些候選結果進行驗證和最佳化。研究團隊在颶風哈維資料集上評估了DisasterTD的效能,該資料集透過收集對應的RSI和SVI對SMI進行了增強,構建了一個用於災害地理定位的跨視角基準。資料集根據地名清晰度和模糊度分為四個類別,從而可以對不同場景下的效能進行細緻分析。

實驗結果顯示,DisasterTD在各項指標上均優於僅使用MLLM或僅使用跨視角方法且未進行消歧的基線系統。其地理定位準確率在1000米範圍內達到71.62%,500米內為62.36%,250米內為57.99%,100米內為52.09%,50米內為47.01%。同時,平均誤差和中位誤差分別降低至11.33公里和0.68公里。最大的改進出現在模糊地名場景中,其中語義推理與跨視角證據的結合顯著減少了候選分散和定位誤差。這些發現證明了將基於MLLM的候選生成與跨視角驗證相結合,對於實現細粒度災害地理定位的有效性。

此外,DisasterTD框架具有實際應用價值。它能夠幫助應急響應人員快速準確地定位社交媒體中提到的受災地點,從而更有效地調配救援資源。跨視角匹配機制利用了不同視角影像的優勢:社交媒體影像提供地面細節,遙感影像提供全域性視野,街景影像提供地面參考,三者互補增強了定位可靠性。未來,該框架有望擴充套件到其他災害型別和地理區域,進一步驗證其泛化能力。