DisasterTD:利用多模態大語言模型和跨視角地理定位進行災難地名消歧
社交媒體的圖像文本中常含有模糊的地理信息,難以精確定位。本研究提出DisasterTD框架,結合多模態大語言模型(MLLMs)的語義推理與跨視角地理定位,先提取地名並生成候選位置,再通過跨視角匹配(社交媒體圖像、遙感圖像、街景圖像)驗證和優化候選。在颶風哈維數據集上測試,其50米內定位準確率達47.01%,顯著優於僅用MLLM或僅用跨視角的方法,尤其在模糊地名場景下提升最大。
在災害應急響應中,社交媒體圖像(SMI)提供了及時且細緻的地面視角,這對於情境意識和應急響應非常有價值。然而,社交媒體中的地理位置引用往往模糊不清,使得準確定位充滿挑戰。針對這一問題,研究人員提出了DisasterTD框架,這是一種集成了多模態大語言模型(MLLMs)語義推理與跨視角地理定位的災難地名消歧方案。
該框架首先利用MLLMs從嘈雜的文本輸入中提取地名並生成候選地理位置。隨後,通過社交媒體圖像(SMI)、遙感圖像(RSI)以及可選的街景圖像(SVI)之間的跨視角匹配,對這些候選結果進行驗證和優化。研究團隊在颶風哈維數據集上評估了DisasterTD的性能,該數據集通過收集對應的RSI和SVI對SMI進行了增強,構建了一個用於災害地理定位的跨視角基準。數據集根據地名清晰度和模糊度分為四個類別,從而可以對不同場景下的性能進行細緻分析。
實驗結果顯示,DisasterTD在各項指標上均優於僅使用MLLM或僅使用跨視角方法且未進行消歧的基線系統。其地理定位準確率在1000米範圍內達到71.62%,500米內為62.36%,250米內為57.99%,100米內為52.09%,50米內為47.01%。同時,平均誤差和中位誤差分別降低至11.33公里和0.68公里。最大的改進出現在模糊地名場景中,其中語義推理與跨視角證據的結合顯著減少了候選分散和定位誤差。這些發現證明了將基於MLLM的候選生成與跨視角驗證相結合,對於實現細粒度災害地理定位的有效性。
此外,DisasterTD框架具有實際應用價值。它能夠幫助應急響應人員快速準確地定位社交媒體中提到的受災地點,從而更有效地調配救援資源。跨視角匹配機制利用了不同視角圖像的優勢:社交媒體圖像提供地面細節,遙感圖像提供全局視野,街景圖像提供地面參考,三者互補增強了定位可靠性。未來,該框架有望擴展到其他災害類型和地理區域,進一步驗證其泛化能力。