AI News HubLIVE
站內改寫2 分鐘閱讀

Databricks for Good與美德基金會合作:連接醫療志願者與72個國家的關鍵醫療服務

美德基金會與Databricks for Good合作,利用AI提升全球醫療成果。雙方共同構建了一個生產級平台,通過大語言模型從72個低收入和中低收入國家提取醫療設施數據,並利用實體解析技術整合信息,最終通過VF Agent實現自然語言查詢,幫助醫療專業人員快速找到匹配的志願機會。

Databricks for Good與美德基金會(Virtue Foundation)近日宣佈合作,運用人工智能技術改善全球醫療服務的可及性。美德基金會是一家專注於全球健康交付的非營利組織,其核心平台VF Match旨在創建一個高效的慈善醫療市場,連接醫療專業人員與72個低收入和中低收入國家的志願機會。至今,該基金會已為超過50,000名患者提供醫療服務,重點關注加納和蒙古。

自2024年起,Databricks for Good與美德基金會密切合作,利用AI聚合這些國家的數據並將其轉化為可操作的信息。初始概念驗證表明,大語言模型(LLM)能夠從分散的網絡數據源中提取結構化信息,繪製醫療基礎設施地圖,並識別資源匱乏地區的服務缺口。然而,將這一功能擴展至生產環境面臨諸多挑戰。經過迭代,雙方構建了一個基於Databricks的生產級平台,聚合了全球數千家醫療設施和非營利組織的數據。

該平台的核心是基礎數據刷新(FDR)流程,它從零開始構建了一個全面的醫療設施和非營利組織數據集。數據來源包括Overture Maps(由Meta和Microsoft提供的開源地理空間數據集)和Bright Data(工業級網頁抓取基礎設施)。信息提取管道利用OpenAI的GPT模型,處理超過2500萬張網頁。管道將任務分解為多個步驟:分類醫療相關性、識別組織類型(醫療設施或非政府組織)、提取專科、設備和程序。這種方法大幅降低了令牌消耗,同時提高了每個模型調用的精度。

Databricks和Apache Spark負責高效編排和並行化抓取的數據,將工作負載分佈到數千個執行器上,實現高吞吐量的LLM推理。關鍵特性包括:可擴展的數據建模(星型模式存儲)、基於狀態的檢查點(支持斷點續傳)、可配置的提取註冊表(模塊化系統提示)以及可擴展的分佈式處理。Lakeflow Jobs編排了超過15個相互依賴的任務,支持條件分支、並行執行和智能重試策略。

實體解析是另一個挑戰。由於同一設施可能出現在多個數據源中,存在名稱差異、地址不一致等問題,傳統去重方法失效。團隊採用了開源的概率記錄鏈接框架Splink,通過電話號碼、街道地址等字段的加權比較評估匹配對,為每個設施生成統一的標識符。運行概率匹配時,早期遇到性能瓶頸:一個Spark分區運行30分鐘,而中位數僅52秒。啓用Databricks的向量化查詢引擎Photon後,最差分區從30分鐘降至約2分鐘,提升了15倍。

展望未來,團隊開發了VF Agent原型,採用LangGraph構建的多智能體架構,結合Databricks Model Serving、Vector Search和Genie。該代理允許專家使用自然語言分析數據:醫學專科提取器將用户語言轉換為標準醫學術語,然後由多智能體監督路由至向量搜索代理(設施發現和搜索)或Genie代理(結構化數據的分析查詢)。

最終,醫療專業人員能夠更快地發現最新的志願機會,找到與其專科匹配的崗位,並訪問全球數千家設施的數據。美德基金會從概念驗證到生產系統的歷程,展示了先進AI與統一數據平台結合的可能性。結果是形成了全球醫療基礎設施的宏觀視圖,凸顯了最需要醫療志願者的地區。