Databricks for Good與美德基金會合作:連線醫療志願者與72個國家的關鍵醫療服務
美德基金會與Databricks for Good合作,利用AI提升全球醫療成果。雙方共同構建了一個生產級平臺,透過大語言模型從72個低收入和中低收入國家提取醫療設施資料,並利用實體解析技術整合資訊,最終透過VF Agent實現自然語言查詢,幫助醫療專業人員快速找到匹配的志願機會。
Databricks for Good與美德基金會(Virtue Foundation)近日宣佈合作,運用人工智慧技術改善全球醫療服務的可及性。美德基金會是一家專注於全球健康交付的非營利組織,其核心平臺VF Match旨在建立一個高效的慈善醫療市場,連線醫療專業人員與72個低收入和中低收入國家的志願機會。至今,該基金會已為超過50,000名患者提供醫療服務,重點關注迦納和蒙古。
自2024年起,Databricks for Good與美德基金會密切合作,利用AI聚合這些國家的資料並將其轉化為可操作的資訊。初始概念驗證表明,大語言模型(LLM)能夠從分散的網路資料來源中提取結構化資訊,繪製醫療基礎設施地圖,並識別資源匱乏地區的服務缺口。然而,將這一功能擴充套件至生產環境面臨諸多挑戰。經過迭代,雙方構建了一個基於Databricks的生產級平臺,聚合了全球數千家醫療設施和非營利組織的資料。
該平臺的核心是基礎資料重新整理(FDR)流程,它從零開始構建了一個全面的醫療設施和非營利組織資料集。資料來源包括Overture Maps(由Meta和Microsoft提供的開源地理空間資料集)和Bright Data(工業級網頁抓取基礎設施)。資訊提取管道利用OpenAI的GPT模型,處理超過2500萬張網頁。管道將任務分解為多個步驟:分類醫療相關性、識別組織型別(醫療設施或非政府組織)、提取專科、裝置和程式。這種方法大幅降低了令牌消耗,同時提高了每個模型呼叫的精度。
Databricks和Apache Spark負責高效編排和並行化抓取的資料,將工作負載分佈到數千個執行器上,實現高吞吐量的LLM推理。關鍵特性包括:可擴充套件的資料建模(星型模式儲存)、基於狀態的檢查點(支援斷點續傳)、可配置的提取登錄檔(模組化系統提示)以及可擴充套件的分散式處理。Lakeflow Jobs編排了超過15個相互依賴的任務,支援條件分支、並行執行和智慧重試策略。
實體解析是另一個挑戰。由於同一設施可能出現在多個資料來源中,存在名稱差異、地址不一致等問題,傳統去重方法失效。團隊採用了開源的機率記錄連結框架Splink,透過電話號碼、街道地址等欄位的加權比較評估匹配對,為每個設施生成統一的識別符號。執行機率匹配時,早期遇到效能瓶頸:一個Spark分割槽執行30分鐘,而中位數僅52秒。啟用Databricks的向量化查詢引擎Photon後,最差分割槽從30分鐘降至約2分鐘,提升了15倍。
展望未來,團隊開發了VF Agent原型,採用LangGraph構建的多智慧體架構,結合Databricks Model Serving、Vector Search和Genie。該代理允許專家使用自然語言分析資料:醫學專科提取器將使用者語言轉換為標準醫學術語,然後由多智慧體監督路由至向量搜尋代理(設施發現和搜尋)或Genie代理(結構化資料的分析查詢)。
最終,醫療專業人員能夠更快地發現最新的志願機會,找到與其專科匹配的崗位,並訪問全球數千家設施的資料。美德基金會從概念驗證到生產系統的歷程,展示了先進AI與統一資料平臺結合的可能性。結果是形成了全球醫療基礎設施的宏觀檢視,凸顯了最需要醫療志願者的地區。