AI News HubLIVE
站内改写2 分钟阅读

Databricks for Good与美德基金会合作:连接医疗志愿者与72个国家的关键医疗服务

美德基金会与Databricks for Good合作,利用AI提升全球医疗成果。双方共同构建了一个生产级平台,通过大语言模型从72个低收入和中低收入国家提取医疗设施数据,并利用实体解析技术整合信息,最终通过VF Agent实现自然语言查询,帮助医疗专业人员快速找到匹配的志愿机会。

Databricks for Good与美德基金会(Virtue Foundation)近日宣布合作,运用人工智能技术改善全球医疗服务的可及性。美德基金会是一家专注于全球健康交付的非营利组织,其核心平台VF Match旨在创建一个高效的慈善医疗市场,连接医疗专业人员与72个低收入和中低收入国家的志愿机会。至今,该基金会已为超过50,000名患者提供医疗服务,重点关注加纳和蒙古。

自2024年起,Databricks for Good与美德基金会密切合作,利用AI聚合这些国家的数据并将其转化为可操作的信息。初始概念验证表明,大语言模型(LLM)能够从分散的网络数据源中提取结构化信息,绘制医疗基础设施地图,并识别资源匮乏地区的服务缺口。然而,将这一功能扩展至生产环境面临诸多挑战。经过迭代,双方构建了一个基于Databricks的生产级平台,聚合了全球数千家医疗设施和非营利组织的数据。

该平台的核心是基础数据刷新(FDR)流程,它从零开始构建了一个全面的医疗设施和非营利组织数据集。数据来源包括Overture Maps(由Meta和Microsoft提供的开源地理空间数据集)和Bright Data(工业级网页抓取基础设施)。信息提取管道利用OpenAI的GPT模型,处理超过2500万张网页。管道将任务分解为多个步骤:分类医疗相关性、识别组织类型(医疗设施或非政府组织)、提取专科、设备和程序。这种方法大幅降低了令牌消耗,同时提高了每个模型调用的精度。

Databricks和Apache Spark负责高效编排和并行化抓取的数据,将工作负载分布到数千个执行器上,实现高吞吐量的LLM推理。关键特性包括:可扩展的数据建模(星型模式存储)、基于状态的检查点(支持断点续传)、可配置的提取注册表(模块化系统提示)以及可扩展的分布式处理。Lakeflow Jobs编排了超过15个相互依赖的任务,支持条件分支、并行执行和智能重试策略。

实体解析是另一个挑战。由于同一设施可能出现在多个数据源中,存在名称差异、地址不一致等问题,传统去重方法失效。团队采用了开源的概率记录链接框架Splink,通过电话号码、街道地址等字段的加权比较评估匹配对,为每个设施生成统一的标识符。运行概率匹配时,早期遇到性能瓶颈:一个Spark分区运行30分钟,而中位数仅52秒。启用Databricks的向量化查询引擎Photon后,最差分区从30分钟降至约2分钟,提升了15倍。

展望未来,团队开发了VF Agent原型,采用LangGraph构建的多智能体架构,结合Databricks Model Serving、Vector Search和Genie。该代理允许专家使用自然语言分析数据:医学专科提取器将用户语言转换为标准医学术语,然后由多智能体监督路由至向量搜索代理(设施发现和搜索)或Genie代理(结构化数据的分析查询)。

最终,医疗专业人员能够更快地发现最新的志愿机会,找到与其专科匹配的岗位,并访问全球数千家设施的数据。美德基金会从概念验证到生产系统的历程,展示了先进AI与统一数据平台结合的可能性。结果是形成了全球医疗基础设施的宏观视图,凸显了最需要医疗志愿者的地区。