AI News HubLIVE
サイト内リライト3 分で読了

Databricks for GoodとVirtue Foundationの提携:72カ国で医療ボランティアを重要な医療サービスに結びつける

Virtue FoundationはDatabricks for Goodと協力し、AIを活用して世界的な医療成果を向上させています。両者は、大規模言語モデルを用いて72の低・中低所得国から医療施設データを抽出し、エンティティ解決で情報を統合する本番環境対応プラットフォームを構築しました。さらに、VF Agentプロトタイプにより自然言語でのデータ分析を可能にし、医療専門家が適切なボランティア機会を迅速に見つけられるようにしました。

Databricks for GoodとVirtue Foundationは、人工知能を活用して世界の医療アクセスを改善するための提携を発表しました。Virtue Foundationは、世界的な健康提供に焦点を当てた非営利団体であり、その中核プラットフォームVF Matchは、医療専門家と72の低所得国および中低所得国でのボランティア機会を結びつける効率的な慈善医療市場を創出することを目指しています。これまでに5万人以上の患者に医療を提供し、特にガーナとモンゴルに重点を置いています。

2024年以降、Databricks for GoodはVirtue Foundationと密接に協力し、AIを使用してこれらの国のデータを集約し、実用的な情報に変換してきました。初期の概念実証では、大規模言語モデル(LLM)が分散したウェブデータソースから構造化情報を抽出し、医療インフラのマップを作成し、リソース不足地域のサービスギャップを特定できることが示されました。しかし、この機能を本番環境に拡張するには多くの課題がありました。反復を経て、両チームはDatabricksベースの本番グレードのプラットフォームを構築し、世界中の数千の医療施設と非営利団体からのデータを集約しています。

このプラットフォームの中核は、基礎データリフレッシュ(FDR)プロセスです。これは、さまざまなウェブソースからゼロから構築された包括的な医療施設および非営利団体データセットです。データソースには、Overture Maps(MetaとMicrosoftによるオープンソースの地理空間データセット)とBright Data(産業用ウェブスクレイピングインフラ)が含まれます。情報抽出パイプラインはOpenAIのGPTモデルを利用し、2500万以上のウェブページを処理します。パイプラインはタスクを段階的に分解し、医療関連性の分類、組織タイプ(医療施設またはNGO)の識別、専門分野、設備、手順の抽出を行います。このアプローチにより、トークン消費を大幅に削減し、各モデル呼び出しの精度を高めています。

DatabricksとApache Sparkは、スクレイピングデータを効率的にオーケストレーションし並列化し、数千のエグゼキュータにワークロードを分散して、高スループットのLLM推論を実現します。重要な機能には、拡張可能なデータモデリング(スタースキーマストレージ)、ステータスベースのチェックポイント(中断からの再開を可能にする)、設定可能な抽出レジストリ(モジュール化されたシステムプロンプト)、およびスケーラブルな分散処理が含まれます。Lakeflow Jobsは、条件分岐、並列実行、インテリジェントな再試行ポリシーを持つ15以上の相互依存タスクをオーケストレーションします。

エンティティ解決も重要な課題でした。同じ施設が複数のデータソースに名前のバリエーション、住所の不一致などで現れるため、従来の重複排除は機能しません。チームはオープンソースの確率的レコードリンケージフレームワークSplinkを採用し、電話番号や住所などのフィールドの重み付き比較を介してマッチペアを評価し、施設ごとに一意のキーを生成します。確率的マッチングの実行中、初期のパフォーマンスボトルネックが明らかになりました。1つのSparkパーティションが30分実行され、中央値は52秒でした。Databricksのベクトル化クエリエンジンPhotonを有効にすることで、最悪のパーティションが30分から約2分に短縮され、15倍の改善を達成しました。

将来を見据えて、チームはVF Agentプロトタイプを開発しました。これはLangGraphで構築されたマルチエージェントアーキテクチャを採用し、Databricks Model Serving、Vector Search、Genieを活用しています。このエージェントにより、専門家は自然言語を使用してデータを分析できます。Medical Specialty Extractorがユーザーの言葉を標準化された医療用語に変換し、マルチエージェントスーパーバイザーがクエリの意図と複雑さに基づいて、Vector Search Agent(施設の発見と検索)またはGenie Agent(構造化データに対する分析クエリ)にルーティングします。

最終的に、医療専門家は最新のボランティア機会をより迅速に発見し、自分の専門分野に合ったマッチングを見つけ、世界中の数千の施設に関するデータにアクセスできるようになりました。Virtue Foundationの概念実証から本番システムへの旅は、高度なAIシステムと統一されたデータプラットフォームを組み合わせることで何が可能になるかを示しています。結果は、世界的な医療インフラの全体像を示し、医療ボランティアが最も必要とされる地域を浮き彫りにしています。