データ品質こそがAI戦略
高品質なAIには高品質なデータが必要であり、それはトランザクションシステムを先に修正することを意味します。NYU Langone Healthの事例を通じて、統一データプラットフォーム、ガバナンス、データリテラシーコミュニティの構築により、リアルタイムの臨床意思決定支援を実現し、医療の質と効率を向上させる方法を探ります。
データ品質こそがAI戦略であり、そのためにはまずトランザクションシステムを修正する必要があります。これはDatabricksブログの記事の中心的な主張です。記事はNYU Langone Healthを例に、データの発生源におけるガバナンスを通じてAIの可能性を引き出す方法を詳述しています。
医療業界はAIの最大の受益者の一つかもしれません。これほど多くのデータを生成し、そこから洞察を得ることで大きな利益を得られる業界は他にありません。しかし、ほとんどの医療システムでは、データを生成することと、それを実際にケアの改善、研究の加速、業務の効率化に活用することの間には依然として大きなギャップがあります。そのギャップを埋めつつある組織は、モデルではなくデータから始めています。
NYU Langone Healthは、ニューヨーク都市圏に患者ケア、医学研究、医学教育を提供する主要な学術医療システムです。同機関はDatabricksを統合データおよびAIプラットフォームとして採用し、最近ではオンプレミスのデータレイクを廃止し、エンタープライズデータウェアハウスを移行中です。プラットフォームのユーザーには、臨床医、アナリスト、科学者、企業関係者が含まれ、ケア提供、運用、研究の各分野で活用されています。
最高デジタル・情報責任者のNader Mherabi氏は、現在のAIブーム以前から同機関のデータ戦略を率いており、データ主導の医療システムの基盤を築いてきました。2017年、彼はNYU Langoneのデータ収集の質を認識し、新興AI機能をさらに活用する機会を見出しました。彼が繰り返し用いた比喩は、きれいな水が欲しければパイプを修理せよ、末端でろ過しようとするな、というものです。
Mherabi氏は、自組織の道のりは他とは少し異なると述べています。NYU Langoneは常に高度にデータ駆動型で指標重視の組織であり、従来のスタックでもデータレイクとエンタープライズデータウェアハウスに統合データをすでに持っていました。しかし、モダンプラットフォームへの移行の必要性は2017年に明らかでした。当時から、AIの可能性はデータスタックの近代化を意味していました。モデルを構築することと、それを24時間365日安全かつ確実に運用することは別問題です。患者の質、安全性、効率、医学研究に関する目標を実現し、技術の進化に伴って成長できるプラットフォームが必要でした。
彼らが10年以上前に確立した指導原則の一つは、インテリジェンス層で高品質なデータを本当に望むなら、まずトランザクションシステムで修正せよ、というものです。水道管にたとえれば、水源できれいな水があれば、末端で繰り返しろ過する必要はありません。汚れた水をろ過するのはコストがかかります。したがって、目標は常に最初にきれいな水を得ることです。途中でろ過しなければならないこともありますが、上流で正しくすることが原則です。
長年にわたり、NYU Langoneは共通のトランザクションプラットフォーム(統合電子健康記録やERPシステムなど)への投資とデータの指導原則の策定により、データ品質の課題に取り組んできました。例えば、データウェアハウス層でデータをマッピングすることは決してせず、常に発生源で修正しようと試みています。システムとデータを掌握し、患者データの権威あるソース、財務データ、業務データのソースを明確にしました。これにより、データプラットフォームはより有意義になり、医療において重要なデータのクロスウォークが可能になります。例えば、患者を中心に据え、ケアデータを利用可能な臨床試験、財務データ、さらには手術中に採取された検体とその物理的な保管場所に結び付ける必要があります。このマッピングがなければ、大きな能力を欠くことになります。
医療現場ではデータの正確性が極めて重要です。統一されたデータ基盤は、部門間の「指標の矛盾」を防ぎます。AI以前でも、統一データによるメリットは計り知れません。データが統一されていれば、より良い指標を作成でき、ビジネスの異なる側面が「その数字はおかしい」と言ってくることはありません。データが統一されていなければ、指標は決して一致しません。AIの場合、リスクはさらに高まります。優れたデータがなければ優れたAIは生まれません。パフォーマンスはデータ品質に依存します。さらに、リアルタイム性も重要です。適切なタイミングと場所で人々に洞察を提供することが求められます。
統合ガバナンスは戦略的なAIの必須事項です。統一データを手に入れた後の次の課題は、データを発見可能で信頼できるものにすることです。Mherabi氏は、ガバナンスが基本であり、データとAIモデルを操作するにはカタログが必要だと述べています。彼らはUnity Catalogを利用していますが、投資はツールだけでなく、それを取り巻く戦略にも向けられています。マスタデータソースを定義し、カタログの各部分の所有者を決め、それをどのように広いコミュニティに公開するかを慎重に検討する必要があります。重複作業を避けつつ、人々が必要なデータを見つけられるようにするためです。
データリテラシーコミュニティの構築も重要です。Mherabi氏は、このようなプラットフォームに投資する場合、その投資を最適化しなければならないと述べています。そのためには、組織全体にその能力を広めることが必要です。目標は学習型医療システムになることであり、すべての患者とのやり取りから学び、その洞察を実際の診療にフィードバックすることです。これは、プラットフォームを使用するコミュニティがIT部門をはるかに超えて広がらなければ実現しません。彼らは、適切なアクセス制御の下で、臨床医、アナリスト、科学者からなる広範なユーザーベースを構築し、ケア提供、運用、研究の各分野で活用できるよう、リテラシープログラムとトレーニングに投資してきました。
救急室のような高緊急性の環境では、リアルタイムの洞察が不可欠です。Mherabi氏は、救急室で稼働するモデルについて説明しています。これらのモデルは特定の危険な状態を監視し、臨床医の前に意思決定支援を提供します。目標は、患者が退院する際に、システムが「この診断は確認しましたか?これを見ましたか?」とフラグを立てることです。見逃されると深刻な結果を招く可能性のある状態を防ぐためです。これらのモデルが機能するにはリアルタイムデータが必要であり、データプラットフォームはリアルタイムフィードをサポートし、モデルが最新情報に基づいて動作し、ちょうど良いタイミングで洞察を提供できるようにしなければなりません。
分析とBI戦略に関して、Mherabi氏は分析には3つの層があると考えています。第一に基本的な可視化を提供すること。第二に会話層(Genieなど)を追加し、ユーザーが好奇心を持ってより深い質問ができるようにすること。第三に、ユーザーに応じて異なる形式で答えを提供すること——直接的な事実、可視化、または画面上のいくつかの数字など。彼は、人間と機械の歴史において初めて、人間の言葉で機械と話すことができるようになったと指摘します。しかし、それが適切な場面と程度を考慮するようアドバイスしています。可視化を完全に置き換えるのではなく、会話層を追加してユーザーが好奇心を持ち、簡単な方法で質問し、自分自身で答えを見つけられるようにすべきです。
最後に、Mherabi氏はAIの予測不可能性を受け入れ、価値創造に焦点を当てるよう勧めています。安全で高品質なケアの提供、業務効率の改善、患者体験の向上など、価値はさまざまです。今日存在する機能で価値を追求し、進化し続けること。そして、自分自身を教育することも重要です。ためらいの原因の一部は、何が起こっているのか理解できないという感覚です。市場の進化、特に現在のペースについていくために、できる限り情報を得ておくことが、より良い意思決定につながります。
NYU Langoneの早期かつ意図的なアプローチが、この議論から得られる重要な教訓です。きれいな水の比喩は重要なことを捉えています。下流で汚れた水をろ過するのに投資する組織は、常に追いかける立場にあります。一方、トランザクション層でデータを修正する組織は、たとえ初期に時間とコストがかかっても、その後のすべての投資——分析からAI、リアルタイムの臨床意思決定支援まで——が確実に構築できる基盤を築きます。患者の安全がかかっている状況では、その規律はオプションではありません。