AI News HubLIVE
サイト内リライト2 分で読了

医療用大規模言語モデルの安全性、ロバスト性、公平性評価のためのマルチドメインレッドチーミングフレームワーク

本研究では、医療分野の大規模言語モデル(LLM)を敵対的・倫理的に複雑なシナリオで評価するマルチドメインレッドチーミングフレームワークを開発。11のLLMを690の臨床シナリオでテストした結果、平均スコアは0.791~0.984の範囲だが、高性能モデルでも安全上重要なシナリオで完全な失敗が発生。公平性タスクでは人口統計的変更により10~20%の誤差増大が確認され、平均精度だけでは臨床リスクを隠蔽することが明らかになった。自動評価と臨床医の監視を組み合わせたハイブリッド評価アプローチの重要性を強調。

ソースarXiv Computational Linguistics著者: Andrei Marian Feier, Veysel Kocaman, Yigit Gul, Ahmet Korkmaz, Alexander Thomas, Aleksei Zakharov, Jay Gil, Mehmet Butgul, David Talby

大規模言語モデル(LLM)の医療分野への導入が進む中、既存のベンチマークは臨床現場で一般的な敵対的または倫理的に複雑な条件下でのモデルの振る舞いを捉えきれていません。John Snow Labs Inc.の研究チームは、11の最新LLMを690の臨床シナリオで評価するマルチドメインレッドチーミングフレームワークを開発しました。このフレームワークは9つのドメインと150以上のサブカテゴリをカバーし、敵対的変換を組み込んでいます。モデルの応答は7次元のルーブリックを用いて評価され、LLM支援スコアリングとヒューマン・イン・ザ・ループ検証が併用されました。

結果は大きな性能ばらつきを示し、平均スコアは0.791から0.984の範囲でした。重要なことに、最高性能のシステム(X-BAI、GPT-5、Claude Opus 4.1など)でも、個々の安全上重要なシナリオで完全な失敗が発生し、全体的な平均精度が臨床的に意味のあるリスクを隠蔽することが明らかになりました。公平性関連タスクでは、人口統計的特徴(人種、性別など)の変更によりエラー率が10~20%増大し、人間のレビュアーは自動評価では見逃される臨床的に重要な失敗を特定しました。

本研究は2026年4月15日にarXivに投稿され、2026年3月29日にオランダ・デルフトで開催されるText2Story 2026ワークショップで発表予定です。研究チームは、性能のばらつきと最悪ケースの失敗が平均精度よりも臨床的に意味のある信頼性指標を提供し、自動化と臨床医の監視を組み合わせたハイブリッド評価アプローチが信頼できる安全性評価に不可欠であると結論付けています。このフレームワークは、医療用LLMの安全な展開に向けた重要な洞察を提供し、平均性能指標だけに依存することの危険性を示しています。論文の著者はAndrei Marian Feierら9名で、10ページ、4つの図表を含み、CEUR Workshop Proceedingsに掲載予定です。