AI News HubLIVE
サイト内リライト2 分で読了

証拠が矛盾するとき:検索拡張型生物医学質問応答における不確実性と順序効果

HealthContradictデータセットを用いて6つのオープンウェイトLLMを5つの証拠条件で評価した結果、矛盾する証拠により精度が低下し、11.4%~25.2%の予測が反転することが判明。提案された矛盾認識棄却スコアは、最も困難な条件で選択的精度を最大33.4ポイント向上させた。

ソースarXiv Computational Linguistics著者: Yikun Han, Mengfei Lan, Halil Kilicoglu

検索拡張生成(RAG)システムは生物医学分野で独自の課題に直面する:文献から検索された証拠は不完全、誤解を招く、または相互に矛盾する可能性がある。しかし、既存の評価手法は通常、有益な文脈下での正答率に焦点を当て、矛盾する証拠が信頼性に及ぼす影響を無視している。このBioNLP 2026に採択された研究は、この問題を体系的に調査する。

研究チームはHealthContradictデータセットを作成し、5つの検索条件を設計した:文脈なし、正しい文脈のみ、誤った文脈のみ、正しい文書と誤った文書が混在し順序が逆の2条件。実験はLlamaやMistralシリーズを含む6つのオープンウェイト大規模言語モデルをカバーする。

重要な発見として、同じ正しい文書と誤った文書のペアが順序のみ反転した場合、全モデルの精度が低下し、11.4%から25.2%の予測が反転した。この順序効果は、モデルが証拠の内容だけでなく提示順序にも敏感であることを示す。例えば、誤った文書が最初に提示されると、モデルはそれに引きずられやすい。

これらの困難なケースに対処するため、研究者はモデルの信頼度と証拠矛盾検出器の出力を組み合わせた矛盾認識棄却スコアを開発した。誤った文書のみを含む条件(IC)と誤った文書が先に提示される矛盾条件(ICC)という最も困難な2条件において、このスコアはカバレッジ75%、50%、25%で選択的精度を平均7.2~33.4ポイント(IC条件)および3.6~14.4ポイント(ICC条件)向上させた。これは信頼度のみに基づく方法よりも大幅な改善である。

この研究は、矛盾する証拠を不確実性とロバスト性の二重の問題として定義し、証拠の不一致を明示的に考慮する評価および棄却手法の開発を促す。臨床意思決定支援などの高リスクアプリケーションにおいて、矛盾情報に直面した際に正確に棄却することは、リスクを冒して回答するよりも安全である可能性がある。研究者はまた、より複雑な矛盾検出メカニズムや動的な証拠順序付け戦略を探求することで、実環境でのRAGシステムの信頼性をさらに向上できると述べている。