微調整済み大規模言語モデルを用いた英国警察インシデントログにおける脆弱性指標の特定
この研究は、米国の警察データに基づいて開発されたLLM分類パイプラインを英国の警察インシデント記録に適用し、精神的健康問題、薬物乱用、アルコール依存、ホームレスという4つの脆弱性指標の発生率を推定する可能性を探る。約3,000件の匿名化されたログを分析した結果、LLMは大規模に有意義な推定を提供できるが、単純な展開は信頼性に欠け、多大な人手と統計的補正が必要であることが判明した。LLMの出力は慎重な方法論的支援なしに有効な測定値として扱えないと強調している。
Sam Relins氏らの研究チームによる新しい研究では、微調整済みの大規模言語モデル(LLM)を使用して英国の警察インシデントログから脆弱性指標を特定する方法が探求され、この技術の大規模分析における可能性と限界が明らかになりました。この研究の主な目的は、日常の警察活動において脆弱な人々がどの程度関与しているかを理解することにあり、これはリソース配分、トレーニング、および多機関協力のための重要な情報を提供する可能性がありますが、従来の行政データでは十分な洞察が得られていません。
研究チームは、まずオープンソースの米国警察データで開発されたLLM分類パイプラインを英国の文脈に適応させました。英国のある警察署から提供された約3,000件の匿名化されたインシデント記録を分析し、精神的健康問題、薬物乱用、アルコール依存、ホームレスの4つの脆弱性指標の発生率を推定しました。データの機密性を確保するため、パイプラインはローカルでホストされたオープンウェイトLLM上で実行され、警察の厳格なセキュリティ要件を満たしています。
使用された分類パイプラインは多段階設計で、モデル推論の繰り返し、ラベルの集約、構造化された人手によるレビュー、統計的補正を組み合わせています。この複雑な設計は、単一のモデル推論の不安定性を補うことを目的としています。研究の結果、LLMは不完全ながらも大規模に有意義な発生率推定を提供できることが示されました。具体的には、精神的健康問題の指標は約5件に1件のインシデントで見られ、他の指標の発生率はそれよりも低いことがわかりました。
しかし、研究では重大な問題も明らかになりました。LLMをそのまま使用した単一パスの分類は非常に信頼性に欠け、分類結果は推論ごとに変動しました。さらに悪いことに、集約された出力は人間の判断と比較して脆弱性指標を系統的に過剰に割り当てる傾向がありました。これらの系統的な過大評価を補正するために、研究者は大量の人手によるレビューと統計的調整を必要とし、それでもかなりの不確実性が残りました。
研究チームは、LLMは非構造化警察データから情報を抽出できるものの、その出力は慎重な方法論的支援なしには有効な測定値として扱えないと結論付けています。集団レベルでは、十分なリソースを投入することで弁護可能な推定値を得ることが可能ですが、個人レベルではエラーが頻繁で予測不可能であり、運用上の意思決定への適合性は限られています。この研究は、実際の応用におけるLLMベースの測定の可能性と制約を浮き彫りにし、警察データ処理におけるAIの責任ある使用に重要な示唆を与えています。