AI News HubLIVE
サイト内リライト2 分で読了

AIは採用において人間よりも偏見を形成しやすい

プリンストン大学とシカゴ大学の研究により、大規模言語モデル(ChatGPT、Claude、Geminiなど)は模擬採用ゲームにおいて、人間よりも初期の限られた経験からステレオタイプを形成しやすく、異なる民族グループを職業別に隔離することが明らかになった。新しく高性能なモデルほど偏見が強く、ダイバーシティボーナスや個人情報の提供により軽減できる。AIが採用や融資などの判断を学習する際、未知の偏見が生じるリスクが指摘されている。

ソースHacker News AI著者: joozio

プリンストン大学とシカゴ大学の研究者らは、大規模言語モデル(LLM)が模擬採用状況において人間よりも偏見を形成しやすいことを発見した。この結果は、LLMが履歴書のスクリーニングや面接など実際の採用プロセスに導入される中で重要な警鐘となる。

研究チームは、ChatGPT、Claude、Geminiを含む複数のLLMに心理学研究を基にした模擬採用ゲームを実施した。各モデルは架空の都市のコンサルタントとして、医師、弁護士、保育士、清掃員などの20の職種に対して、4つの架空民族グループ(Tufa、Aima、Reku、Weki)から候補者を選ぶよう指示された。各ラウンドでモデルが1人を選ぶと、その候補者の職務成功・失敗が即座に通知された。実際には全候補者の成功確率は等しかった。

ところがモデルは、早期の観察結果に基づいてすぐに特定の民族グループを特定の職種に偏らせ始めた。例えば、Aima族の候補者が医師として失敗したと知ると、以後Aima族を医師に選ばなくなり、代わりに清掃員など「暖かさと能力が低い」と分類した職種に割り当てた。この偏見の強さは人間の参加者を大きく上回った。実験で使われた隔離指数(2が完全隔離)では、人間が0.84だったのに対し、LLMは平均して約65%高く、OpenAIのo3モデルは1.83に達した。

共著者のRyan Liu(プリンストン大学博士課程)は、LLMが限られたデータから一般化するように最適化されていることが原因だと説明する。探索と活用のジレンマの中で、LLMは初期の仮説に固執しやすく、特に社会的文脈で深刻な偏見を生む。また、推論能力が高い新モデル(o3やDeepSeek R1)ほど偏見が強かった。

コーネル大学のAngelina Wang氏(本研究非関与)は、チャットボットの記憶機能向上がこの問題を悪化させる可能性を指摘する。過去の会話履歴を頼りにしすぎて偏見を強化するからだ。単に記憶を減らすだけでは解決にならず、適切な記憶量のバランスが模索されている。

研究では緩和策も試みられた。「公平であれ」という指示は効果が薄かったが、多様な採用に報酬を与えるダイバーシティボーナスは偏見を大幅に低減した。また、候補者の年齢や教育など適応能力に関連する個人情報を提供すると、民族による隔離が減った。一方、髪色や刺青の形など無関係な情報では効果がなかった。

現実世界でAIがどの程度偏見を示すかは未解決の課題だが、フィードバックが遅れる中でも、一旦結果が入るとモデルが過度に一般化するリスクがある。研究者らは、LLMが採用や融資、仮釈放の判断を経験から学習する際、人間が教えていない新たな偏見が生じる可能性を警告している。

本研究は7月にソウルで開催されたICMLで発表された。