AI News HubLIVE
サイト内リライト2 分で読了

確率的な結果に対するリスク認識型の選好学習

人間は不確実な結果を評価する際にリスクに敏感であり、稀なネガティブイベントを過大評価する傾向がある。従来の報酬学習では期待効用(EU)モデルが使われるが、本研究では累積プロスペクト理論(CPT)に基づく手法を提案。ソーシャルロボットナビゲーション実験で、リスク敏感なユーザーの選好に対してCPTがEUよりも低い後悔値を達成し、人間のリスク感受性をモデル化する重要性を示した。

ソースarXiv Robotics著者: Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

人間とロボットのインタラクションにおいて、報酬関数を人間の選好から学習することは、ロボットの行動をユーザーの期待に合わせるための広く使われる手法である。しかし、既存の手法のほとんどは、人間が不確実な結果を期待効用(EU)を使って評価すると仮定し、結果の効用を確率で線形に重み付けしている。行動科学の証拠は、人間が系統的にリスクに敏感であり、稀なネガティブイベントを過大評価し、損失回避を示すことを明らかにしている。このミスマッチは、ソーシャルロボットナビゲーションのような安全クリティカルな応用において特に問題となる。なぜなら、衝突などの結果は稀であっても非常に重大だからである。

このギャップを埋めるため、研究者らは非線形な意思決定モデルである累積プロスペクト理論(CPT)をBradley-Terry選好学習フレームワークに組み込んだ。CPTは確率の非線形重み付けと損失への感度を捉えることができ、リスク敏感なユーザーの選好をより忠実に反映する。実験はソーシャルロボットナビゲーションシナリオに焦点を当て、リスク敏感なユーザーが生成した選好に対して、CPTベースの学習器がEUベースの学習器よりも大幅に低い後悔値で報酬関数を回復できることを示した。後悔値は学習された方策と最適方策のギャップを測定し、低い後悔値はユーザーの期待に近い行動を示す。

結果は、リスク感受性を無視すると安全クリティカルな状況で最適でない意思決定につながることを強調している。例えば、ロボットが衝突リスクを過小評価し、危険な行動をとる可能性がある。この研究は、確率的な結果と安全上の懸念を伴うインタラクションにおいて、人間のリスク感受性をモデル化する重要性を強調している。将来の研究では、より複雑なシナリオや実際の展開に拡張し、CPTの頑健性を検証する予定である。本成果は、2026年のICRAにおける「ロボット学習と人間ロボットインタラクションのギャップを埋める」ワークショップで発表された。