記述から規範へ:LLMベースエージェントの社会的価値整合性を明らかにする
本論文では、GraphRAGを用いて原則を価値ベースの指示に変換し、会話コンテキストに応じて適切な指示を取得することでエージェントの振る舞いを制御する新しい価値ベースのフレームワークを提案する。マズローの欲求階層説とプルチックの感情の輪から期待される行動を定義し、DAILYDILEMMASベンチマークでの実験により、ECoT、Plan-and-Solve、メタ認知プロンプティングなどのベースラインと比較して有意な性能向上を示し、AIシステムにおける自己感情の出現の基盤を提供する。
大規模言語モデル(LLM)に基づくエージェントは、医療、金融、カスタマーサービスなど幅広い分野で応用されており、人間の社会的価値観との強力な整合性が求められています。しかし、現在のLLMエージェントは、自己認知、ジレンマ判断、自己感情において依然として欠陥が見られます。例えば、道徳的ジレンマを含む会話では、エージェントは人間のように異なる価値観を权衡することができず、人間の期待に反した感情反応を示すことがあります。この問題を解決するために、研究者たちは新しい価値ベースのフレームワークを提案しました。このフレームワークは、GraphRAG技術を用いて抽象的な原則(道徳基準や社会規範など)を具体的な価値ベースの指示に変換し、リアルタイムの会話コンテキストに応じて最も適切な指示を検索してエージェントの行動を期待通りに導きます。
このフレームワークの核心は二つの革新的な点にあります。第一に、GraphRAGによって原則と指示の間の意味的関連性を構築し、エージェントが単一のルールに従うのではなく、複数の原則を柔軟に適用できるようにすることです。第二に、期待される行動を定義する際に、心理学の二大理論——マズローの欲求階層説とプルチックの感情の輪——を導入しています。前者は生理的欲求、安全の欲求、社会的欲求、承認欲求、自己実現欲求をカバーし、後者は怒り、喜び、悲しみなどの基本感情とその組み合わせを記述します。これらの理論をエージェントの行動空間にマッピングすることで、研究者は会話中にエージェントが期待される行動を示す割合を体系的に評価できます。
手法の有効性を検証するため、研究チームはDAILYDILEMMASベンチマークで実験を行いました。このベンチマークは、日常的な道徳ジレンマのシナリオを多数含み、エージェントが複数の価値観のバランスを取る必要があります。実験結果は、提案手法がECoT(感情連鎖思考)、Plan-and-Solve、メタ認知プロンプティングなどのプロンプトベースのベースラインと比較して、期待される行動の割合において有意な改善を示しました。特筆すべきは、この手法が単一の意思決定におけるパフォーマンスを向上させるだけでなく、複数回のインタラクションにわたって価値の一貫性を維持する能力も高めたことです。
この研究はCogSci 2026に採択され、AIアライメント研究が記述的分析から規範的ガイダンスへと重要な転換を遂げたことを示しています。論文の第一著者であるJinxian Qu氏は、この研究が将来のAIシステムにおける自己感情の出現の基盤を提供すると述べています。GraphRAGなどの技術が成熟するにつれて、価値ベースのエージェントはより複雑な現実シナリオで、より信頼性が高く人間の期待に合った行動を実現することが期待されます。