从描述性到规范性:揭示基于LLM的智能体的社会价值对齐
本文提出了一种基于价值的框架,利用GraphRAG将原则转化为价值导向的指令,并通过在具体对话上下文中检索合适指令来引导智能体行为。基于马斯洛需求层次理论和普拉奇克情绪轮的预期行为定义,实验表明该方法在DAILYDILEMMAS基准上显著优于ECoT、Plan-and-Solve和元认知提示等基线方法,为AI系统中自我情绪的出现提供了基础。
基于大语言模型(LLM)的智能体在医疗、金融、客服等领域的广泛应用,要求它们能够与人类社会价值观高度对齐。然而,现有LLM智能体在自我认知、两难决策和自我情绪方面仍存在明显不足。例如,在涉及道德困境的对话中,智能体往往无法像人类一样权衡不同价值观,或者表现出与人类期望不符的情绪反应。为了解决这一问题,研究者提出了一种新颖的基于价值的框架,该框架利用GraphRAG技术将抽象原则(如道德准则、社会规范)转化为具体的价值导向指令,并在实时对话中根据上下文检索最合适的指令来引导智能体行为,使其输出符合预期。
该框架的核心在于两个关键创新:首先,通过GraphRAG构建原则与指令之间的语义关联,使得智能体能够灵活应用多个原则而不仅仅是遵循单一规则;其次,定义预期行为时,研究者引入了心理学中的两大经典理论——马斯洛需求层次理论和普拉奇克情绪轮。前者涵盖生理、安全、社交、尊重和自我实现需求,后者则描述了愤怒、喜悦、悲伤等基本情绪及其组合。通过将这些理论映射到智能体的行为空间,研究者能够系统性地评估智能体在对话中展现期望行为的比例。
为了验证方法的有效性,研究团队在DAILYDILEMMAS基准上进行了实验。该基准包含大量日常道德困境场景,需要智能体在多种价值观之间做出平衡。实验结果表明,所提方法在期望行为比例上显著优于多种提示基线方法,包括ECoT(情感链思考)、Plan-and-Solve和元认知提示(Metacognitive prompting)。值得注意的是,该方法不仅提升了智能体在单一决策中的表现,还增强了其在多次交互中保持价值一致性的能力。
这项研究已被CogSci 2026接收,标志着AI对齐研究从描述性分析向规范性指导的重要转变。论文第一作者Jinxian Qu表示,这项工作为未来AI系统自我情绪的出现提供了理论基础。随着GraphRAG等技术的成熟,基于价值的智能体有望在更复杂的现实场景中实现更可靠、更符合人类期望的行为。