從描述性到規範性:揭示基於LLM的智慧體的社會價值對齊
本文提出了一種基於價值的框架,利用GraphRAG將原則轉化為價值導向的指令,並透過在具體對話上下文中檢索合適指令來引導智慧體行為。基於馬斯洛需求層次理論和普拉奇克情緒輪的預期行為定義,實驗表明該方法在DAILYDILEMMAS基準上顯著優於ECoT、Plan-and-Solve和元認知提示等基線方法,為AI系統中自我情緒的出現提供了基礎。
基於大語言模型(LLM)的智慧體在醫療、金融、客服等領域的廣泛應用,要求它們能夠與人類社會價值觀高度對齊。然而,現有LLM智慧體在自我認知、兩難決策和自我情緒方面仍存在明顯不足。例如,在涉及道德困境的對話中,智慧體往往無法像人類一樣權衡不同價值觀,或者表現出與人類期望不符的情緒反應。為了解決這一問題,研究者提出了一種新穎的基於價值的框架,該框架利用GraphRAG技術將抽象原則(如道德準則、社會規範)轉化為具體的價值導向指令,並在即時對話中根據上下文檢索最合適的指令來引導智慧體行為,使其輸出符合預期。
該框架的核心在於兩個關鍵創新:首先,透過GraphRAG構建原則與指令之間的語義關聯,使得智慧體能夠靈活應用多個原則而不僅僅是遵循單一規則;其次,定義預期行為時,研究者引入了心理學中的兩大經典理論——馬斯洛需求層次理論和普拉奇克情緒輪。前者涵蓋生理、安全、社交、尊重和自我實現需求,後者則描述了憤怒、喜悅、悲傷等基本情緒及其組合。透過將這些理論對映到智慧體的行為空間,研究者能夠系統性地評估智慧體在對話中展現期望行為的比例。
為了驗證方法的有效性,研究團隊在DAILYDILEMMAS基準上進行了實驗。該基準包含大量日常道德困境場景,需要智慧體在多種價值觀之間做出平衡。實驗結果表明,所提方法在期望行為比例上顯著優於多種提示基線方法,包括ECoT(情感鏈思考)、Plan-and-Solve和元認知提示(Metacognitive prompting)。值得注意的是,該方法不僅提升了智慧體在單一決策中的表現,還增強了其在多次互動中保持價值一致性的能力。
這項研究已被CogSci 2026接收,標誌著AI對齊研究從描述性分析向規範性指導的重要轉變。論文第一作者Jinxian Qu表示,這項工作為未來AI系統自我情緒的出現提供了理論基礎。隨著GraphRAG等技術的成熟,基於價值的智慧體有望在更復雜的現實場景中實現更可靠、更符合人類期望的行為。