一些大型语言模型表现出一致的风险态度
一项新研究通过跨领域框架测试了大型语言模型(LLMs)在不确定性下的风险态度,发现大多数模型在任务内和跨任务中都表现出稳定且一致的风险偏好,且其风险态度分布比人类更集中。
一篇发表在arXiv上的新研究(arXiv:2607.16197)引起了广泛关注,该研究揭示了一些大型语言模型(LLMs)在不确定性下表现出系统且一致的风险态度。随着人工智能系统越来越多地被部署在开放式、高风险的环境中,一个关键维度至今仍未得到充分衡量:感知到的风险如何转化为行动。这项研究通过引入一个跨领域框架,将情境风险信念与类别决策解耦,从而填补了这一空白。
研究人员对六个代表性LLM和100名人类参与者进行了测试,涉及三种截然不同的任务:空间导航、临床分诊和财务分配。利用回归模型,他们提取了每个智能体从信念到决策的映射,并量化了风险敏感度和风险态度偏差。结果令人瞩目:大多数测试的LLM表现出稳健的任务内一致性,即在固定任务领域内,从情境信念到风险决策的映射是稳定的。此外,这些模型还显示出跨领域的排名顺序稳定性,即在不同的任务中保持相对的风险姿态。值得注意的是,与更广泛的人类基线相比,LLMs的风险态度分布更趋于集中,显示出一种收敛性。
这些结果表明,风险态度是LLM行为中一个稳定的、此前未被表征的维度。该研究为评估和对齐在开放环境中决策的AI系统奠定了坚实基础,并激发了进一步探究这些内在行为倾向起源的动机。研究人员强调,理解这些风险态度对于确保AI在真实世界应用中的安全和可靠性至关重要。该论文由Bowen Sun等人撰写,提交于2026年4月24日,并获得了38条评论,收录于计算机科学人工智能子领域。