一项最新研究揭示了一个令人不安的规律:在金融交易等高风险真实场景中,大语言模型(LLM)能力的提升反而可能增加系统整体风险,而非降低风险。来自 arXiv 的预印本论文《Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets》由 Jillian Ross 及另外四位作者共同撰写,并于 2026 年 9 月 3 日提交。论文编号为 arXiv:2609.04373,目前属于人工智能(cs.AI)以及计算机与社会(cs.CY)两个学科分类,全文共 14 页,包含 4 张图表。
研究指出,LLM 已被大规模部署到金融、内容审核、招聘等具有重大社会影响的现实系统中。传统观点认为,提高单点模型的性能会自然提升整体系统的表现,但这项研究通过严格的模拟验证,发现在某些情况下恰恰相反。核心假设是:由于这些模型共享大量训练数据和相似架构,能力更强的 LLM 往往会在推理与决策中表现出更高的行为趋同性。这种相关性会导致它们采取同质化的行动,而这些行动在统计上无法通过相互抵消来降低风险,因此形成了一个不可分散的系统性风险底线。
为了验证这一假设,研究者构建了一个基于智能体的金融市场模拟环境,让不同通识能力的 LLM 充当交易员进行模拟交易。实验得出了三项主要发现:其一,顶尖的(frontier)LLM 之间表现出急剧上升的相关行为,而且模型能力越强,这种相关性越显著;其二,当智能体之间共享的推理逻辑是准确时,增加这类智能体的参与数量反而能够降低市场层面的风险,因为它们的共识有助于价格回归理性;其三,当智能体共同处在一个包含错误信息的环境中时,高度相关的行为就会演变成显著的负债,导致所有智能体同时被误导,从而放大系统性风险。
研究者将这一结果概括为“能力悖论”(capability paradox):改进单个模型的性能并不必然带来更优的系统级结果,甚至可能恶化系统整体的稳健性。这种悖论的潜在影响并不仅限于金融市场。在内容推荐、自动驾驶、机器人协作等多个领域中,若多个高性能模型基于相同的训练偏差或共同上下文进行协同决策,类似的风险也能被放大。因此,设计者需要在模型能力提升之外,考虑多样化、去相关性以及系统层面校准的机制。
该论文的通讯作者之一查尔斯·波兹尼亚克(Charles Pozniak)在对论文提交记录的说明中指出,文章关注的正是模型间协同与系统稳定性之间的张力。研究者也谨慎地表示,尽管在金融市场的模拟中观察到了明确证据,但这些动力学机制是否会在其他领域以同样方式出现,仍然是一个开放性的实证问题,有待未来进一步的研究来回应。论文目前已获得 DataCite 平台分配的 DOI(10.48550/arXiv.2609.04373),但正式注册仍在等待处理。
这篇论文为 AI 安全与风险管理领域提供了新的思考方向,提醒人们在追求模型个体能力跃升时,必须警惕其在复杂社会系统中所产生的结构性风险。随着 LLM 在金融交易、自动决策等领域的参与度不断上升,理解并缓解这种能力带来的系统性隐患,已经开始成为一项不容忽视的重要议题。