一項最新研究揭示了一個令人不安的規律:在金融交易等高風險真實場景中,大語言模型(LLM)能力的提升反而可能增加系統整體風險,而非降低風險。來自 arXiv 的預印本論文《Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets》由 Jillian Ross 及另外四位作者共同撰寫,並於 2026 年 9 月 3 日提交。論文編號為 arXiv:2609.04373,目前屬於人工智能(cs.AI)以及計算機與社會(cs.CY)兩個學科分類,全文共 14 頁,包含 4 張圖表。
研究指出,LLM 已被大規模部署到金融、內容審核、招聘等具有重大社會影響的現實系統中。傳統觀點認為,提高單點模型的性能會自然提升整體系統的表現,但這項研究通過嚴格的模擬驗證,發現在某些情況下恰恰相反。核心假設是:由於這些模型共享大量訓練數據和相似架構,能力更強的 LLM 往往會在推理與決策中表現出更高的行為趨同性。這種相關性會導致它們採取同質化的行動,而這些行動在統計上無法通過相互抵消來降低風險,因此形成了一個不可分散的系統性風險底線。
為了驗證這一假設,研究者構建了一個基於智能體的金融市場模擬環境,讓不同通識能力的 LLM 充當交易員進行模擬交易。實驗得出了三項主要發現:其一,頂尖的(frontier)LLM 之間表現出急劇上升的相關行為,而且模型能力越強,這種相關性越顯著;其二,當智能體之間共享的推理邏輯是準確時,增加這類智能體的參與數量反而能夠降低市場層面的風險,因為它們的共識有助於價格迴歸理性;其三,當智能體共同處在一個包含錯誤信息的環境中時,高度相關的行為就會演變成顯著的負債,導致所有智能體同時被誤導,從而放大系統性風險。
研究者將這一結果概括為“能力悖論”(capability paradox):改進單個模型的性能並不必然帶來更優的系統級結果,甚至可能惡化系統整體的穩健性。這種悖論的潛在影響並不僅限於金融市場。在內容推薦、自動駕駛、機器人協作等多個領域中,若多個高性能模型基於相同的訓練偏差或共同上下文進行協同決策,類似的風險也能被放大。因此,設計者需要在模型能力提升之外,考慮多樣化、去相關性以及系統層面校準的機制。
該論文的通訊作者之一查爾斯·波茲尼亞克(Charles Pozniak)在對論文提交記錄的説明中指出,文章關注的正是模型間協同與系統穩定性之間的張力。研究者也謹慎地表示,儘管在金融市場的模擬中觀察到了明確證據,但這些動力學機制是否會在其他領域以同樣方式出現,仍然是一個開放性的實證問題,有待未來進一步的研究來回應。論文目前已獲得 DataCite 平台分配的 DOI(10.48550/arXiv.2609.04373),但正式註冊仍在等待處理。
這篇論文為 AI 安全與風險管理領域提供了新的思考方向,提醒人們在追求模型個體能力躍升時,必須警惕其在複雜社會系統中所產生的結構性風險。隨着 LLM 在金融交易、自動決策等領域的參與度不斷上升,理解並緩解這種能力帶來的系統性隱患,已經開始成為一項不容忽視的重要議題。