通過事實-啓發式-情緒狀態強制執行測量和提高大型語言模型的行為一致性
大型語言模型在不同運行中可能對同一問題給出不同答案,甚至根據自身先前答案反轉決策。本研究提出認知內核模型(CKM),一種提示級別的狀態強制執行層,要求模型在決策前將輸入分為事實、啓發式和情緒三類。在26個LLM上的實驗表明,CKM顯著降低了輸出變異性(Hedges' g=1.09)和決策翻轉率(高達82%),且效果隨採樣隨機性增加而增強。但CKM並未提高推理正確性。
大型語言模型(LLM)在多個運行中可能對同一決策問題給出不同答案,甚至會在自己的先前答案作為上下文返回時反轉決策。這種不一致性引發了對其可靠性的擔憂。一項新研究探討了這種不穩定性是否可以在不改變模型權重的情況下被衡量和部分降低。
研究人員提出了認知內核模型(Cognitive Kernel Model, CKM),這是一種提示級別的狀態強制執行層。在模型做出決策之前,它必須將輸入分為三種認知角色:事實(給定或可驗證的信息)、啓發式(推斷或假設的信息)和情緒(評價性或優先級信號)。CKM不增加任何能力,而是強制模型在行動前跟蹤它使用何種類型的信息。形式上,它維護一個結構化狀態 S_t = {F_t, H_t, E_t},由轉換函數更新。
實驗在韓語決策場景(包括模糊性、倫理衝突、資源分配和錯誤處理)下進行,涉及來自四個供應商的26個LLM和37,403個觀測數據。研究包括四個核心實驗、一個四臂消融實驗、一個五臂假限制消融實驗和一個温度探測。主要發現如下:
(1) CKM降低了重複輸出的變異性(隨機效應Hedges' g=1.09,95%置信區間[0.83, 1.35],31個模型對); (2) 狀態持續性將較新模型的決策翻轉率降低了82%(g=1.52); (3) 效果不僅僅來自JSON格式化(僅值重新計算,g=2.24); (4) 在固定錨定狀態下,內在隨機性可忽略; (5) 在採樣隨機性下優勢增加(温度0.7時g=2.87); (6) 假限制消融顯示約45%的增益來自結構框架,55%來自事實/啓發式/情緒內容,且CKM是唯一同時提高一致性和降低翻轉率的方案。
值得注意的是,CKM並不改進推理正確性。更狹窄的結論是:行為一致性是可測量的,在各模型間不同,並且可以通過強制模型在決策前分離事實、假設和評價性信號來部分改善。該研究提供了代碼、提示和數據集,為進一步探索LLM行為一致性奠定了基礎。