CogArena:大型語言模型認知能力結構的多方法評估
CogArena是一個包含13個正規化的程式化生成基準,用於評估大型語言模型的認知能力結構。對55個開源模型的測試顯示,所有正規化相關性均為正,共同因子解釋了約一半的方差,但基於理論的分組內優勢很小,且未能透過驗證標準。研究表明,現有證據不支援穩定的五維認知能力畫像。
近期,一篇發表在arXiv上的研究論文(arXiv:2607.24999)提出了一個名為CogArena的新型基準測試框架,旨在系統評估大型語言模型(LLM)的認知能力結構。該研究由Dengzhe Hou等四位作者完成,論文標題為“CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models”,於2026年7月27日提交。
CogArena是一個程式化生成的基準,包含13個不同的正規化(paradigms),這些正規化涵蓋了五個理論驅動的認知分組:推理、記憶、語言理解、規劃和感知。研究團隊對55個開源權重模型進行了全面測試。結果顯示,幾乎所有正規化之間的相關性均為正,且一個共同因子解釋了約一半的方差。然而,理論分組內的優勢非常微小,且對評分方式敏感,在不同模型家族間表現不確定。
為了進一步驗證認知維度的穩定性,研究設計了一個凍結的交叉研究(frozen confirmatory study),涉及來自6個模型家族的12個模型。研究人員採用了針對性提示(targeted scaffolds)作為干預手段,結果表明分組內優勢很小,且沒有特定提示的對比能夠透過多重性校正。此外,這種選擇性並未改善對未參與訓練模型家族的預測能力,導致凍結確認標準失敗。隨後的事後變體複製實驗(post-hoc alternate-wording replication)也產生了較小的正估計值,同樣未能透過驗證。
基於這些結果,論文得出了一個邊界性結論:雖然理論對齊的提示在測試內產生了一定的對角趨勢,但現有證據不足以建立穩定的五維認知能力畫像。CogArena提供了一個完整的工作流程,將行為特徵、協方差、匹配干預和跨家族預測結合起來,強調在將認知標籤附加到模型分數之前,必須經過嚴格的多方法驗證。
該研究對於理解和評估LLM的認知能力具有重要意義,它提醒研究者不能僅憑表面相關性就認定能力維度的存在。未來,CogArena框架有望在更多模型和任務上應用,推動LLM認知評估的規範化發展。