AI News HubLIVE
站内改写1 分钟阅读

CogArena:大型语言模型认知能力结构的多方法评估

CogArena是一个包含13个范式的程序化生成基准,用于评估大型语言模型的认知能力结构。对55个开源模型的测试显示,所有范式相关性均为正,共同因子解释了约一半的方差,但基于理论的分组内优势很小,且未能通过验证标准。研究表明,现有证据不支持稳定的五维认知能力画像。

来源arXiv Computational Linguistics作者: Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

近期,一篇发表在arXiv上的研究论文(arXiv:2607.24999)提出了一个名为CogArena的新型基准测试框架,旨在系统评估大型语言模型(LLM)的认知能力结构。该研究由Dengzhe Hou等四位作者完成,论文标题为“CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models”,于2026年7月27日提交。

CogArena是一个程序化生成的基准,包含13个不同的范式(paradigms),这些范式涵盖了五个理论驱动的认知分组:推理、记忆、语言理解、规划和感知。研究团队对55个开源权重模型进行了全面测试。结果显示,几乎所有范式之间的相关性均为正,且一个共同因子解释了约一半的方差。然而,理论分组内的优势非常微小,且对评分方式敏感,在不同模型家族间表现不确定。

为了进一步验证认知维度的稳定性,研究设计了一个冻结的交叉研究(frozen confirmatory study),涉及来自6个模型家族的12个模型。研究人员采用了针对性提示(targeted scaffolds)作为干预手段,结果表明分组内优势很小,且没有特定提示的对比能够通过多重性校正。此外,这种选择性并未改善对未参与训练模型家族的预测能力,导致冻结确认标准失败。随后的事后变体复制实验(post-hoc alternate-wording replication)也产生了较小的正估计值,同样未能通过验证。

基于这些结果,论文得出了一个边界性结论:虽然理论对齐的提示在测试内产生了一定的对角趋势,但现有证据不足以建立稳定的五维认知能力画像。CogArena提供了一个完整的工作流程,将行为特征、协方差、匹配干预和跨家族预测结合起来,强调在将认知标签附加到模型分数之前,必须经过严格的多方法验证。

该研究对于理解和评估LLM的认知能力具有重要意义,它提醒研究者不能仅凭表面相关性就认定能力维度的存在。未来,CogArena框架有望在更多模型和任务上应用,推动LLM认知评估的规范化发展。