AI News HubLIVE
站内改写1 分钟阅读

行动之前:面向前瞻性假设发现的LLM基准测试

大型语言模型(LLM)在回答预设问题方面表现优异,但其在开放式、结论前阶段的探索能力尚未得到充分评估。本文提出前瞻性假设发现(PHD)任务,要求模型从不确定证据中自主构建有依据、可区分且可检验的假设空间。为评估该能力,研究者推出HypoArena基准,包含涵盖六个科学分析领域的988个案例的HypoData数据集及HypoEval评估框架。实验表明,15个前沿LLM在该任务上表现出明显的能力分层,并揭示了结构化分析技能对模型性能的依赖效应。

来源arXiv Computational Linguistics作者: Tianyun Zhong, Wangyi Jiang, Wei Wang, Xuanang Chen, Yaojie Lu, Shiwei Ye, Yuzhen Shi, Boyu Yang, Jinghang Wang, Han Li, Weiqi Zhai, Bing Zhao, Hu Wei, Haiyang Yu, Yongbin Li, Hongyu Lin, Le Sun, Xianpei Han

大型语言模型(LLM)在回答预定义问题方面已经展现出卓越的能力,但它们在开放式的、结论尚未得出的发现阶段中自主导航的能力,在很大程度上尚未被测量。为了填补这一空白,一个研究团队引入了前瞻性假设发现(Prospective Hypothesis Discovery,简称PHD)任务,该任务要求模型从不确定的证据(包括异常观察和碎片化记录)中自主构建有根据、有区分度且可检验的假设空间,以指导后续的研究。

为了系统地评估这一能力,研究者推出了HypoArena基准测试套件,它由两个核心组件构成:HypoData(一个包含988个案例的基准数据集,涵盖六个科学和分析领域)和HypoEval(一个用于评估开放式假设集的框架)。为了大规模构建HypoData,团队提出了一种称为“回顾性上下文回归”的方法,这是一个“锻造-审计”流水线,通过从已完成的专家文档中移除明确的结论、目标假设和回顾性因果归因,同时保留事实基础,来重建结论前的上下文。

由于PHD任务允许多个有效输出,HypoEval结合了双向成对判断与Bradley-Terry-Davidson聚合进行排名,以及六维评分表进行诊断。在15个前沿LLM上进行的实验揭示了清晰的能力分层,以及结构化分析技能对模型依赖的影响。一些性能较低的模型在HypoArena上取得了进步,但其他系统(包括一个顶级模型)出现了退化。与绝对评分表相比,竞技场评估能解析出模型间更细微的差异,且聚合排名与人类专家及独立评判者高度一致。

这些结果共同支持将PHD作为评估LLM在最终结论被隐藏时如何制定研究方向的独特目标。研究团队已公开其代码和数据,分别位于github.com/SKYLENAGE-AI/HypoArena和github.com/SKYLENAGE-AI/HypoArena。