行动之前:面向前瞻性假设发现的LLM基准测试
大型语言模型(LLM)在回答预设问题方面表现优异,但其在开放式、结论前阶段的探索能力尚未得到充分评估。本文提出前瞻性假设发现(PHD)任务,要求模型从不确定证据中自主构建有依据、可区分且可检验的假设空间。为评估该能力,研究者推出HypoArena基准,包含涵盖六个科学分析领域的988个案例的HypoData数据集及HypoEval评估框架。实验表明,15个前沿LLM在该任务上表现出明显的能力分层,并揭示了结构化分析技能对模型性能的依赖效应。
大型语言模型(LLM)在回答预定义问题方面已经展现出卓越的能力,但它们在开放式的、结论尚未得出的发现阶段中自主导航的能力,在很大程度上尚未被测量。为了填补这一空白,一个研究团队引入了前瞻性假设发现(Prospective Hypothesis Discovery,简称PHD)任务,该任务要求模型从不确定的证据(包括异常观察和碎片化记录)中自主构建有根据、有区分度且可检验的假设空间,以指导后续的研究。
为了系统地评估这一能力,研究者推出了HypoArena基准测试套件,它由两个核心组件构成:HypoData(一个包含988个案例的基准数据集,涵盖六个科学和分析领域)和HypoEval(一个用于评估开放式假设集的框架)。为了大规模构建HypoData,团队提出了一种称为“回顾性上下文回归”的方法,这是一个“锻造-审计”流水线,通过从已完成的专家文档中移除明确的结论、目标假设和回顾性因果归因,同时保留事实基础,来重建结论前的上下文。
由于PHD任务允许多个有效输出,HypoEval结合了双向成对判断与Bradley-Terry-Davidson聚合进行排名,以及六维评分表进行诊断。在15个前沿LLM上进行的实验揭示了清晰的能力分层,以及结构化分析技能对模型依赖的影响。一些性能较低的模型在HypoArena上取得了进步,但其他系统(包括一个顶级模型)出现了退化。与绝对评分表相比,竞技场评估能解析出模型间更细微的差异,且聚合排名与人类专家及独立评判者高度一致。
这些结果共同支持将PHD作为评估LLM在最终结论被隐藏时如何制定研究方向的独特目标。研究团队已公开其代码和数据,分别位于github.com/SKYLENAGE-AI/HypoArena和github.com/SKYLENAGE-AI/HypoArena。