Collider-Bench:用粒子物理分析复现来基准测试AI智能体
Collider-Bench是一个新基准,用于评估大型语言模型(LLM)智能体能否仅凭公开论文和开源软件复现大型强子对撞机(LHC)的实验分析。智能体需构建模拟与选择流水线,并预测指定信号区间的碰撞事件产额。评估采用直方图指标和LLM裁判检测失败模式。初步结果显示,尚无智能体能可靠击败人类物理学家。
近日,一篇提交至arXiv的论文提出了Collider-Bench——一个用于评估AI智能体复现大型强子对撞机(LHC)实验分析能力的全新基准。该研究由Darius A. Faroughy等五位作者共同完成,旨在检验大型语言模型(LLM)智能体能否仅依赖公开论文和开源科学软件,自主复现高能物理实验的关键步骤。
在粒子物理领域,实验协作组内部使用的软件与公开工具链存在差异,且已发表论文常常省略实现细节,这导致分析复现极具挑战。Collider-Bench要求智能体将已发表的分析方法转化为可执行的模拟与选择流水线,并提交指定信号区间的预测碰撞事件产额。评估采用标准直方图指标,提供连续的保真度评分,无需手工编制的评分标准。此外,研究者还报告了每个智能体完成任务的计算机开销,并使用LLM裁判分析代码库和完整会话记录,以捕捉编造、幻觉和重复等定性失败模式。这种双管齐下的评估方式不仅量化了准确度,还揭示了智能体在推理过程中的常见陷阱。
该基准附带一组从LHC搜索中提取的初始任务,以及容器化沙箱和事件模拟工具,使得任何开发者都可以复现评估。研究者在通用编码智能体的能力阶梯上进行了评估,范围从简单的代码补全到复杂的多步骤推理。结果令人深思:平均而言,没有任何智能体能可靠地超越“物理学家参与循环”的解决方案。即使是最先进的智能体,也在某些任务上出现了严重的幻觉或错误,尤其是在需要精确物理常数或特定探测器几何的环节。这表明,尽管LLM在自然语言处理上表现优异,但在处理需要严格领域知识和细致实验细节的科学复现任务时,仍有很长的路要走。该工作为未来AI在科学研究中的应用设立了严谨的测试标准,也为改进智能体的工具使用和知识整合能力指明了方向。