AI News HubLIVE
站内改写1 分钟阅读

Relay-Bench:评估大语言模型在多领域推理链上的表现

Relay-Bench 是一个全新的未饱和基准测试,旨在评估大语言模型在单个提示中完成多个不同领域任务的能力。当前领先模型 GPT-5.5 (xHigh) 得分仅为 43.3%,表明模型在多领域复合推理方面仍有巨大提升空间。

来源arXiv Computational Linguistics作者: Liam Swayne

近日,一项名为 Relay-Bench 的新型基准测试正式发布,该测试专门用于评估大语言模型(LLM)在复杂多领域推理链上的表现。与以往仅测试单一能力的基准不同,Relay-Bench 要求模型在单个提示中依次完成来自不同领域的多个子问题,从而模拟真实世界中需要综合运用多种技能的复合任务。

Relay-Bench 的测试集完全由复合问题组成,每个问题包含2到13个单领域子问题。这些子问题涵盖了视觉推理(以文本形式描述)、编程、数学、信息提取(重点为网络搜索)、问题解决、常识知识和数据分析共8个领域。为了增加难度,许多问题还通过提示编码(prompt encoding)和故意添加冗余上下文(context bloat)来增加复杂度,使得模型必须在混乱的信息中准确提取关键要素。

在最新评估中,表现最好的模型是 OpenAI 的 GPT-5.5 (xHigh),但其得分仅为 43.3%,远未达到饱和水平。值得注意的是,测试未对模型施加任何外部限制,并且明确鼓励模型使用代码执行、网络搜索以及所有可用工具。这意味着模型具备完全的自主权,但即使如此,整体表现仍不尽人意,表明当前 LLM 在整合多领域知识进行长链推理方面存在根本性短板。

Relay-Bench 的发布为 AI 研究社区提供了一个更贴近实际应用场景的评估工具。传统基准往往只针对单一技能,而现实中的问题往往需要跨领域协作。该基准的设计旨在捕捉这种综合性,推动模型在复杂任务中的泛化能力。研究者认为,Relay-Bench 可能成为未来 LLM 性能的重要标尺,并促使模型在组合推理、工具使用和上下文管理方面取得突破。相关论文已提交至 arXiv(编号:2607.18438),并计划在后续会议上展示。论文共21页,包含7张图表,详细介绍了基准构建方法、难度控制及样本分析。