AI News HubLIVE
站內改寫1 分鐘閱讀

Relay-Bench:評估大語言模型在多領域推理鏈上的表現

Relay-Bench 是一個全新的未飽和基準測試,旨在評估大語言模型在單個提示中完成多個不同領域任務的能力。當前領先模型 GPT-5.5 (xHigh) 得分僅為 43.3%,表明模型在多領域複合推理方面仍有巨大提升空間。

來源arXiv Computational Linguistics作者: Liam Swayne

近日,一項名為 Relay-Bench 的新型基準測試正式發佈,該測試專門用於評估大語言模型(LLM)在複雜多領域推理鏈上的表現。與以往僅測試單一能力的基準不同,Relay-Bench 要求模型在單個提示中依次完成來自不同領域的多個子問題,從而模擬真實世界中需要綜合運用多種技能的複合任務。

Relay-Bench 的測試集完全由複合問題組成,每個問題包含2到13個單領域子問題。這些子問題涵蓋了視覺推理(以文本形式描述)、編程、數學、信息提取(重點為網絡搜索)、問題解決、常識知識和數據分析共8個領域。為了增加難度,許多問題還通過提示編碼(prompt encoding)和故意添加冗餘上下文(context bloat)來增加複雜度,使得模型必須在混亂的信息中準確提取關鍵要素。

在最新評估中,表現最好的模型是 OpenAI 的 GPT-5.5 (xHigh),但其得分僅為 43.3%,遠未達到飽和水平。值得注意的是,測試未對模型施加任何外部限制,並且明確鼓勵模型使用代碼執行、網絡搜索以及所有可用工具。這意味着模型具備完全的自主權,但即使如此,整體表現仍不盡人意,表明當前 LLM 在整合多領域知識進行長鏈推理方面存在根本性短板。

Relay-Bench 的發佈為 AI 研究社區提供了一個更貼近實際應用場景的評估工具。傳統基準往往只針對單一技能,而現實中的問題往往需要跨領域協作。該基準的設計旨在捕捉這種綜合性,推動模型在複雜任務中的泛化能力。研究者認為,Relay-Bench 可能成為未來 LLM 性能的重要標尺,並促使模型在組合推理、工具使用和上下文管理方面取得突破。相關論文已提交至 arXiv(編號:2607.18438),並計劃在後續會議上展示。論文共21頁,包含7張圖表,詳細介紹了基準構建方法、難度控制及樣本分析。