AI News HubLIVE
站內改寫1 分鐘閱讀

行動之前:面向前瞻性假設發現的LLM基準測試

大型語言模型(LLM)在回答預設問題方面表現優異,但其在開放式、結論前階段的探索能力尚未得到充分評估。本文提出前瞻性假設發現(PHD)任務,要求模型從不確定證據中自主構建有依據、可區分且可檢驗的假設空間。為評估該能力,研究者推出HypoArena基準,包含涵蓋六個科學分析領域的988個案例的HypoData資料集及HypoEval評估框架。實驗表明,15個前沿LLM在該任務上表現出明顯的能力分層,並揭示了結構化分析技能對模型效能的依賴效應。

來源arXiv Computational Linguistics作者: Tianyun Zhong, Wangyi Jiang, Wei Wang, Xuanang Chen, Yaojie Lu, Shiwei Ye, Yuzhen Shi, Boyu Yang, Jinghang Wang, Han Li, Weiqi Zhai, Bing Zhao, Hu Wei, Haiyang Yu, Yongbin Li, Hongyu Lin, Le Sun, Xianpei Han

大型語言模型(LLM)在回答預定義問題方面已經展現出卓越的能力,但它們在開放式的、結論尚未得出的發現階段中自主導航的能力,在很大程度上尚未被測量。為了填補這一空白,一個研究團隊引入了前瞻性假設發現(Prospective Hypothesis Discovery,簡稱PHD)任務,該任務要求模型從不確定的證據(包括異常觀察和碎片化記錄)中自主構建有根據、有區分度且可檢驗的假設空間,以指導後續的研究。

為了系統地評估這一能力,研究者推出了HypoArena基準測試套件,它由兩個核心元件構成:HypoData(一個包含988個案例的基準資料集,涵蓋六個科學和分析領域)和HypoEval(一個用於評估開放式假設集的框架)。為了大規模構建HypoData,團隊提出了一種稱為“回顧性上下文迴歸”的方法,這是一個“鍛造-審計”流水線,透過從已完成的專家文件中移除明確的結論、目標假設和回顧性因果歸因,同時保留事實基礎,來重建結論前的上下文。

由於PHD任務允許多個有效輸出,HypoEval結合了雙向成對判斷與Bradley-Terry-Davidson聚合進行排名,以及六維評分表進行診斷。在15個前沿LLM上進行的實驗揭示了清晰的能力分層,以及結構化分析技能對模型依賴的影響。一些效能較低的模型在HypoArena上取得了進步,但其他系統(包括一個頂級模型)出現了退化。與絕對評分表相比,競技場評估能解析出模型間更細微的差異,且聚合排名與人類專家及獨立評判者高度一致。

這些結果共同支援將PHD作為評估LLM在最終結論被隱藏時如何制定研究方向的獨特目標。研究團隊已公開其程式碼和資料,分別位於github.com/SKYLENAGE-AI/HypoArena和github.com/SKYLENAGE-AI/HypoArena。