行動之前:面向前瞻性假設發現的LLM基準測試
大型語言模型(LLM)在回答預設問題方面表現優異,但其在開放式、結論前階段的探索能力尚未得到充分評估。本文提出前瞻性假設發現(PHD)任務,要求模型從不確定證據中自主構建有依據、可區分且可檢驗的假設空間。為評估該能力,研究者推出HypoArena基準,包含涵蓋六個科學分析領域的988個案例的HypoData數據集及HypoEval評估框架。實驗表明,15個前沿LLM在該任務上表現出明顯的能力分層,並揭示了結構化分析技能對模型性能的依賴效應。
大型語言模型(LLM)在回答預定義問題方面已經展現出卓越的能力,但它們在開放式的、結論尚未得出的發現階段中自主導航的能力,在很大程度上尚未被測量。為了填補這一空白,一個研究團隊引入了前瞻性假設發現(Prospective Hypothesis Discovery,簡稱PHD)任務,該任務要求模型從不確定的證據(包括異常觀察和碎片化記錄)中自主構建有根據、有區分度且可檢驗的假設空間,以指導後續的研究。
為了系統地評估這一能力,研究者推出了HypoArena基準測試套件,它由兩個核心組件構成:HypoData(一個包含988個案例的基準數據集,涵蓋六個科學和分析領域)和HypoEval(一個用於評估開放式假設集的框架)。為了大規模構建HypoData,團隊提出了一種稱為“回顧性上下文迴歸”的方法,這是一個“鍛造-審計”流水線,通過從已完成的專家文檔中移除明確的結論、目標假設和回顧性因果歸因,同時保留事實基礎,來重建結論前的上下文。
由於PHD任務允許多個有效輸出,HypoEval結合了雙向成對判斷與Bradley-Terry-Davidson聚合進行排名,以及六維評分表進行診斷。在15個前沿LLM上進行的實驗揭示了清晰的能力分層,以及結構化分析技能對模型依賴的影響。一些性能較低的模型在HypoArena上取得了進步,但其他系統(包括一個頂級模型)出現了退化。與絕對評分表相比,競技場評估能解析出模型間更細微的差異,且聚合排名與人類專家及獨立評判者高度一致。
這些結果共同支持將PHD作為評估LLM在最終結論被隱藏時如何制定研究方向的獨特目標。研究團隊已公開其代碼和數據,分別位於github.com/SKYLENAGE-AI/HypoArena和github.com/SKYLENAGE-AI/HypoArena。