Collider-Bench:用粒子物理分析復現來基準測試AI智能體
Collider-Bench是一個新基準,用於評估大型語言模型(LLM)智能體能否僅憑公開論文和開源軟件復現大型強子對撞機(LHC)的實驗分析。智能體需構建模擬與選擇流水線,並預測指定信號區間的碰撞事件產額。評估採用直方圖指標和LLM裁判檢測失敗模式。初步結果顯示,尚無智能體能可靠擊敗人類物理學家。
近日,一篇提交至arXiv的論文提出了Collider-Bench——一個用於評估AI智能體復現大型強子對撞機(LHC)實驗分析能力的全新基準。該研究由Darius A. Faroughy等五位作者共同完成,旨在檢驗大型語言模型(LLM)智能體能否僅依賴公開論文和開源科學軟件,自主復現高能物理實驗的關鍵步驟。
在粒子物理領域,實驗協作組內部使用的軟件與公開工具鏈存在差異,且已發表論文常常省略實現細節,這導致分析復現極具挑戰。Collider-Bench要求智能體將已發表的分析方法轉化為可執行的模擬與選擇流水線,並提交指定信號區間的預測碰撞事件產額。評估採用標準直方圖指標,提供連續的保真度評分,無需手工編制的評分標準。此外,研究者還報告了每個智能體完成任務的計算機開銷,並使用LLM裁判分析代碼庫和完整會話記錄,以捕捉編造、幻覺和重複等定性失敗模式。這種雙管齊下的評估方式不僅量化了準確度,還揭示了智能體在推理過程中的常見陷阱。
該基準附帶一組從LHC搜索中提取的初始任務,以及容器化沙箱和事件模擬工具,使得任何開發者都可以復現評估。研究者在通用編碼智能體的能力階梯上進行了評估,範圍從簡單的代碼補全到複雜的多步驟推理。結果令人深思:平均而言,沒有任何智能體能可靠地超越“物理學家參與循環”的解決方案。即使是最先進的智能體,也在某些任務上出現了嚴重的幻覺或錯誤,尤其是在需要精確物理常數或特定探測器幾何的環節。這表明,儘管LLM在自然語言處理上表現優異,但在處理需要嚴格領域知識和細緻實驗細節的科學復現任務時,仍有很長的路要走。該工作為未來AI在科學研究中的應用設立了嚴謹的測試標準,也為改進智能體的工具使用和知識整合能力指明瞭方向。