AI News HubLIVE
站內改寫1 分鐘閱讀

Collider-Bench:用粒子物理分析復現來基準測試AI智慧體

Collider-Bench是一個新基準,用於評估大型語言模型(LLM)智慧體能否僅憑公開論文和開源軟體復現大型強子對撞機(LHC)的實驗分析。智慧體需構建模擬與選擇流水線,並預測指定訊號區間的碰撞事件產額。評估採用直方圖指標和LLM裁判檢測失敗模式。初步結果顯示,尚無智慧體能可靠擊敗人類物理學家。

來源arXiv Machine Learning作者: Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih

近日,一篇提交至arXiv的論文提出了Collider-Bench——一個用於評估AI智慧體復現大型強子對撞機(LHC)實驗分析能力的全新基準。該研究由Darius A. Faroughy等五位作者共同完成,旨在檢驗大型語言模型(LLM)智慧體能否僅依賴公開論文和開源科學軟體,自主復現高能物理實驗的關鍵步驟。

在粒子物理領域,實驗協作組內部使用的軟體與公開工具鏈存在差異,且已發表論文常常省略實現細節,這導致分析復現極具挑戰。Collider-Bench要求智慧體將已發表的分析方法轉化為可執行的模擬與選擇流水線,並提交指定訊號區間的預測碰撞事件產額。評估採用標準直方圖指標,提供連續的保真度評分,無需手工編制的評分標準。此外,研究者還報告了每個智慧體完成任務的計算機開銷,並使用LLM裁判分析程式碼庫和完整會話記錄,以捕捉編造、幻覺和重複等定性失敗模式。這種雙管齊下的評估方式不僅量化了準確度,還揭示了智慧體在推理過程中的常見陷阱。

該基準附帶一組從LHC搜尋中提取的初始任務,以及容器化沙箱和事件模擬工具,使得任何開發者都可以復現評估。研究者在通用編碼智慧體的能力階梯上進行了評估,範圍從簡單的程式碼補全到複雜的多步驟推理。結果令人深思:平均而言,沒有任何智慧體能可靠地超越“物理學家參與迴圈”的解決方案。即使是最先進的智慧體,也在某些任務上出現了嚴重的幻覺或錯誤,尤其是在需要精確物理常數或特定探測器幾何的環節。這表明,儘管LLM在自然語言處理上表現優異,但在處理需要嚴格領域知識和細緻實驗細節的科學復現任務時,仍有很長的路要走。該工作為未來AI在科學研究中的應用設立了嚴謹的測試標準,也為改進智慧體的工具使用和知識整合能力指明瞭方向。