AI News HubLIVE
站內改寫1 分鐘閱讀

開放式問答中推理的無參考評估

提出一種基於推理的無參考框架,通過NLI和超圖結構審計LLM推理軌跡,在數學和醫療推理中比直接使用LLM評判更可靠。

來源arXiv Computational Linguistics作者: Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull, Gregory E Dean, Maria Liakata

在人工智能生成內容日益普及的今天,特別是在醫療、法律等高 stakes 領域,如何驗證AI回答的推理過程是否可靠成為一個關鍵挑戰。傳統方法往往依賴於參考答案或使用大型語言模型(LLM)本身作為評判者,但這兩種方式都存在侷限性:參考標準可能不存在,而LLM評判者容易接受流暢但實際依據不足的回覆。

近日,來自Guneet Singh Kohli等研究人員的論文提出了一種全新的無參考評估框架,專門用於審計LLM生成的多步推理過程。該方法首先將推理軌跡分解為多個片段,然後利用自然語言推理(NLI)技術標記每個片段與結論之間的前提-目標關係,並將這些關係組織成超圖結構。最後,通過確定性的後向AND-OR搜索,為每個片段分配審計標籤,指明其在整體推理中的基礎依據。

研究者在兩個場景中評估了該框架:數學演繹推理(使用Hard2Verify數據集)和開放式醫療推理。針對醫療場景,他們構建了一個新的基準數據集UroReason,包含由醫生標註的真實臨牀病例中LLM的推理軌跡。實驗結果顯示,基於NLI的超圖審計方法比直接使用LLM作為評判者提供了更可靠的參考評估信號。特別值得一提的是,在醫療案例中,當前最先進的LLM評判者經常無法識別有問題的推理片段,過度接受那些流暢但推理薄弱的回答。這一發現揭示了僅依賴最終答案或單一LLM驗證者的固有缺陷,表明評估應當考慮整個推理軌跡中推斷關係的組合方式。

該框架的代碼將開源發佈,UroReason數據集也將通過API提供。該研究為構建更可信的AI系統提供了新的視角和工具,對模型選型、推理成本優化以及產品能力評估等方面都可能產生深遠影響。