AI News HubLIVE
站內改寫2 分鐘閱讀

DeepLens診斷代理:智慧體工作流設計讓小型推理模型與前沿LLM競爭

DeepLens診斷代理透過五階段流程(結構化臨床提取、循證檢索、約束候選生成、證據三角驗證和可審計決策),將小型醫療推理模型JSL Medical Small 7B v2的效能提升至60.14%的診斷準確率,超越許多前沿模型,同時成本更低。該工作流設計使診斷推理在不確定性下仍能可靠執行,並提供了可追溯的中間結果以支援高 stakes 應用場景。

來源arXiv AI作者: Mahmood Bayeshi, Veysel Kocaman, Muhammed Ali Naqvi, Yigit Gul, David Talby

由John Snow Labs團隊提出的DeepLens診斷代理是一種創新的智慧體系統,它透過精心設計的五階段工作流,將小型醫療推理模型JSL Medical Small 7B v2的診斷準確率從23.99%大幅提升至60.14%,在915個病例的DiagnosisArena基準測試中超越了包括Claude Sonnet 4.5和Gemini 3.1 Pro在內的多個前沿大語言模型,同時成本降低35-45%。這一成果表明,在醫療診斷這種高 stakes 領域,結構化的流程約束往往比單純的模型引數擴充套件和API成本投入更為關鍵。

該工作流由五個嚴格定義的階段組成:第一階段是結構化臨床提取,系統性地從病例描述中提取相關症狀、體徵、病史等關鍵臨床資訊;第二階段是循證檢索,利用檢索增強生成技術從權威醫學文獻中獲取相關證據;第三階段是約束候選生成,基於前兩步的結果生成可能的診斷候選列表;第四階段是證據三角驗證,透過交叉比對多種來源的證據來驗證每個候選診斷的可靠性;第五階段是可審計決策,生成包含推理過程和證據引用的最終診斷建議。每個階段都會產生結構化的中間輸出,便於後續的審計和錯誤定位。

實驗結果顯示,該代理在標準醫療基準上的表現達到了88.2%,但若沒有工作流設計,其診斷準確率僅為23.99%,這36個百分點的提升完全歸功於流程本身而非模型知識的補充。這一發現挑戰了“更大模型必然更好”的傳統認知,揭示了在需要處理不確定性、多步驟推理的複雜任務中,精心設計的智慧體工作流可以成為比模型規模更重要的效能槓桿。

從經濟性角度看,DeepLens診斷代理每例診斷的推理成本僅為0.0072美元(在A100 GPU上消耗約24K token),延遲24秒,遠低於Claude Sonnet 4.5的0.0110美元和Gemini 3.1 Pro的0.0128美元,同時在準確率上分別高出9.70和9.17個百分點。這種成本效益比使其特別適用於資源受限的醫療環境,或需要大規模部署診斷輔助系統的場景。

更重要的是,該工作流生成的中間產物使得整個診斷過程透明可追溯。醫生可以檢查每個階段的輸出,理解模型為何選擇某個診斷,並在必要時進行干預。這種可解釋性對於醫療等高風險領域至關重要,因為它不僅提高了信任度,還便於在出現錯誤時快速定位問題環節。DeepLens診斷代理的實踐表明,透過將強大的基礎模型與精心設計的流程約束相結合,即使使用小型模型也能在專業領域達到與大型模型相當甚至更優的效能,同時保持更低的成本和更高的可解釋性。