AI News HubLIVE
站內改寫2 分鐘閱讀

GuideSkill:將臨牀指南編譯為可執行技能,推動LLM臨牀推理

GuideSkill是一種外部推理層,將臨牀實踐指南中的診斷標準編譯為可執行函數,返回序數診斷支持得分。GuideSkill-Zero從指南初始化,GuideSkill-Evo利用病例-診斷對進一步優化。在四項基準和四個骨幹模型上,GuideSkill-Evo均取得最高宏平均準確率,較直接推理相對提升18.49%,並將金標準技能覆蓋率從56.5%提升至99.5%,且無需更新骨幹參數。

來源arXiv AI作者: Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

臨牀實踐指南(CPGs)是循證醫學的重要基石,其中編碼了針對各類疾病的診斷標準,幫助醫生做出準確判斷。大型語言模型(LLM)在臨牀推理上顯示出巨大潛力,然而現有的LLM系統往往只是將指南當作文本檢索,或在訓練時將其吸收進模型參數,很少真正執行指南中藴含的規則。這種間接的利用方式可能讓模型在複雜病例中難以嚴格遵循指南的診斷邏輯。

GuideSkill正是為解決這一問題而提出。它來自Lang Cao等人於2026年7月28日提交至arXiv的論文(編號2607.26160)。該方法構建了一個外部推理層,將疾病特定的診斷標準編譯為可執行函數,並返回序數的診斷支持得分。也就是説,給定一個病例,函數會產生一個反映其符合診斷程度的排序分數,讓LLM得以“運行”指南邏輯,而非僅憑記憶作答。

具體來説,GuideSkill包含兩個版本。GuideSkill-Zero直接從臨牀指南文本初始化技能模塊,把規則轉化為程序化的可執行功能;GuideSkill-Evo則在此基礎之上,利用成對的病例–診斷數據對已有技能進行優化,並補充指南中缺失的診斷,從而形成更完整的技能庫。在推理階段,LLM首先生成一個鑑別診斷列表;然後系統針對每個候選項,從病例中抽取該技能所需的關鍵特徵;最後將LLM自身的排序與執行技能得到的分數相融合,生成最終的診斷建議。這一設計保持了模型參數知識不變,同時通過外部結構施加了顯式的規則約束。

實驗證據相當有力。研究者在四個基準測試和四個骨幹LLM上進行了系統評估。結果顯示,相較於基於指南的RAG方法,GuideSkill-Zero平均將宏平均準確率提升了13.45%。GuideSkill-Evo則在所有骨幹模型上都取得了最高的宏平均準確率;相比直接推理,相對提升了18.49%,並將金標準技能覆蓋率從56.5%提升到99.5%。尤其是在Qwen3.5-9B上,GuideSkill-Evo在不更新任何骨幹參數的情況下,超過了最強的參數更新基線11.16%。這個結果表明,可執行技能可以在很大程度上替代基於微調的性能提升,並且與具體模型無關。

論文還報告了專家評估的結果。臨牀醫生認為GuideSkill生成的技能在臨牀上是合理且被廣泛接受的,這意味着初始化的規則和進化後的規則都具有實際的可靠性。作者據此認為,可執行技能是一種通用的機制,能夠將指南推導出的診療流程與真實病例所反映的診斷模式結合起來。

GuideSkill的應用前景值得關注。由於技能層是外部且模塊化的,指南一旦更新,系統可以隨時更換技能,而無需重新訓練底層模型。同時,它提供了透明的審計路徑:研究者或醫生可以直接檢查所執行的函數,而不是面對不可解釋的神經網絡輸出。在強調責任與可追溯性的醫療場景中,這種透明性尤為重要。

未來的研究方向可能是將GuideSkill拓展到臨牀指南之外的其他結構化知識源,或者與醫學影像等多模態輸入結合。就目前而言,這篇論文提供了一個令人信服的概念驗證:可執行技能能夠在陳述性醫學知識與穩健的LLM推理之間架起橋樑,為人工智能輔助臨牀決策開闢了新的思路。