AI News HubLIVE
站內改寫2 分鐘閱讀

用於識別皮膚免疫相關不良事件的人機協同大語言模型框架

本研究評估了一種檢索增強、多智能體、大語言模型驅動且包含人工審核的框架,用於從臨牀筆記中檢測皮膚免疫相關不良事件(cirAEs)。與人工審核相比,該框架將準確率(F1)從0.77提升至0.88,Cohen's kappa係數從0.50提高至0.82,並將平均審核時間縮短約一半。該框架展示了LLM在跨器官系統識別免疫相關毒性方面的應用潛力,並有望實現準確、可擴展且透明的不良事件數據提取。

來源arXiv Computational Linguistics作者: Charles Lu, Olivia Burke, Debby Cheng, Adam Kashlan, Caitlyn Duffy, Zeyun Lu, Lirit Fuksman, Jin Ning Tian, Andrew Sedlack, Priya Katyal, Eudora Lee, Ralina Karagenova, Chuck Lin, Kun-Hsing Yu, Nicole LeBoeuf, Alexander Gusev, Yevgeniy R. Semenov

2026年5月9日,一項發表於arXiv預印本平台的研究提出了一種創新的人機協同框架,旨在利用大語言模型(LLM)自動從臨牀筆記中識別皮膚免疫相關不良事件(cirAEs)。該框架突破了傳統人工審核的瓶頸,通過結合檢索增強(retrieval-augmented)技術、多智能體(multi-agent)系統以及人工審核環節(human-in-the-loop),實現了檢測準確性與效率的雙重提升。

研究團隊由Charles Lu等17位作者組成,他們將該框架應用於實際臨牀數據,並與未受輔助的人工審核進行了嚴格對比。評估指標顯示,基於LLM的輔助工作流在多個維度表現出色:F1分數從0.77顯著提升至0.88,表明模型在精確率和召回率之間取得了更優的平衡;Cohen's kappa係數從0.50躍升至0.82,反映出評估者之間的一致性和可靠性大幅增強。更為重要的是,平均審核時間縮短了近一半,從原先的數小時減少至約一半時長。這一改進意味着臨牀醫生和研究人員可以更快地識別不良事件,從而及時採取干預措施,改善患者預後。

該框架的設計亮點在於其多層架構。首先,檢索增強模塊從外部知識庫中提取相關醫學文獻和臨牀指南,為LLM提供上下文信息。其次,多智能體系統由多個專門化的LLM代理組成,每個代理負責不同任務(如實體識別、關係抽取、證據評估),通過協作完成複雜分析。最後,人工審核環節引入臨牀專家對LLM輸出進行驗證和修正,確保結果的準確性和可解釋性。這種設計不僅提高了檢測性能,還為模型的可信度提供了保障。

研究者強調,該方法不僅限於皮膚不良事件,其核心架構可推廣至其他器官系統的免疫相關毒性識別。例如,未來可應用於肝臟、肺臟等器官的免疫不良事件檢測,甚至擴展至非免疫類不良事件。這為大規模、自動化的不良事件數據提取提供了新路徑,具有重要的公共衞生意義。

儘管初步結果令人鼓舞,但論文也指出了當前研究的侷限性。例如,數據集可能規模有限,且來自單一醫療系統,因此需要更多樣化的數據驗證。此外,框架對計算資源的要求較高,未來需優化以提高可部署性。研究人員計劃在後續工作中探索更高效的推理策略,並開展多中心臨牀試驗以確認實用性。

總體而言,這項研究為LLM在醫療領域的應用提供了強有力的實證。它將人工智能與人類專業知識相結合,展示了在保持高準確率的同時大幅提升效率的可能性。隨着技術的成熟,此類框架有望融入電子健康記錄系統,成為臨牀決策支持的關鍵組件,助力醫生更高效、精準地管理免疫治療相關不良反應。