AI News HubLIVE
站內改寫2 分鐘閱讀

用於識別皮膚免疫相關不良事件的人機協同大語言模型框架

本研究評估了一種檢索增強、多智慧體、大語言模型驅動且包含人工稽核的框架,用於從臨床筆記中檢測皮膚免疫相關不良事件(cirAEs)。與人工稽核相比,該框架將準確率(F1)從0.77提升至0.88,Cohen's kappa係數從0.50提高至0.82,並將平均稽核時間縮短約一半。該框架展示了LLM在跨器官系統識別免疫相關毒性方面的應用潛力,並有望實現準確、可擴充套件且透明的不良事件資料提取。

來源arXiv Computational Linguistics作者: Charles Lu, Olivia Burke, Debby Cheng, Adam Kashlan, Caitlyn Duffy, Zeyun Lu, Lirit Fuksman, Jin Ning Tian, Andrew Sedlack, Priya Katyal, Eudora Lee, Ralina Karagenova, Chuck Lin, Kun-Hsing Yu, Nicole LeBoeuf, Alexander Gusev, Yevgeniy R. Semenov

2026年5月9日,一項發表於arXiv預印本平臺的研究提出了一種創新的人機協同框架,旨在利用大語言模型(LLM)自動從臨床筆記中識別皮膚免疫相關不良事件(cirAEs)。該框架突破了傳統人工稽核的瓶頸,透過結合檢索增強(retrieval-augmented)技術、多智慧體(multi-agent)系統以及人工稽核環節(human-in-the-loop),實現了檢測準確性與效率的雙重提升。

研究團隊由Charles Lu等17位作者組成,他們將該框架應用於實際臨床資料,並與未受輔助的人工稽核進行了嚴格對比。評估指標顯示,基於LLM的輔助工作流在多個維度表現出色:F1分數從0.77顯著提升至0.88,表明模型在精確率和召回率之間取得了更優的平衡;Cohen's kappa係數從0.50躍升至0.82,反映出評估者之間的一致性和可靠性大幅增強。更為重要的是,平均稽核時間縮短了近一半,從原先的數小時減少至約一半時長。這一改進意味著臨床醫生和研究人員可以更快地識別不良事件,從而及時採取干預措施,改善患者預後。

該框架的設計亮點在於其多層架構。首先,檢索增強模組從外部知識庫中提取相關醫學文獻和臨床指南,為LLM提供上下文資訊。其次,多智慧體系統由多個專門化的LLM代理組成,每個代理負責不同任務(如實體識別、關係抽取、證據評估),透過協作完成複雜分析。最後,人工稽核環節引入臨床專家對LLM輸出進行驗證和修正,確保結果的準確性和可解釋性。這種設計不僅提高了檢測效能,還為模型的可信度提供了保障。

研究者強調,該方法不僅限於皮膚不良事件,其核心架構可推廣至其他器官系統的免疫相關毒性識別。例如,未來可應用於肝臟、肺臟等器官的免疫不良事件檢測,甚至擴充套件至非免疫類不良事件。這為大規模、自動化的不良事件資料提取提供了新路徑,具有重要的公共衛生意義。

儘管初步結果令人鼓舞,但論文也指出了當前研究的侷限性。例如,資料集可能規模有限,且來自單一醫療系統,因此需要更多樣化的資料驗證。此外,框架對計算資源的要求較高,未來需最佳化以提高可部署性。研究人員計劃在後續工作中探索更高效的推理策略,並開展多中心臨床試驗以確認實用性。

總體而言,這項研究為LLM在醫療領域的應用提供了強有力的實證。它將人工智慧與人類專業知識相結合,展示了在保持高準確率的同時大幅提升效率的可能性。隨著技術的成熟,此類框架有望融入電子健康記錄系統,成為臨床決策支援的關鍵元件,助力醫生更高效、精準地管理免疫治療相關不良反應。