面向醫療大語言模型安全、魯棒性和公平性評估的多領域紅隊框架
本研究提出了一個多領域紅隊框架,用於評估醫療領域大語言模型在對抗性和倫理複雜場景下的表現。通過對11個當代模型在690個臨牀場景的測試,發現平均得分範圍0.791-0.984,但高性能模型在安全關鍵場景中會出現完全失敗,且公平性任務中人口統計修改導致10-20%的誤差放大。研究強調,性能方差和極端失敗比平均準確率更能反映臨牀可靠性,混合評估方法結合自動化與臨牀醫生監督對安全評估至關重要。
隨着大語言模型(LLM)在醫療領域的應用日益廣泛,傳統基準測試已難以捕捉模型在臨牀實踐中面臨的對抗性或倫理複雜場景下的真實表現。為此,John Snow Labs Inc.的研究團隊開發了一套多領域紅隊框架(Multi-Domain Red Teaming Framework),對11個當代大語言模型進行了系統性評估。該框架包含690個基於臨牀現實的測試場景,涵蓋9個領域和超過150個子類別,並引入了對抗性變換以模擬真實世界的挑戰。模型的響應採用七維度評分規則進行評估,結合了大語言模型輔助評分與人類專家在環驗證。
研究結果顯示,模型性能存在顯著差異,平均得分範圍從0.791到0.984。關鍵發現是,即便是得分最高的系統(如X-BAI、GPT-5、Claude Opus 4.1),在個別安全關鍵場景中也出現了完全失敗,這意味着總體平均準確率可能掩蓋具有臨牀意義的風險。性能在不同領域間波動較大,尤其是在公平性相關任務中,當輸入中的人口統計特徵(如種族、性別)被修改時,誤差率放大了10-20%。此外,人類評審員識別出了自動評估未能發現的臨牀相關失敗案例,凸顯了人工監督的重要性。
該研究於2026年4月15日提交至arXiv,並將於2026年3月29日在荷蘭代爾夫特舉辦的Text2Story 2026研討會上發表。研究團隊強調,性能方差和最壞情況下的失敗比平均準確率更能提供有臨牀意義的可靠性指標。他們認為,結合自動化評估與臨牀醫生監督的混合方法,對於可信的安全評估至關重要。這一框架為醫療領域大語言模型的安全部署提供了重要參考,提醒業界不能僅依賴平均性能指標,而需關注模型在極端情況下的表現。該研究的作者包括Andrei Marian Feier等9人,論文共10頁,包含4張圖表,即將發表在CEUR Workshop Proceedings上。