HealthCraft:面向急診醫學的強化學習安全環境
HealthCraft 是首個基於 FHIR R4 構建的急診醫學強化學習環境,透過雙層級評分系統評估語言模型在複雜臨床工作流中的安全性。測試顯示,前沿模型在多步工作流中幾乎完全失敗,且基礎設施缺陷會影響模型排名。該環境及任務集已開源。
隨著前沿語言模型被快速部署到臨床工作流中,評估其安全性的基礎設施卻未能跟上步伐。靜態醫療問答基準無法捕捉急診醫學中真正關鍵的失敗模式——軌跡級安全崩潰、工具誤用,以及在持續臨床壓力下的妥協。為此,研究人員提出了 HealthCraft,這是首個在真實急診條件下獎勵軌跡級安全的公開強化學習環境,改編自 Corecraft。
HealthCraft 基於 FHIR R4 世界狀態構建,包含 14 種實體型別和 3987 個種子實體,並提供 24 個 MCP 工具。其核心是一個雙層級評分系統:當任何安全關鍵標準被違反時,獎勵將直接歸零。研究團隊釋出了 195 個任務,涵蓋六個類別,共 2255 個二元評判標準,其中 515 個為安全關鍵。後續又增加了 10 個負類任務,使總數達到 205 個任務和 2337 個標準。
對兩個前沿模型——Claude Opus 4.6 和 GPT-5.4——的 V8 版本測試顯示,在單步任務中,Claude 的首次透過率為 24.8%(置信區間 21.5-28.4),GPT 為 12.6%(10.2-15.6);安全失敗率分別為 27.5% 和 34.0%。然而,在多步工作流(最接近真實急診護理的測試)中,兩者效能幾乎歸零:Claude 僅 1.0%,GPT 為 0.0%,儘管它們在單個步驟上表現出部分能力。
值得注意的是,在 V2 到 V8 的測試過程中,修復的六個基礎設施錯誤改變了模型之間的相對排名,這證明基礎設施的保真度本身也是測量的一部分。為控制評估噪聲,研究引入了確定性 LLM 評審覆蓋層。一項 60 次執行的負類煙霧測試表明,獎勵訊號不能直接用於訓練:約束標準的透過率為 0.929,這種可遊戲性在評估框架中可被容忍,但作為訓練獎勵則會帶來風險。
研究團隊按照 Corecraft 第 5.2 節搭建了與 Megatron+SGLang+GRPO 迴圈的耦合,並將訓練獎勵消融實驗留作未來工作。HealthCraft 的環境、任務、評分規則及評估框架均以 Apache 2.0 許可證開源釋出。