AI News HubLIVE
站内改写1 分钟阅读

HealthCraft:面向急诊医学的强化学习安全环境

HealthCraft 是首个基于 FHIR R4 构建的急诊医学强化学习环境,通过双层级评分系统评估语言模型在复杂临床工作流中的安全性。测试显示,前沿模型在多步工作流中几乎完全失败,且基础设施缺陷会影响模型排名。该环境及任务集已开源。

来源arXiv Machine Learning作者: Brandon Dent

随着前沿语言模型被快速部署到临床工作流中,评估其安全性的基础设施却未能跟上步伐。静态医疗问答基准无法捕捉急诊医学中真正关键的失败模式——轨迹级安全崩溃、工具误用,以及在持续临床压力下的妥协。为此,研究人员提出了 HealthCraft,这是首个在真实急诊条件下奖励轨迹级安全的公开强化学习环境,改编自 Corecraft。

HealthCraft 基于 FHIR R4 世界状态构建,包含 14 种实体类型和 3987 个种子实体,并提供 24 个 MCP 工具。其核心是一个双层级评分系统:当任何安全关键标准被违反时,奖励将直接归零。研究团队发布了 195 个任务,涵盖六个类别,共 2255 个二元评判标准,其中 515 个为安全关键。后续又增加了 10 个负类任务,使总数达到 205 个任务和 2337 个标准。

对两个前沿模型——Claude Opus 4.6 和 GPT-5.4——的 V8 版本测试显示,在单步任务中,Claude 的首次通过率为 24.8%(置信区间 21.5-28.4),GPT 为 12.6%(10.2-15.6);安全失败率分别为 27.5% 和 34.0%。然而,在多步工作流(最接近真实急诊护理的测试)中,两者性能几乎归零:Claude 仅 1.0%,GPT 为 0.0%,尽管它们在单个步骤上表现出部分能力。

值得注意的是,在 V2 到 V8 的测试过程中,修复的六个基础设施错误改变了模型之间的相对排名,这证明基础设施的保真度本身也是测量的一部分。为控制评估噪声,研究引入了确定性 LLM 评审覆盖层。一项 60 次运行的负类烟雾测试表明,奖励信号不能直接用于训练:约束标准的通过率为 0.929,这种可游戏性在评估框架中可被容忍,但作为训练奖励则会带来风险。

研究团队按照 Corecraft 第 5.2 节搭建了与 Megatron+SGLang+GRPO 循环的耦合,并将训练奖励消融实验留作未来工作。HealthCraft 的环境、任务、评分规则及评估框架均以 Apache 2.0 许可证开源发布。