当医生与AI合作时,谁来负责?
人工智能正在快速融入医疗领域,但随之而来的是患者安全风险和责任归属问题。传统医疗责任划分清晰,而黑箱AI工具使责任难以界定。本文提出了基于自主性、自动化程度和操作范围的医疗AI七级分类框架,以帮助监管、法律和医疗体系应对这一挑战。
人工智能正迅速成为医院和诊所的一部分。然而,AI工具在带来好处的同时,也带来了新的患者安全风险——以及当出现问题时谁应该负责的问题。
传统上,医疗保健中的责任划分明确。临床医生必须提供规定的治疗标准。医疗机构必须组织安全的治疗流程。制造商必须提供无缺陷的医疗设备。监管机构和许可认证机构可以在任何一方未达到预期标准时进行干预。如果患者受到伤害,法院可以判定哪一方承担责任。
即将到来的一波医疗AI工具将模糊这些界限。当前的AI工具主要作为辅助手段使用,由人工检查作为后盾,与其他医疗设备类似。例如,当AI模型触发患者有败血症风险的警报时,临床医生必须在任何治疗前审查并确认生理学原理。
但在未来几年,AI驱动的临床工具预计将从综合数据发展到根据数据采取行动,且人类输入越来越少。它们将做出诊断、制定治疗计划以及做出患者管理决策,而临床医生几乎不参与或完全不参与。而许多现有工具的输出是可以理解的——例如,败血症模型通过根据透明公式组合定义的生理变量来工作——更先进的工具可能涉及黑箱深度学习过程。临床医生将无法完全理解工具的推理过程,即使算法对其判断提供了一些解释。
这些工具介于责任规则之间。它们的黑箱推理使得难以确定何时存在缺陷。当人类与不透明的AI模型共同做出决策时,评估人们在接受医疗保健时受到伤害的责任变得困难。现有的医疗责任框架没有解决这个交叉点。
这种法律不确定性意味着受伤害的人可能陷入责任空白,其中没有人明确违反规则。医院可能因为担心法律风险而避免使用AI进行潜在有用的功能——这种担忧被医生反复引述为安全采用AI的障碍,并且被一些人视为不使用已经可用的黑箱工具的理由。AI供应商可能逃避在工具上市后监测安全的义务,因为他们确信当出现问题时很难归咎责任。
需要明确的责任框架。这里我们概述如何实现这一点,通过基于三个因素定义AI能力的七个级别:自主性、自动化程度和操作范围。在飞机和自动驾驶汽车方面,监管机构已经使用分级级别来明确指定系统必须执行哪些任务、多大程度上独立执行,以及何时人类应该接管。一套类似的医疗AI系统级别将帮助监管机构、政策制定者、政府、法院和专业医疗保健机构为即将到来的工具做好准备。
三个特性,七个级别:三个特性决定了AI在诊所中的使用方式。第一,自主性:系统独立推理的程度,无需人工输入。现有的败血症风险模型是低自主性AI工具。相比之下,深度学习系统可能从数千个变量的模式中得出诊断,做出医生无法追溯的推论。第二,自动化:医疗AI系统可以自行执行哪些任务。这样的系统可能从外科医生控制的低自动化机器人,到直接将化疗处方发送到药房的系统。第三,操作范围:允许系统运行的范围。由专科眼科服务部署的双重检查临床决策的视网膜成像系统,与在初级保健诊所用于自主决定是否将患者转诊给专家的同一工具相比,风险较低。
以下七个级别可以构成定义医疗AI工具风险的基础。给定的工具可能根据其使用地点、方式和使用者而处于不同级别。
0级:信息提供。没有自主性、自动化程度可变、操作范围狭窄的AI系统。此类系统根据人类设定的规则存储、移动和显示数据。示例包括管理电子健康记录的算法或从跟踪生命体征的可穿戴设备流式传输数据。算法行为透明,任何输出都可独立验证。这是熟悉的领域。监管机构可以评估此类工具是否可靠,是否提供足够的网络安全和数据保护。法院可以应用常规标准来评估责任。
1级:辅助。低自主性、低到中等自动化、操作范围狭窄的AI系统。此类系统可以执行单个明确定义的任务,由临床医生监督——例如在心脏监护仪上标记可疑节律,或在扫描中突出可能的肺结节。工具的算法推理可能不透明,但可以通过对患者数据的临床审查或通过“可解释性技术”来验证输出,这些技术检查模型输入和输出数据之间的相关性。这些工具作为诊断辅助工具受到监管,类似于现有的乳腺摄影和结肠镜检查计算机辅助检测系统。医院负责确保员工了解其局限性。用户应准确判断警报是否有意义。
2级:决策支持。低自主性、低到中等自动化、操作范围适中的AI工具。这些系统组合多个数据流——可能包括症状、既往病史、影像数据和当前指南。当前此级别的工具可以生成诊断和治疗计划,起草详细的出院摘要,并为分诊决策生成风险评分。与1级工具一样,它们旨在提供建议——其推理可能不透明,但在某种程度上可验证,临床医生应做出最终决定。监管机构应要求这些系统改善护理的有力证据。医院必须培训临床医生质疑输出而不是默认接受,法院必须确定临床医生在特定情况下依赖特定建议是否合理。存在时间压力下的临床医生可能过度依赖建议工具的风险。无法轻易确定临床医生在多大程度上受到机器建议的影响。
3级:监督自动化。中等自主性和自动化水平、操作范围适中的AI系统。系统而不是临床医生是决策者。此类工具目前很少见。在严格定义的领域中,它们可以动态响应治疗需求——例如,胰岛素输送设备根据连续血糖读数自动调整剂量,使用嵌入式算法和预定义限制。临床医生选择哪些患者置于系统上,仅在出现异常时干预。监管机构应关注使用和维护这些系统的说明质量以及提供护理固有的风险信息。医疗机构应针对AI驱动治疗固有的新型风险提供知情同意协议的指导,提供者应与患者讨论这些风险。对于这些系统,医生可能因纳入不适合的患者、未能响应设备警报或不了解系统局限性而受到批评。组织可能因其选择、验证和监控技术的方式而受到评判。如果设计或更新有缺陷导致伤害,制造商可能承担责任。但如果医生和组织行为合理,而伤害是由算法决定的并非明显错误决策引起的,则常规责任评估可能不合适。
4级:AI触发的人类监督。中等到高自主性和自动化水平、操作范围广泛的AI系统。这些系统管理整个疗程,例如在重症监护领域。它们持续监测患者并调整治疗——例如同时平衡呼吸机和镇静剂设置与多个生理目标。它们在出现异常时触发备份协议,例如召唤快速反应团队。临床医生是安全网,仅在系统报警时采取行动。4级部署在医学中尚未突破,尽管所需的技术组件正在出现。对于这些系统,监管机构应要求强有力的证据表明将人类纳入循环会降低安全性。由于临床医生没有现实机会审查这些系统的行动,法院可能难以确定不良结果是反映疏忽、隐藏缺陷还是仅仅医学固有风险。
生成式AI可能彻底改变医疗保健——但如果控制权交给大型科技公司则不会。