英伟达押注物理AI解决医疗机器人数据难题
英伟达推出开源医疗物理模拟框架,将医疗机器人视为物理AI系统,通过模拟生成大量训练数据,加速手术和诊断机器人的开发。
英伟达(Nvidia)近日发布了新的医疗物理模拟框架(Medical Physics Simulation),该框架将医疗机器人视为物理人工智能系统,强调它们需要通过与物理世界的互动来学习,而不仅仅是依靠代码。
物理AI是英伟达和许多机器人公司用来描述那些必须通过接触、力和结果来理解世界行为的机器,而不是仅通过文本或图像。语言模型从文本中学习,而物理AI系统则从导管接触血管壁或机械臂对软组织施加过大压力等实际情况中学习。这种学习通常需要实体在真实世界中操作,或者需要足够详细的模拟环境。
对于医疗机器人来说,在真实手术中获取经验既稀缺又受到严格监管,而且难以快速生成机器人所需的多样化场景。英伟达的医疗物理模拟框架旨在通过计算生成这种具身经验。该框架作为开源工具添加到公司的Isaac for Healthcare平台中,能够生成手术或诊断机器人通常需要多年临床经验才能遇到的物理交互场景,例如导丝卡在钙化血管壁、肾结石以异常角度嵌顿,或仅在少数手术中出现的软组织反应。
这些边缘情况不会在手术室中准时出现,而模拟可以让开发人员按需生成它们。该框架结合了两种建模方式:经典物理模拟处理已明确的机械规则,如导管的弯曲、血管壁的阻力以及器械移动时接触力的变化;生成式AI则处理难以手动编码的部分,通过名为Cosmos-H Dreams的组件从手术数据中学习视觉场景动态。
这种结合体现了物理AI的理念:经典模拟提供机器人策略所需的物理规则,生成模拟则提供视觉和解剖变异的范围,使其能够泛化。通过英伟达的Warp和Newton库在GPU上大规模并行运行,该框架可以同时执行大量训练环境,而不是一次处理一个场景。英伟达表示,在基准测试中,并行运行8,192个环境将训练时间从五小时以上缩短到不到两分钟。然而,这仅展示了吞吐量,并未说明临床可靠性,也未涉及训练策略在不完整成像、传感器延迟或模拟未覆盖的解剖结构下的表现。
语言模型在边缘情况下表现不佳会导致错误答案,但物理AI系统在患者体内操作时,边缘情况下的失误可能造成严重后果。并行模拟方法在加速开发者探索故障模式方面是真正的进步,但模拟的故障模式是否与实际手术中发生的情况相符,则是另一个问题。
英伟达公布的早期采用者正在不同深度应用这一方法。CMR Surgical和Capgemini旗下的Cambridge Consultants在数据方面走得最远,CMR贡献了近500小时的匿名临床数据用于Open-H Embodiment数据集,并利用Cosmos-H Dreams建模软组织交互物理,生成患者特定模拟。强生医疗技术部门利用该框架和Cosmos基础模型构建其MONARCH平台的数字孪生,专注于泌尿科肾结石场景。XCath将其用于血管内自主策略训练,Inner Logic则生成合成数据验证设备力学,并计划为监管提交提供计算机模拟证据,尽管尚无公开确认。美敦力结构性心脏部门则处于早期阶段,探索模拟X射线传感用于导管导航研究。
这些目前均为训练或数据贡献,尚未有直接用于患者、策略通过这种方式学习的系统,英伟达也未声称如此。医疗机器人面临的监管要求高于大多数物理AI应用,监管机构和临床审查委员会需要看到系统如何得出行为,而不仅仅是确认行为在测试中看起来可接受。开源框架让开发者可以检查模拟中的物理假设,在不同解剖结构上重现结果,并建立适合提交给FDA或类似机构的证据链。
开源在物理AI中比在大多数软件类别中更有说服力,因为封闭的供应商管道隐藏了团队需要向监管机构辩护的假设。但这并不能单独解决验证问题:开放的代码让外部审查者检查模型的逻辑,但不能确认模型的物理行为与人体内实际情况相符,这种确认仍需测试,而这些公司尚未公布。
英伟达构建了可能缩短手术和诊断机器人物理AI开发中硬件前阶段的基础设施,以这种规模并行运行训练也意味着无需为每个工作流重建自定义模拟场景。