英偉達押注物理AI解決醫療機器人數據難題
英偉達推出開源醫療物理模擬框架,將醫療機器人視為物理AI系統,通過模擬生成大量訓練數據,加速手術和診斷機器人的開發。
英偉達(Nvidia)近日發佈了新的醫療物理模擬框架(Medical Physics Simulation),該框架將醫療機器人視為物理人工智能系統,強調它們需要通過與物理世界的互動來學習,而不僅僅是依靠代碼。
物理AI是英偉達和許多機器人公司用來描述那些必須通過接觸、力和結果來理解世界行為的機器,而不是僅通過文本或圖像。語言模型從文本中學習,而物理AI系統則從導管接觸血管壁或機械臂對軟組織施加過大壓力等實際情況中學習。這種學習通常需要實體在真實世界中操作,或者需要足夠詳細的模擬環境。
對於醫療機器人來説,在真實手術中獲取經驗既稀缺又受到嚴格監管,而且難以快速生成機器人所需的多樣化場景。英偉達的醫療物理模擬框架旨在通過計算生成這種具身經驗。該框架作為開源工具添加到公司的Isaac for Healthcare平台中,能夠生成手術或診斷機器人通常需要多年臨牀經驗才能遇到的物理交互場景,例如導絲卡在鈣化血管壁、腎結石以異常角度嵌頓,或僅在少數手術中出現的軟組織反應。
這些邊緣情況不會在手術室中準時出現,而模擬可以讓開發人員按需生成它們。該框架結合了兩種建模方式:經典物理模擬處理已明確的機械規則,如導管的彎曲、血管壁的阻力以及器械移動時接觸力的變化;生成式AI則處理難以手動編碼的部分,通過名為Cosmos-H Dreams的組件從手術數據中學習視覺場景動態。
這種結合體現了物理AI的理念:經典模擬提供機器人策略所需的物理規則,生成模擬則提供視覺和解剖變異的範圍,使其能夠泛化。通過英偉達的Warp和Newton庫在GPU上大規模並行運行,該框架可以同時執行大量訓練環境,而不是一次處理一個場景。英偉達表示,在基準測試中,並行運行8,192個環境將訓練時間從五小時以上縮短到不到兩分鐘。然而,這僅展示了吞吐量,並未説明臨牀可靠性,也未涉及訓練策略在不完整成像、傳感器延遲或模擬未覆蓋的解剖結構下的表現。
語言模型在邊緣情況下表現不佳會導致錯誤答案,但物理AI系統在患者體內操作時,邊緣情況下的失誤可能造成嚴重後果。並行模擬方法在加速開發者探索故障模式方面是真正的進步,但模擬的故障模式是否與實際手術中發生的情況相符,則是另一個問題。
英偉達公佈的早期採用者正在不同深度應用這一方法。CMR Surgical和Capgemini旗下的Cambridge Consultants在數據方面走得最遠,CMR貢獻了近500小時的匿名臨牀數據用於Open-H Embodiment數據集,並利用Cosmos-H Dreams建模軟組織交互物理,生成患者特定模擬。強生醫療技術部門利用該框架和Cosmos基礎模型構建其MONARCH平台的數字孿生,專注於泌尿科腎結石場景。XCath將其用於血管內自主策略訓練,Inner Logic則生成合成數據驗證設備力學,並計劃為監管提交提供計算機模擬證據,儘管尚無公開確認。美敦力結構性心臟部門則處於早期階段,探索模擬X射線傳感用於導管導航研究。
這些目前均為訓練或數據貢獻,尚未有直接用於患者、策略通過這種方式學習的系統,英偉達也未聲稱如此。醫療機器人面臨的監管要求高於大多數物理AI應用,監管機構和臨牀審查委員會需要看到系統如何得出行為,而不僅僅是確認行為在測試中看起來可接受。開源框架讓開發者可以檢查模擬中的物理假設,在不同解剖結構上重現結果,並建立適合提交給FDA或類似機構的證據鏈。
開源在物理AI中比在大多數軟件類別中更有説服力,因為封閉的供應商管道隱藏了團隊需要向監管機構辯護的假設。但這並不能單獨解決驗證問題:開放的代碼讓外部審查者檢查模型的邏輯,但不能確認模型的物理行為與人體內實際情況相符,這種確認仍需測試,而這些公司尚未公佈。
英偉達構建了可能縮短手術和診斷機器人物理AI開發中硬件前階段的基礎設施,以這種規模並行運行訓練也意味着無需為每個工作流重建自定義模擬場景。