輝達押注物理AI解決醫療機器人資料難題
輝達推出開源醫療物理模擬框架,將醫療機器人視為物理AI系統,透過模擬生成大量訓練資料,加速手術和診斷機器人的開發。
輝達(Nvidia)近日釋出了新的醫療物理模擬框架(Medical Physics Simulation),該框架將醫療機器人視為物理人工智慧系統,強調它們需要透過與物理世界的互動來學習,而不僅僅是依靠程式碼。
物理AI是輝達和許多機器人公司用來描述那些必須透過接觸、力和結果來理解世界行為的機器,而不是僅透過文本或影像。語言模型從文本中學習,而物理AI系統則從導管接觸血管壁或機械臂對軟組織施加過大壓力等實際情況中學習。這種學習通常需要實體在真實世界中操作,或者需要足夠詳細的模擬環境。
對於醫療機器人來說,在真實手術中獲取經驗既稀缺又受到嚴格監管,而且難以快速生成機器人所需的多樣化場景。輝達的醫療物理模擬框架旨在透過計算生成這種具身經驗。該框架作為開源工具新增到公司的Isaac for Healthcare平臺中,能夠生成手術或診斷機器人通常需要多年臨床經驗才能遇到的物理互動場景,例如導絲卡在鈣化血管壁、腎結石以異常角度嵌頓,或僅在少數手術中出現的軟組織反應。
這些邊緣情況不會在手術室中準時出現,而模擬可以讓開發人員按需生成它們。該框架結合了兩種建模方式:經典物理模擬處理已明確的機械規則,如導管的彎曲、血管壁的阻力以及器械移動時接觸力的變化;生成式AI則處理難以手動編碼的部分,透過名為Cosmos-H Dreams的元件從手術資料中學習視覺場景動態。
這種結合體現了物理AI的理念:經典模擬提供機器人策略所需的物理規則,生成模擬則提供視覺和解剖變異的範圍,使其能夠泛化。透過輝達的Warp和Newton庫在GPU上大規模並行執行,該框架可以同時執行大量訓練環境,而不是一次處理一個場景。輝達表示,在基準測試中,並行執行8,192個環境將訓練時間從五小時以上縮短到不到兩分鐘。然而,這僅展示了吞吐量,並未說明臨床可靠性,也未涉及訓練策略在不完整成像、感測器延遲或模擬未覆蓋的解剖結構下的表現。
語言模型在邊緣情況下表現不佳會導致錯誤答案,但物理AI系統在患者體內操作時,邊緣情況下的失誤可能造成嚴重後果。並行模擬方法在加速開發者探索故障模式方面是真正的進步,但模擬的故障模式是否與實際手術中發生的情況相符,則是另一個問題。
輝達公佈的早期採用者正在不同深度應用這一方法。CMR Surgical和Capgemini旗下的Cambridge Consultants在資料方面走得最遠,CMR貢獻了近500小時的匿名臨床資料用於Open-H Embodiment資料集,並利用Cosmos-H Dreams建模軟組織互動物理,生成患者特定模擬。強生醫療技術部門利用該框架和Cosmos基礎模型構建其MONARCH平臺的數字孿生,專注於泌尿科腎結石場景。XCath將其用於血管內自主策略訓練,Inner Logic則生成合成資料驗證裝置力學,並計劃為監管提交提供計算機模擬證據,儘管尚無公開確認。美敦力結構性心臟部門則處於早期階段,探索模擬X射線感測用於導管導航研究。
這些目前均為訓練或資料貢獻,尚未有直接用於患者、策略透過這種方式學習的系統,輝達也未聲稱如此。醫療機器人面臨的監管要求高於大多數物理AI應用,監管機構和臨床審查委員會需要看到系統如何得出行為,而不僅僅是確認行為在測試中看起來可接受。開源框架讓開發者可以檢查模擬中的物理假設,在不同解剖結構上重現結果,並建立適合提交給FDA或類似機構的證據鏈。
開源在物理AI中比在大多數軟體類別中更有說服力,因為封閉的供應商管道隱藏了團隊需要向監管機構辯護的假設。但這並不能單獨解決驗證問題:開放的程式碼讓外部審查者檢查模型的邏輯,但不能確認模型的物理行為與人體內實際情況相符,這種確認仍需測試,而這些公司尚未公佈。
輝達構建了可能縮短手術和診斷機器人物理AI開發中硬體前階段的基礎設施,以這種規模並行執行訓練也意味著無需為每個工作流重建自定義模擬場景。