動作條件世界模型用於機器人超聲中的目標平面探頭引導
提出了一種動作條件世界模型框架,用於機器人超聲中的目標平面探頭引導,特別針對頸部超聲掃描。採用兩階段模型學習管道:首先,潛在條件擴散世界模型從上下文幀、探頭運動和時移預測未來超聲圖像;然後,目標條件時間變換器預測有序探頭運動,並通過凍結世界模型的獎勵進行微調。在自收集數據集上,世界模型保留了目標導向掃描中的動作依賴解剖結構。真實世界閉環實驗顯示,頸動脈引導成功率達70.0%,甲狀腺引導達65.0%,展示了學習超聲動力學用於訓練目標導向機器人探頭導航的潛力。
在機器人超聲領域,自主超聲任務通常需要大量的探頭運動軌跡進行訓練,但收集高質量的演示數據勞動密集,且由於超聲圖像依賴於接觸、組織變形和視角相關的聲學偽影,顯式模擬器難以構建。本文提出了一種動作條件世界模型框架,用於機器人超聲中的目標平面探頭引導,特別針對頸部超聲掃描。該框架採用兩階段模型學習管道:首先,一個潛在條件擴散世界模型從最近的上下文幀、探頭運動和時移預測未來的超聲觀測;其次,一個目標條件時間變換器預測有序的探頭運動,並通過凍結世界模型的獎勵進行微調。實驗在自收集數據集上進行,結果顯示世界模型在目標導向掃描中保留了動作依賴的解剖結構。在真實世界閉環實驗中,該框架在頸動脈引導中達到70.0%的成功率,在甲狀腺引導中達到65.0%。這些結果展示了學習超聲動力學在訓練目標導向機器人探頭導航中的潛力。
該工作的核心創新在於利用學習到的超聲動力學替代傳統的基於物理的模擬器,從而避免了構建複雜聲學模型的需求。兩階段架構使得世界模型能夠捕捉探頭動作與超聲圖像變化之間的因果關係,而目標條件變換器則利用這一因果模型進行規劃。實驗結果表明,即使在沒有大量演示數據的情況下,模型仍能成功引導探頭到達目標平面。這一方法有望顯著降低自主超聲系統的部署成本,並加速其在臨牀中的應用。研究團隊計劃進一步擴展該框架以支持更復雜的超聲掃描任務,並探索其在其他醫學影像模態中的適用性。