アクション条件付きワールドモデルによるロボット超音波の目標平面プローブガイダンス
ロボット超音波の目標平面プローブガイダンスのためのアクション条件付きワールドモデルフレームワークを提案し、特に頸部超音波スキャンに焦点を当てる。二段階モデルベース学習パイプライン:まず、潜在条件付き拡散ワールドモデルが最近のコンテキストフレーム、プローブ動作、時間オフセットから将来の超音波観測を予測。次に、目標条件付き時間トランスフォーマーが順序付けられたプローブ動作を予測し、凍結されたワールドモデルからの報酬を使用して微調整。自己収集データセットの実験では、ワールドモデルが目標指向スキャンにおける動作依存の解剖学的構造を保持。実世界の閉ループ実験では、頸動脈ガイダンスで70.0%、甲状腺ガイダンスで65.0%の成功率を達成。学習された超音波ダイナミクスが目標指向ロボットプローブナビゲーションの訓練に潜在能力を示す。
ロボット超音波の分野では、自律的な超音波タスクの訓練に大量のプローブ動作軌跡が必要ですが、高品質なデモデータの収集は労働集約的であり、超音波画像が接触、組織変形、視点依存の音響アーティファクトに依存するため、明示的なシミュレータの構築は困難です。本稿では、頸部超音波スキャンに焦点を当てたロボット超音波の目標平面プローブガイダンスのためのアクション条件付きワールドモデルフレームワークを提案します。このフレームワークは二段階のモデルベース学習パイプラインを採用します。第一段階では、潜在条件付き拡散ワールドモデルが最近のコンテキストフレーム、プローブ動作、時間オフセットから将来の超音波観測を予測します。第二段階では、目標条件付き時間トランスフォーマーが順序付けられたプローブ動作を予測し、凍結されたワールドモデルからの報酬を用いて微調整されます。自己収集データセットによる実験では、ワールドモデルが目標指向スキャンにおける動作依存の解剖学的構造を保持することが示されました。実世界の閉ループ実験では、頸動脈ガイダンスで70.0%、甲状腺ガイダンスで65.0%の成功率を達成しました。これらの結果は、学習された超音波ダイナミクスが目標指向ロボットプローブナビゲーションの訓練に大きな可能性を持つことを示しています。
本研究の重要な革新点は、物理ベースのシミュレータに代わり学習された超音波ダイナミクスを用いることで、複雑な音響モデルの構築を回避した点にあります。二段階アーキテクチャにより、ワールドモデルはプローブ動作と超音波画像変化の因果関係を捉え、目標条件付きトランスフォーマーはその因果モデルを利用して動作計画を行います。実験結果は、大量のデモデータがなくてもモデルが目標平面にプローブを導くことに成功することを示しています。この手法は、自律超音波システムの導入コストを大幅に削減し、臨床応用を加速することが期待されます。研究チームは、さらに複雑な超音波スキャンタスクへの拡張や、他の医用画像モダリティへの応用を検討しています。