MotionMERGE:人間の動作編集、推論、生成、説明のためのマルチグラニュラーフレームワーク
MotionMERGEは、単一のLLM内で動作の部分レベルと時間レベルを明示的にモデル化することにより、動作言語モデルの粒度ギャップを埋める統合フレームワークです。推論認識型粒度シナジー事前学習と、細粒度の修正指示および思考連鎖注釈を含むMotionFineEditデータセット(98万1千トリプレット)を導入します。実験では、動作生成、理解、編集において優れた精度を実証し、ゼロショット汎化も示しています。
近年、動作と言語を結びつけるモデルが注目を集めていますが、従来の研究では粗い粒度での処理にとどまっており、アニメーションやインタラクションに必要な身体部位の微細な制御や理解が不十分でした。この課題を解決するため、研究チームはMotionMERGEという統合フレームワークを提案しました。本フレームワークは、単一の大規模言語モデル(LLM)内で動作を部位レベルと時間レベルに分けて明示的にモデル化することで、粒度のギャップを埋めることを目指しています。
MotionMERGEの第一の革新点は、細粒度の言語誘導による動作制御を初めて実現したことです。具体的には、LLM内で動作の局所的なパターンと時間的変化を明示的に扱うことで、例えば「右腕を上げながら左足を動かさない」といった細かい指示を理解し、対応する動作を生成できるようになりました。
第二に、研究チームは「推論認識型粒度シナジー事前学習(Reasoning-Aware Granularity-Synergy pre-training)」という新しい訓練戦略を設計しました。この戦略では、クロス粒度アライメント、時間的接地、局所アライメント、動作一貫性、そして動作に基づく思考連鎖(CoT)推論を同時に学習します。これにより、モデルは異なる粒度間の対応関係を理解し、複雑な動作指示を推論しながら実行する能力を獲得します。
第三に、MotionFineEditデータセットを構築しました。これは83万7千の原子トリプレット(例:「左手を肩の高さに動かす」)と14万4千の複合トリプレット(例:「かがんで物を拾い、振り返る」)からなり、初めての細粒度時空間修正指示と動作接地CoT注釈を含む大規模リソースです。このデータセットは、テキスト駆動の細粒度動作編集と動作推論の新たなベンチマークを提供します。
広範な実験により、MotionMERGEは動作生成、理解、編集において従来手法より高い精度を達成し、さらに他の複雑な動作タスク(例えばテキストからのアニメーション合成やインタラクティブな動作調整)へのゼロショット汎化も示しました。本研究は、より細かい粒度で動作と対話し、人間らしい推論を行うモデルへの重要な一歩です。今後の応用として、アニメーション制作、ヒューマンロボットインタラクション、バーチャルリアリティ、スポーツトレーニング分析などが期待されています。