HoloMotion-1 テクニカルレポート
本レポートでは、ゼロショット全身動作追跡のための人型ロボット動作基盤モデルHoloMotion-1を紹介する。その主要な革新は、実世界の動画から再構成された動作を多様性の主な源とし、厳選されたモーションキャプチャおよび社内データを高忠実度の監視と展開指向のカバレッジとして用いる大規模ハイブリッド動作コーパスにより制御ポリシーのトレーニングを拡大することにある。モデルは、大容量時間モデリング、スパース活性化混合専門家TransformerとKVキャッシュ推論によるリアルタイム制御、およびシーケンスレベルトレーニング戦略を統合する。実験では、多様な未見の動作ベンチマークで堅牢な一般化を示し、追跡精度を大幅に向上させ、タスク固有の微調整なしに実機人型ロボットに直接転送できることを確認した。
最近、arXivで公開されたテクニカルレポートにより、HoloMotion-1と呼ばれる革新的な人型ロボット動作基盤モデルが紹介されました。このモデルは、ゼロショットでの全身動作追跡を可能にし、タスク固有の微調整を必要とせずに実機人型ロボットに直接適用できる点が特徴です。HoloMotion-1の核心的な革新は、そのトレーニングデータ戦略にあります。研究チームは、大規模なハイブリッド動作コーパスを構築しました。このコーパスでは、実世界の動画から再構成された動作データが豊富な動作の多様性を提供し、厳選されたモーションキャプチャデータと社内データが高忠実度の監視と展開指向のカバレッジを担います。このデータ戦略により、モデルは従来のモーションキャプチャのみのトレーニングでは扱えなかった、はるかに広範な動作、キャプチャ条件、動作スタイルに触れることができ、一般化能力が大幅に向上します。しかし、異種データからの学習には、再構成ノイズ、ソースドメインのミスマッチ、動作品質の不均一、大きな行動変動下での時間的モデリングの必要性など、新たな課題が伴います。これらの課題に対処するため、HoloMotion-1は、大容量の時間モデリング機能、スパース活性化混合専門家Transformer(MoE)アーキテクチャとKVキャッシュ推論によるリアルタイム制御、および長い動作シーケンスの学習効率を向上させるシーケンスレベルトレーニング戦略を統合しています。複数の未見の動作ベンチマークを用いた広範な実験により、HoloMotion-1は多様な動作タイプとキャプチャ条件に対して堅牢に一般化し、従来手法と比較して追跡精度を大幅に向上させることが示されました。さらに、このモデルはタスク固有の微調整なしで実機人型ロボットに直接転送可能であり、シミュレーションから現実へのシームレスな移行を実現します。この成果は、人型ロボットの動作制御分野に新たな可能性を開き、ロボットがより自然に複雑な動的環境に適応する道を拓くものです。