人間とロボットのインタラクション(HRI)では、ロボットは「来て」「止まって」といった明示的な指示だけでなく、招待、拒否、忙しいなどの社会的な合図も理解することが求められます。実際の運用環境では、ロボットが搭載するセンサーの情報は部分的に遮蔽されたり、視点が変わったり、ノイズが混入したりします。さらに、エッジデバイス上でリアルタイムに処理するには遅延の制約も厳しくなります。こうした課題に対し、研究チームはSocioGestureというシステムを提案しました。
SocioGestureは、信頼度を考慮した身体・手の骨格表現を用います。これは、身体の骨格情報と手の関節情報をコンパクトに統合したもので、軽量なデュアルストリームモデルによって身体全体の動きと手指の細かな動きを融合します。これにより、ロボットの機上コンピュータでも低遅延で認識を行うことができます。
実環境での堅牢性を高めるため、学習時には遮蔽を考慮したデータ拡張を行っています。具体的には、手の欠損や腕の遮蔽、時間的に不安定なキーポイントを意図的に作り出し、モデルがそんな状況でも正しく判断できるように訓練します。この拡張は学習時のみに行われるため、推論時の計算コストは増加しません。
屋内と屋外の混合HRIシーンで収集したデータセットによる評価では、訓練に参加していない被験者に対しても高い認識性能を示しました。構造的な関節遮蔽がある場合の頑健性も大幅に向上しています。さらに、ロボットに搭載したエッジデバイス上でリアルタイム動作を確認しました。また、デプロイ中に判断が曖昧な区間を保存しておき、後でオフラインでラベル付けして適応学習を行うことで、元のジェスチャクラスの性能を保ったまま、新しいジェスチャ語彙を追加することも可能です。
本論文はWenjin Fu氏を含む6人の著者によるもので、全15ページ・図3点から構成されています。2026年9月3日にarXivへ提出され、識別番号は2609.04545です。著者らは、この研究がロボットのための頑健で効率的かつ適応的な社会的知覚への実用的な道筋を示すものだと述べています。