AI News HubLIVE
站内改写1 分钟阅读

MIME:多模态交互运动编码器

本文介绍了多模态交互运动编码器(MIME),这是首个专为双人交互运动设计的多模态编码器。MIME通过基于流的共注意力机制、显式交互特征和基于课程的对比训练,捕捉个体与共享结构。在Inter-X文本-运动检索任务中,MIME显著优于基线方法,在2000样本库中文本到运动R@1相对提升12.8%。作为冻结的辅助先验,MIME在TIMotion和InterMask中提升了语义对齐指标,同时保持了相当的FID分数,表明交互感知的多模态编码能够提升多人运动检索并迁移至下游运动生成任务。

来源arXiv Computer Vision作者: Addison Zucek, Prerit Gupta, Kamila Kuatova, Aniket Bera

近年来,文本-运动表征学习取得了显著进展,尤其在多人物交互场景中,如动画、增强现实/虚拟现实(AR/VR)和具身人工智能等领域受到了广泛关注。这些应用要求表征能够将自然语言描述与个体运动动态及其交互关系精确对齐。然而,传统方法通常采用早期融合或晚期融合策略,难以有效捕捉双人之间的共享交互结构。为此,来自研究团队(Addison Zucek等人)提出了多模态交互运动编码器(MIME),据我们所知,这是首个专门为双人交互运动设计的多模态编码器。

MIME的核心创新在于其独特的架构设计。它采用基于流的共注意力机制,将两个人的运动序列分别视为独立的数据流,通过共注意力层交互信息,同时引入显式交互特征(如相对位置、距离、朝向等)来增强对交互关系的建模。此外,MIME采用了基于课程的对比训练策略,从简单的负样本开始逐步过渡到更难的负样本,从而更有效地学习个体与共享结构的区分性表示。在Inter-X数据集上的文本-运动检索实验中,MIME在不同规模的检索库中均优于早期融合和晚期融合基线方法,特别是在包含2000个样本的库中,其文本到运动检索的R@1指标相对提升了12.8%。

为了验证MIME的泛化能力,研究团队进一步将其作为冻结的辅助先验,集成到两个运动生成框架中:文本到运动生成模型TIMotion和运动修复模型InterMask。在未见过的InterHuman数据集上进行评估,结果表明,MIME显著提升了语义对齐指标(如R精度等),同时保持了与基线相当的FID分数。这些成果证明,交互感知的多模态编码不仅能够改进多人运动检索,还能跨数据集迁移,有效支持下游的运动生成任务。

该论文目前正在接受2027年IEEE冬季计算机视觉应用会议(WACV 2027)的审稿,提交时间为2026年7月18日。MIME的提出为交互式运动理解与生成领域提供了新的思路,有望推动虚拟角色动画、人机交互以及具身智能技术的发展。