AI News HubLIVE
站内改写2 分钟阅读

MotionMERGE:用于人体运动编辑、推理、生成和解释的多粒度框架

MotionMERGE是一个统一框架,通过在大语言模型中显式建模局部和时序运动模式,弥合了运动语言模型中的粒度差距。它引入了推理感知粒度协同预训练策略和包含98万个三元组的大规模数据集MotionFineEdit,实现了精细的文本驱动运动编辑和基于运动的思维链推理。实验表明,该框架在运动生成、理解和编辑方面具有更高精度,并能零样本泛化到其他复杂运动任务。

来源arXiv Computer Vision作者: Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

近年来,运动语言模型在理解和生成人体运动方面取得了显著进展,但这些模型通常仅能处理粗粒度的运动描述,无法对特定身体部位进行精细控制或执行局部编辑。这一问题源于模型和数据的双重局限:模型难以聚焦于运动的局部模式,而训练数据也缺乏细粒度的监督信号。为了突破这一瓶颈,研究团队提出了MotionMERGE——一个统一的多粒度框架,旨在弥合运动语言模型中的粒度鸿沟。

MotionMERGE的核心创新包括三个方面。首先,该框架首次将细粒度语言引导的运动控制引入单一大型语言模型(LLM)。通过对运动在部位和时间两个维度进行显式建模,模型获得了精确控制所需的强大先验知识。这意味着用户不仅可以用自然语言描述整体动作,还能对特定关节或肢体进行局部调整,例如“抬起右臂的同时保持左腿不动”。

其次,研究团队设计了推理感知粒度协同预训练(Reasoning-Aware Granularity-Synergy pre-training)策略。该策略通过联合监督学习同时优化跨粒度对齐、时序定位、局部对齐、运动连贯性以及基于运动的思维链(Chain-of-Thought, CoT)推理。这种多任务训练方式使模型具备了精细的运动语言对齐能力、跨粒度协同能力以及显式推理能力,能够理解复杂的运动指令并生成连贯的人体动作。

第三,为了支持细粒度研究,团队构建了MotionFineEdit数据集,这是首个包含精细时空校正指令和运动思维链标注的大规模资源。该数据集由83.7万个原子三元组(如“移动左手到肩膀高度”)和14.4万个复杂三元组(如“先弯腰再捡起物体并转身”)组成,为细粒度文本驱动的运动编辑和运动推理树立了新基准。

在广泛的实验中,MotionMERGE展示了卓越的性能。在运动生成、理解和编辑任务上,它均实现了比现有方法更高的精度,并且能够令人信服地零样本泛化到其他复杂运动任务,如基于文本的动画合成和交互式运动调整。这一工作标志着向更细粒度、更具人类推理能力的运动交互模型迈出了重要一步。未来,该框架有望在动画制作、人机交互、虚拟现实以及体育训练分析等领域发挥重要作用。