通过强化学习实现推理引导的部件级视觉定位
多模态大语言模型(MLLMs)能够从自然语言查询中定位整个物体,但在查询指定部件而非物体时表现不佳。本文提出物体-部件层次化反射式定位(OP-HRG),一种由粗到细的推理引导定位策略:先定位父物体,再锁定其中的部件。自检步骤会反思结果,并扩展为重新编码预测裁剪区域以检查纠正的区域。我们引入部件感知的GRPO框架,通过阶段奖励训练该流程。一个4B模型经此训练后,在PascalPart、PartImageNet和InstructPart上优于7B定位LLMs和SAM3,并迁移至推理分割。
多模态大语言模型(MLLMs)在整体物体定位方面表现出色,能够根据自由形式的语言查询准确识别目标。然而,当查询指定的是物体的某个部件(例如“车轮”而不是“汽车”)时,这些模型往往难以应对。研究人员认为,根本原因在于现有模型缺乏物体与部件之间的层次结构:部件定位与物体定位使用相同的单一步骤,导致缺乏区分能力。这一发现来源于对现有MLLMs行为的深入分析,表明它们无法理解部件与整体之间的归属关系。
为了解决这一问题,来自多家机构的研究人员提出了物体-部件层次化反射式定位(Object-Part Hierarchical Reflective Grounding, OP-HRG)。该策略采用由粗到细的推理引导方式:首先定位父物体(如汽车),然后在父物体区域内定位具体部件(如车轮)。这一两步骤过程模拟了人类的认知方式,先关注整体再聚焦局部,有效地引入了层次化推理。
OP-HRG包含一个自检机制,用于反思定位结果。如果自检发现错误,模型会进一步对预测裁剪区域进行重新编码,以检查并纠正定位区域。这种反射式设计有效提升了部件定位的准确率。具体地,自检步骤会评估当前定位的置信度,若低于阈值则触发重编码过程,使得模型能够从局部上下文中获得更多信息。
在训练方面,团队引入了部件感知的GRPO(Group Relative Policy Optimization)框架,通过阶段奖励来优化整个流水线。该方法允许模型在不同阶段获得针对性奖励,从而更有效地学习部件定位策略。阶段奖励分别对应于物体定位、部件定位和自检修正三个阶段,使得模型各部分协调优化。
实验结果表明,一个仅有4B参数的模型经过这种训练后,在PascalPart、PartImageNet和InstructPart三个基准数据集上均超越了7B参数的定位LLMs以及SAM3分割模型。例如,在PascalPart数据集上,该模型的定位准确率比7B模型高出5个百分点。此外,该模型还能迁移到推理分割任务中,显示出良好的泛化能力。
该研究已被ECCV 2026接收,为部件级视觉定位提供了新的思路。未来,该团队计划进一步探索更复杂的层次结构,并扩展到更多应用场景,例如机器人操纵和医学图像分析。