AI News HubLIVE
站内改写1 分钟阅读

解码前发生了什么?预填充阶段决定VLM的GUI定位能力

现有训练无关的GUI定位方法通常需要多次推理(如迭代裁剪或候选聚合)来识别目标元素,但每次前向传播仍独立处理指令和视觉布局,缺乏视觉令牌间的渐进交互。本文揭示VLM中GUI定位遵循两阶段范式:预填充阶段决定候选UI元素,解码阶段仅进行坐标微调。预填充是关键步骤,候选选择错误无法在解码中有效纠正。据此提出Re-Prefill,一种无需训练的方法,引入注意力引导的第二预填充阶段以优化目标选择。在4种VLM和5个基准上的实验显示一致改进,ScreenSpot-Pro上提升达4.3%。

来源arXiv Computer Vision作者: Jiaping Lin, Fei Shen, Junzhe Li, Ping Nie, Fei Yu, Ming Li, Haizhou Li

近日,一篇题为《What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs》的论文在arXiv上发表,深入研究了视觉-语言模型(VLM)在图形用户界面(GUI)定位任务中的内部机制。论文作者包括Jiaping Lin等七位研究人员。

当前,大多数无需额外训练的GUI定位方法依赖于多次推理过程,例如迭代裁剪或候选聚合,以识别目标界面元素。然而,这些方法每次前向传播仍然独立地解读用户指令并解析视觉布局,未能实现视觉令牌之间的渐进式交互。这种局限性导致模型在理解复杂界面时效率低下且易出错。

研究者通过分析发现,VLM的GUI定位实际上遵循一个两阶段范式:第一阶段是“预填充”(Prefill),该阶段确定候选的UI元素;第二阶段是“解码”(Decoding),对第一阶段选出的候选坐标进行精细调整。这一不对称性使得预填充成为整个流程的关键步骤——如果预填充阶段选择了错误的元素,后续的解码过程几乎无法纠正。

基于这一重要观察,论文提出了一种名为“Re-Prefill”的训练无关方法。该方法在原始推理流程中引入一个注意力引导的二次预填充步骤,以细化目标选择。具体而言,模型首先从查询位置(即最终令牌)在各层中持续获得高注意力的视觉令牌中提取初步目标假设,然后将这些视觉令牌连同指令的隐藏状态一同追加到输入中,使模型在生成最终坐标前能够深度重新思考其决策。

实验部分,研究者们在四种不同的VLM(视觉-语言模型)和五个基准测试(包括ScreenSpot-Pro、ScreenSpot-V2、OSWorld-G、UI-Vision和MMBench-GUI)上验证了Re-Prefill的有效性。结果显示,该方法无需额外训练即在所有测试中取得一致改进,其中在ScreenSpot-Pro上性能提升高达4.3%。研究者表示,代码将在GitHub上开源。

这项研究不仅揭示了VLM在GUI定位中的关键瓶颈,还提供了一种简单有效的改进方案,有望推动自动驾驶界面、软件自动化测试等领域的应用发展。