arXiv 于 2026 年 9 月 21 日(周一)18:16:40 UTC 收录了预印本论文《RULER: Instance-aware Rubric Rewards for SVG Generation》(RULER:面向 SVG 生成的实例感知评分量表奖励),编号 arXiv:2609.25270v1,属于计算机视觉与模式识别(cs.CV)分类。第一作者为 Hangyu Ran,另有四位合著者。论文全文约 842 KB,DOI 为 10.48550/arXiv.2609.25270,项目主页为 https://hangyuran.github.io/RULER/。
论文要解决的问题是:从自然语言指令生成可缩放矢量图形(SVG)代码,本质上是一项开放式任务,不存在绝对的视觉真值。这一特性使得评估与策略优化都缺乏可靠的训练信号。作者指出,当前常用的标量指标(如 CLIP、Aesthetic)是在自然图像上校准的,迁移到风格化矢量内容时表现很差;而若直接把这些标量指标当作强化学习(RL)的奖励,则会触发奖励黑客(reward hacking)——模型会去迎合指标的偏好,而不是真正提升生成质量。论文试图同时化解这两个局限,思路是改用基于评分量表(rubric)的打分方式。
在方法之前,作者先做了实证验证:让视觉语言评判模型(judge VLM)依据一个多轴评分量表进行打分,其与人类判断的相关性远高于标量指标,这一结论在跨样本比较与同一指令内部比较两种设定下都成立。也就是说,量表式评判不仅能在不同指令之间区分好坏,还能在同一条指令的多个候选输出之间给出与人类一致的排序,这正是 RL 奖励所需要具备的性质。
基于这一发现,作者提出 RULER(Instance-aware Rubric Rewards for Reinforcement Learning)。其核心做法是:把每一条生成指令转换成一份「实例感知」的评分量表,量表共包含六个条目,覆盖语义、视觉与风格三类轴。随后由评判 VLM 对渲染出来的各个 rollout 逐项打分,各条目满足度经过加权后构成一个细粒度的奖励信号,再通过 Group Relative Policy Optimization(GRPO)进行策略优化。关键之处在于,量表完全由文本指令推导而来,因此 RULER 既不需要成对的 SVG 真值标注,也不需要人类偏好标签,避免了昂贵且难以规模化的人工标注环节。
实验结果在两个基准上给出:在 MMSVG-Illustration 与 MMSVG-Icon 上,RULER 将量表得分分别从 0.432 和 0.395 提升至 0.693 和 0.683。这一结果不仅超过了专门的 SVG 生成专用模型,还追平了规模显著更大的 DeepSeek-V3。考虑到后者的参数量与训练资源远超 RULER 所依赖的模型,这一对比说明奖励信号的重新设计能够带来可观的收益。
论文进一步通过消融实验说明,量表设计本身才是开放式 SVG 生成任务上强化学习的有效杠杆:改进量表的结构与条目,会直接改变 RL 的优化方向与最终质量,而不是依赖更大的模型规模或更多的监督数据。
从更广的意义上看,这项工作为「无绝对真值的生成任务」如何构造可优化的奖励提供了一个可复用的范式:先把抽象的质量标准显式化为多轴、逐条目的量表,再让视觉语言模型充当评判者,把语言层面的标准转化为可微调、可比较的数值奖励。论文同时提及可获取的资源入口,包括 PDF 全文、实验性 HTML 版本与 TeX 源码,并标注了许可信息。需要留意的是,其结论所覆盖的数据集为 MMSVG-Illustration 与 MMSVG-Icon,评测依赖评判 VLM 自身的判断能力,量表条目固定为六项,这些设定构成了当前结果的适用边界。论文浏览上下文为 cs.CV,收录于 2026 年 9 月。