arXiv 於 2026 年 9 月 21 日(週一)18:16:40 UTC 收錄了預印本論文《RULER: Instance-aware Rubric Rewards for SVG Generation》(RULER:面向 SVG 生成的例項感知評分量表獎勵),編號 arXiv:2609.25270v1,屬於計算機視覺與模式識別(cs.CV)分類。第一作者為 Hangyu Ran,另有四位合著者。論文全文約 842 KB,DOI 為 10.48550/arXiv.2609.25270,專案主頁為 https://hangyuran.github.io/RULER/。
論文要解決的問題是:從自然語言指令生成可縮放向量圖形(SVG)程式碼,本質上是一項開放式任務,不存在絕對的視覺真值。這一特性使得評估與策略最佳化都缺乏可靠的訓練訊號。作者指出,當前常用的標量指標(如 CLIP、Aesthetic)是在自然影像上校準的,遷移到風格化向量內容時表現很差;而若直接把這些標量指標當作強化學習(RL)的獎勵,則會觸發獎勵駭客(reward hacking)——模型會去迎合指標的偏好,而不是真正提升生成質量。論文試圖同時化解這兩個侷限,思路是改用基於評分量表(rubric)的打分方式。
在方法之前,作者先做了實證驗證:讓視覺語言評判模型(judge VLM)依據一個多軸評分量表進行打分,其與人類判斷的相關性遠高於標量指標,這一結論在跨樣本比較與同一指令內部比較兩種設定下都成立。也就是說,量表式評判不僅能在不同指令之間區分好壞,還能在同一條指令的多個候選輸出之間給出與人類一致的排序,這正是 RL 獎勵所需要具備的性質。
基於這一發現,作者提出 RULER(Instance-aware Rubric Rewards for Reinforcement Learning)。其核心做法是:把每一條生成指令轉換成一份「例項感知」的評分量表,量表共包含六個條目,覆蓋語義、視覺與風格三類軸。隨後由評判 VLM 對渲染出來的各個 rollout 逐項打分,各條目滿足度經過加權後構成一個細粒度的獎勵訊號,再透過 Group Relative Policy Optimization(GRPO)進行策略最佳化。關鍵之處在於,量表完全由文本指令推導而來,因此 RULER 既不需要成對的 SVG 真值標註,也不需要人類偏好標籤,避免了昂貴且難以規模化的人工標註環節。
實驗結果在兩個基準上給出:在 MMSVG-Illustration 與 MMSVG-Icon 上,RULER 將量表得分分別從 0.432 和 0.395 提升至 0.693 和 0.683。這一結果不僅超過了專門的 SVG 生成專用模型,還追平了規模顯著更大的 DeepSeek-V3。考慮到後者的引數量與訓練資源遠超 RULER 所依賴的模型,這一對比說明獎勵訊號的重新設計能夠帶來可觀的收益。
論文進一步透過消融實驗說明,量表設計本身才是開放式 SVG 生成任務上強化學習的有效槓桿:改進量表的結構與條目,會直接改變 RL 的最佳化方向與最終質量,而不是依賴更大的模型規模或更多的監督資料。
從更廣的意義上看,這項工作為「無絕對真值的生成任務」如何構造可最佳化的獎勵提供了一個可複用的正規化:先把抽象的質量標準顯式化為多軸、逐條目的量表,再讓視覺語言模型充當評判者,把語言層面的標準轉化為可微調、可比較的數值獎勵。論文同時提及可獲取的資源入口,包括 PDF 全文、實驗性 HTML 版本與 TeX 原始碼,並標註了許可資訊。需要留意的是,其結論所覆蓋的資料集為 MMSVG-Illustration 與 MMSVG-Icon,評測依賴評判 VLM 自身的判斷能力,量表條目固定為六項,這些設定構成了當前結果的適用邊界。論文瀏覽上下文為 cs.CV,收錄於 2026 年 9 月。