自然言語の指示からスケーラブル・ベクター・グラフィックス(SVG)コードを生成するタスクはオープンエンドであり、絶対的な視覚的真値が存在しない。そのため、評価と方策最適化はいずれも忠実な信号を持たない。自然画像で調整された CLIP や Aesthetic などのスカラー指標は、様式化されたベクターコンテンツへの転用がうまくいかず、強化学習の報酬として再利用すると報酬ハッキングを引き起こす。
本論文はこの制約を、ルーブリックに基づく採点で解決する。まず、視覚言語モデルの判定者に多軸ルーブリックを与えて評価させると、サンプル間でも同一指示内でも、人間の判断との相関がスカラー指標よりはるかに高いことを実験的に示す。
その知見に基づき、著者らは RULER(Instance-aware Rubric Rewards for Reinforcement Learning)を提案する。RULER は各指示を、意味・視覚・スタイルの軸にまたがる6項目のインスタンス認識型ルーブリックへ変換する。判定 VLM がレンダリングされたロールアウトを項目ごとに採点し、重み付き満足度が細粒度の報酬となり、Group Relative Policy Optimization(GRPO)で最適化される。ルーブリックはテキストのみから導出されるため、RULER はペアとなる SVG 正解データも人間の選好ラベルも必要としない。
MMSVG-Illustration と MMSVG-Icon において、RULER はルーブリックスコアを 0.432/0.395 から 0.693/0.683 へ引き上げ、専用の SVG 生成モデルを上回り、はるかに大規模な DeepSeek-V3 に匹敵する性能を示した。アブレーションにより、ルーブリック設計がオープンエンドな SVG 生成における強化学習の有効なレバーであることが特定されている。
論文は「RULER: Instance-aware Rubric Rewards for SVG Generation」で、Hangyu Ran 氏ら5名の著者による。2026年9月21日に投稿され、arXiv のコンピュータビジョンとパターン認識(cs.CV)分類に属し、番号は arXiv:2609.25270v1。プロジェクトページが公開されており、DOI は登録待ちである。