arXiv cs.CVは2026年9月22日(現地時間)、自然言語の指示からScalable Vector Graphics (SVG) コードを生成する際の評価とポリシー最適化における課題に対処する新しい手法「ルーラー (RULER)」に関する論文を発表した。RULERは、多軸ルーブリックに基づく評価と強化学習 (RL) の報酬システムを導入し、既存のスカラー指標が抱える「報酬ハッキング」の問題解決を図る。
SVG生成は視覚的な絶対的真理値がないオープンエンドなタスクであり、正確な評価シグナルの欠如が課題とされてきた。これまでのCLIPやAestheticといったスカラー指標は、自然画像を基準としているため、スタイル化されたベクターコンテンツには適合しにくく、RL報酬として再利用すると報酬ハッキングを引き起こすことが指摘されていた。
論文では、ビジョン言語モデル (VLM) を用いて多軸ルーブリックで評価することが、スカラー指標よりも人間の判断と高い相関を示すことを実証。この知見に基づき、RULER(Instance-aware Rubric Rewards for Reinforcement Learning)を導入した。RULERは、各指示を意味的、視覚的、様式的軸にわたる6項目のインスタンス認識型ルーブリックに変換する。VLMがレンダリングされた出力を項目ごとに採点し、その加重満足度がGroup Relative Policy Optimizationを通じて最適化されるきめ細かい報酬を形成する。このルーブリックはテキストのみから導出されるため、RULERはSVGの真理値や人間の選好ラベルを必要としない。
MMSVG-IllustrationとMMSVG-Iconのデータセットにおいて、RULERはルーブリックスコアをそれぞれ0.432/0.395から0.693/0.683に向上させた。これは専用のSVGスペシャリストを上回り、大幅に規模の大きいDeepSeek-V3と同等の性能を示した。アブレーションスタディにより、ルーブリック設計がオープンエンドなSVG生成におけるRLの有効なレバーであることが確認されている。
参考: arXiv cs.CV (アーカイブ) — 2026年9月23日 13:00 (JST)
原文ハイライト"RULER requires neither paired SVG ground truth nor human preference labels."