先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.25270
RULER:按每条指令定制评分细则,给 SVG 生成做强化学习奖励
RULER: Instance-aware Rubric Rewards for SVG Generation
Hangyu Ran,Yuhao Zheng,Yingying Zhang,Kevin Qinghong Lin 等 5 位作者 · 2026-09-21
开放式生成没有标准答案?给每题现写一份评分表
打开交互式解读 →三个要点
- 问题:从自然语言生成 SVG 矢量图代码没有绝对的标准答案。CLIP、美学分这类在自然图像上校准的标量指标迁移到风格化矢量内容效果差,直接当强化学习奖励还会引发奖励作弊。
- 方法:作者先验证,让视觉语言评委按多维度细则打分,与人类判断的相关性远高于标量指标。RULER 把每条指令转成六项细则(语义、视觉、风格),评委逐项给渲染结果打分,加权后作为 GRPO 的细粒度奖励。细则只从文本生成,不需要成对的 SVG 标准答案或人类偏好标注。
- 结果:在 MMSVG-Illustration 和 MMSVG-Icon 上细则分从 0.432/0.395 提到 0.693/0.683,超过专门的 SVG 模型,与大得多的 DeepSeek-V3 相当。作者承认奖励质量依赖两个外部模型,会继承它们的偏差。
0.432 → 0.693 MMSVG-Illustration 上的细则得分提升
适合谁读:做设计工具、图标/插画生成以及开放式任务奖励设计的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。