RULER:实例感知的评分标准奖励用于SVG生成
摘要
RULER为SVG生成引入了实例感知的评分标准奖励,利用视觉语言评判器优化强化学习,显著提升性能,优于之前的方法。
查看缓存全文
缓存时间: 2026/09/23 03:32
论文页面 - RULER:面向SVG生成的实例感知评分标准奖励机制
来源:https://huggingface.co/papers/2609.25270
摘要
从自然语言指令生成可缩放矢量图形代码是一项开放性任务,缺乏绝对的视觉基准,导致评估和策略优化均无可靠依据。基于自然图像校准的标量指标难以准确评估风格化矢量内容,将其复用为强化学习奖励信号易引发奖励欺骗问题。我们采用基于评分标准的评分方案同时解决这两项局限。通过实验证明:引导视觉语言模型使用多维评分标准进行判断,其结果与人类评判的一致性远高于标量指标,无论是跨样本还是指令内部对比均显著成立。基于此发现,我们提出RULER(用于强化学习的实例感知评分标准奖励机制),该方法将每条指令转化为包含六个项目的实例感知评分标准,覆盖语义、视觉和风格维度;由评判型视觉语言模型对渲染输出逐项评分,加权满意度构成细粒度奖励信号,并通过组相对策略优化进行模型更新。由于评分标准仅基于文本生成,RULER无需配对的SVG标准答案或人工偏好标签。在MMSVG-Illustration和MMSVG-Icon数据集上,RULER将评分标准得分从0.432/0.395提升至0.693/0.683,超越专业SVG生成模型并达到与体量更大的DeepSeek-V3相当的水平。消融实验证实评分标准设计是驱动开放式SVG生成强化学习的关键要素。项目主页:https://hangyuran.github.io/RULER/
查看arXiv页面 (https://arxiv.org/abs/2609.25270) 查看PDF (https://arxiv.org/pdf/2609.25270) 项目主页 (https://hangyuran.github.io/RULER/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.25270)
通过代理获取本文:
hf papers read 2609.25270
未安装最新版命令行工具?运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型关联本文
在模型README.md中引用 arxiv.org/abs/2609.25270 即可从此页面建立关联
引用本文的数据集 0
暂无数据集关联本文
在数据集README.md中引用 arxiv.org/abs/2609.25270 即可从此页面建立关联
引用本文的空间 0
暂无空间关联本文
在空间README.md中引用 arxiv.org/abs/2609.25270 即可从此页面建立关联
包含本文的合集 0
暂无合集包含本文
将本文添加至合集 (https://huggingface.co/new-collection) 即可从此页面建立关联
相似文章
AutoRubric-T2I: 基于规则的文本到图像对齐鲁棒奖励模型
AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。
并非每种评分标准都同样有效:面向策略感知的评分标准奖励用于RLVR
本文提出POW3R,一种面向策略感知的评分标准奖励框架,用于可验证奖励的强化学习(RLVR)。它表明静态评分标准聚合会错误分配学习信号,而POW3R在多种设置下实现了更快的收敛和更好的性能。
V-Rubrics:基于评估准则的强化学习实现视觉忠实性
提出一种基于评估准则的强化学习方法,通过将回答分解为原子命题,并从视觉忠实性、推理一致性和指令遵循度三个维度进行评分,从而提升视觉语言模型的视觉忠实性。
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
RUBRIC-ARROW:非可验证领域中LLM后训练的交替点状评分标准奖励建模
RUBRIC-ARROW 提出了一种交替式奖励建模框架,通过减少平局并利用成对偏好数据改进了基于评分标准的方法,在非可验证领域为LLM后训练实现了具有竞争力的准确率和收益。