RULER:实例感知的评分标准奖励用于SVG生成

Hugging Face Daily Papers 论文

摘要

RULER为SVG生成引入了实例感知的评分标准奖励,利用视觉语言评判器优化强化学习,显著提升性能,优于之前的方法。

从自然语言指令生成可缩放矢量图形(SVG)代码是一项没有绝对视觉基准的开放性任务,使得评估和策略优化都缺乏可靠的信号。在自然图像上校准的标量指标(CLIP、Aesthetic)在风格化矢量内容上表现不佳,将它们复用为强化学习奖励会触发奖励黑客行为。我们使用基于评分标准的评分来解决这两个局限性。我们首先通过实证建立,使用多轴评分标准提示视觉语言评判器,与人类判断的相关性远高于标量指标,无论是在样本间还是在指令内。基于这一发现,我们引入了RULER(实例感知的评分标准奖励用于强化学习),它将每条指令转换为包含六个项目的实例感知评分标准,涵盖语义、视觉和风格维度;评判器视觉语言模型对渲染的输出逐项评分,加权满意度形成细粒度奖励,通过群组相对策略优化进行优化。由于评分标准仅从文本中得出,RULER既不需要配对的SVG基准,也不需要人类偏好标签。在MMSVG-Illustration和MMSVG-Icon上,RULER将评分标准分数从0.432/0.395提升至0.693/0.683,超越专用SVG专家模型,并与规模更大的DeepSeek-V3相匹配,通过消融研究,确定评分标准设计是开放性SVG生成中强化学习的关键杠杆。项目页面可在 https://hangyuran.github.io/RULER/ 访问。
查看原文
查看缓存全文

缓存时间: 2026/09/23 03:32

论文页面 - RULER:面向SVG生成的实例感知评分标准奖励机制

来源:https://huggingface.co/papers/2609.25270

摘要

从自然语言指令生成可缩放矢量图形代码是一项开放性任务,缺乏绝对的视觉基准,导致评估和策略优化均无可靠依据。基于自然图像校准的标量指标难以准确评估风格化矢量内容,将其复用为强化学习奖励信号易引发奖励欺骗问题。我们采用基于评分标准的评分方案同时解决这两项局限。通过实验证明:引导视觉语言模型使用多维评分标准进行判断,其结果与人类评判的一致性远高于标量指标,无论是跨样本还是指令内部对比均显著成立。基于此发现,我们提出RULER(用于强化学习的实例感知评分标准奖励机制),该方法将每条指令转化为包含六个项目的实例感知评分标准,覆盖语义、视觉和风格维度;由评判型视觉语言模型对渲染输出逐项评分,加权满意度构成细粒度奖励信号,并通过组相对策略优化进行模型更新。由于评分标准仅基于文本生成,RULER无需配对的SVG标准答案或人工偏好标签。在MMSVG-Illustration和MMSVG-Icon数据集上,RULER将评分标准得分从0.432/0.395提升至0.693/0.683,超越专业SVG生成模型并达到与体量更大的DeepSeek-V3相当的水平。消融实验证实评分标准设计是驱动开放式SVG生成强化学习的关键要素。项目主页:https://hangyuran.github.io/RULER/

查看arXiv页面 (https://arxiv.org/abs/2609.25270) 查看PDF (https://arxiv.org/pdf/2609.25270) 项目主页 (https://hangyuran.github.io/RULER/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.25270)

通过代理获取本文:
hf papers read 2609.25270

未安装最新版命令行工具?运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

暂无模型关联本文
在模型README.md中引用 arxiv.org/abs/2609.25270 即可从此页面建立关联

引用本文的数据集 0

暂无数据集关联本文
在数据集README.md中引用 arxiv.org/abs/2609.25270 即可从此页面建立关联

引用本文的空间 0

暂无空间关联本文
在空间README.md中引用 arxiv.org/abs/2609.25270 即可从此页面建立关联

包含本文的合集 0

暂无合集包含本文
将本文添加至合集 (https://huggingface.co/new-collection) 即可从此页面建立关联

相似文章