HP-Edit:面向图像编辑的人类偏好后训练框架
摘要
HP-Edit 提出一种后训练框架,通过 RLHF 将基于扩散的图像编辑模型与人类偏好对齐,依托全新 5 万张真实场景数据集及自动 VLM 评估器。
查看缓存全文
缓存时间: 2026/04/22 10:35
论文页 - HP-Edit:面向图像编辑的人偏好后训练框架
来源:https://huggingface.co/papers/2604.19406
作者:
,
,
,
,
,
,
,
,
,
,
摘要
我们提出一种后训练框架 HP-Edit,通过新型自动评估器与真实世界数据集,将图像编辑模型与人类偏好对齐,并利用强化学习技术提升编辑质量。
常见图像编辑任务普遍采用强大的生成式扩散模型作为现实内容编辑的主流范式。与此同时,尽管 Diffusion-DPO、Flow-GRPO 等强化学习(RL)方法进一步提升了生成质量,但由于缺乏可扩展的人类偏好数据集以及面向多样化编辑需求的框架,将基于扩散的编辑与人类反馈强化学习(RLHF)高效结合仍属空白。为此,我们提出 HP-Edit——面向人类偏好对齐编辑的后训练框架,并发布 RealPref-50K,一个涵盖八类常见任务、兼顾常见物体编辑的真实世界数据集。具体而言,HP-Edit 利用少量人类偏好评分数据与预训练的视觉大语言模型(VLM),训练出与人类偏好对齐的自动评估器——HP-Scorer。随后,我们使用 HP-Scorer 高效构建可扩展的偏好数据集,并将其作为奖励函数对编辑模型进行后训练。此外,我们提出 RealPref-Bench,用于评估真实世界编辑性能。大量实验表明,该方法显著提升 Qwen-Image-Edit-2509 等模型的输出,与人类偏好更加一致。
查看 arXiv 页面(https://arxiv.org/abs/2604.19406)
查看 PDF(https://arxiv.org/pdf/2604.19406)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.19406)
在智能体中获取本文:
hf papers read 2604.19406
尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型关联该论文
在模型 README.md 中引用 arxiv.org/abs/2604.19406 即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集关联该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.19406 即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 关联该论文
在 Space README.md 中引用 arxiv.org/abs/2604.19406 即可在此页面显示链接。
收录该论文的合集 0
暂无合集收录该论文
将该论文添加到新建合集即可在此页面显示链接。
相似文章
Edit-Compass & EditReward-Compass: 图像编辑与奖励建模的统一基准
介绍了Edit-Compass和EditReward-Compass,这是一个用于评估图像编辑模型和奖励模型的统一基准套件,包含2,388个标注实例和2,251个偏好对,用于真实的强化学习场景。
Uni-Edit:智能编辑是统一模型调优的通用任务
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
Qwen-Image-2.0-RL 技术报告
本技术报告介绍了 Qwen-Image-2.0-RL,这是一个基于强化学习与人类反馈及在策略蒸馏的后训练流程,旨在提升图像生成与编辑任务中的视觉质量和指令遵循能力。
从计划到像素:学习规划和编排实现开放式图像编辑
一个针对长序列图像编辑的体验式框架,将规划与奖励驱动的执行相结合,以提高复杂多步编辑的连贯性和可靠性。
RewardHarness:自演进的代理式后训练框架
RewardHarness 是一个用于后训练的自演进代理框架,通过迭代优化工具和技能库来替代大规模偏好标注,在图像编辑评估基准上的表现优于 GPT-5。