Qwen-Image-2.0-RL 技术报告

Hugging Face Daily Papers 论文

摘要

本技术报告介绍了 Qwen-Image-2.0-RL,这是一个基于强化学习与人类反馈及在策略蒸馏的后训练流程,旨在提升图像生成与编辑任务中的视觉质量和指令遵循能力。

我们提出了 Qwen-Image-2.0-RL,这是一个后训练流程,应用了基于人类反馈的强化学习(RLHF)和在策略蒸馏(OPD)来提升 Qwen-Image-2.0 扩散模型的视觉质量和指令遵循能力。为了提供可靠的奖励信号,我们通过微调视觉语言模型,采用逐点评分范式和思维链推理,构建了任务特定的复合奖励模型。对于文本到图像的生成,奖励模型涵盖了对齐、美学和人像保真度等维度。对于图像编辑任务,奖励系统处理了指令遵循准确度和人脸身份保留。基于此奖励系统,我们开发了一个可扩展的基于 GRPO 的 RL 训练框架,融合了混合无分类器指导(CFG)策略以保留预训练知识、通过组内奖励范围过滤进行提示语筛选,以及每类奖励权重校准。为了合并 T2I 和编辑任务专用的 RL 策略,我们提出了在策略蒸馏作为最终训练阶段,通过轨迹级速度匹配将多个教师模型整合到一个学生模型中。广泛的评估表明,Qwen-Image-2.0-RL 在 Qwen-Image-Bench 上取得了 57.84 的总分(比基础模型提升 2.61),在文本到图像竞技场中的 Elo 评级为 1193(+78),在图像编辑竞技场中为 1349(+93),展示了在美学质量、提示遵循和编辑准确性方面的一致提升。
查看原文
查看缓存全文

缓存时间: 2026/06/29 02:00

论文页面 - Qwen-Image-2.0-RL 技术报告

来源:https://huggingface.co/papers/2606.27608 发布日期:6月25日

#2 今日论文 (https://huggingface.co/papers/date/2026-06-29) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

一种强化学习与在线策略蒸馏方法,增强了扩散模型在图像生成和编辑任务中的视觉质量与指令遵循能力。

我们提出 Qwen-Image-2.0-RL,这是一套后训练流程,通过引入基于人类反馈的强化学习 (https://huggingface.co/papers?q=reinforcement%20learning%20from%20human%20feedback)(RLHF)和在线策略蒸馏 (https://huggingface.co/papers?q=on-policy%20distillation)(OPD),同时提升 Qwen-Image-2.0 扩散模型的视觉质量和指令遵循能力。为了提供可靠的奖励信号,我们通过微调视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models),结合逐点评分范式 (https://huggingface.co/papers?q=pointwise%20scoring%20paradigm) 和思维链推理 (https://huggingface.co/papers?q=chain-of-thought%20reasoning),构建了任务特定的复合奖励模型。对于文本到图像生成 (https://huggingface.co/papers?q=text-to-image%20generation) 任务,奖励模型覆盖了对齐度、美学和人像保真度三个维度;对于图像编辑 (https://huggingface.co/papers?q=image%20editing) 任务,奖励体系则针对指令遵循准确度和人脸身份保持进行了优化。基于此奖励体系,我们开发了可扩展的基于 GRPO 的强化学习训练框架 (https://huggingface.co/papers?q=GRPO-based%20RL%20training%20framework),融合了混合无分类器指导 (https://huggingface.co/papers?q=hybrid%20classifier-free%20guidance)(CFG)策略以保留预训练知识、通过组内奖励范围过滤 (https://huggingface.co/papers?q=intra-group%20reward%20range%20filtering) 进行提示筛选,以及按类别奖励权重校准 (https://huggingface.co/papers?q=per-category%20reward%20weight%20calibration)。为了合并面向文本到图像生成和编辑任务的特化强化学习策略,我们提出采用在线策略蒸馏 (https://huggingface.co/papers?q=on-policy%20distillation) 作为最终训练阶段,通过轨迹级速度匹配 (https://huggingface.co/papers?q=trajectory-level%20velocity%20matching) 将多个教师模型合并为单个学生模型。大量评估表明,Qwen-Image-2.0-RL 在 Qwen-Image-Bench 上取得了 57.84 的综合得分(比基础模型高 2.61),在文本到图像竞技场中的 Elo 评分为 1193(+78),在图像编辑竞技场中的 Elo 评分为 1349(+93),在美学质量、提示遵循度和编辑准确性方面均表现出持续提升。

查看 arXiv 页面 (https://arxiv.org/abs/2606.27608) 查看 PDF (https://arxiv.org/pdf/2606.27608) 收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.27608)

引用此论文的模型0

尚无模型关联此论文

请在模型的 README.md 中引用 arxiv.org/abs/2606.27608 以在此页面关联。

引用此论文的数据集0

尚无数据集关联此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2606.27608 以在此页面关联。

引用此论文的 Space0

尚无 Space 关联此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2606.27608 以在此页面关联。

包含此论文的收藏集0

尚无包含此论文的收藏集

请将此论文加入收藏集 (https://huggingface.co/new-collection) 以在此页面关联。

相似文章

Qwen-Image-Flash(26分钟阅读)

TLDR AI

本文来自阿里巴巴,重新审视了视觉生成模型的少步蒸馏,聚焦于训练配方因素如数据组成、教师指导和任务混合,以Qwen-Image-2.0为案例研究,开发了Qwen-Image-Flash。

Qwen-Image-2.0 技术报告

Hugging Face Daily Papers

Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。

Qwen-Image-Flash:超越目标设计

Hugging Face Daily Papers

本文研究了视觉生成模型的少步蒸馏训练策略,以Qwen-Image-2.0为例。它揭示了非直观行为,并提出了Qwen-Image-Flash。