接下来编辑什么:对话系统中视觉对齐的图像编辑后续建议
摘要
一个三阶段多模态框架改进了对话式图像生成系统中的后续编辑推荐,利用SFT、多目标强化学习和视觉验证来减少视觉不一致性,并在实时A/B测试中提升参与度指标。
查看缓存全文
缓存时间: 2026/08/11 10:21
论文页面 - 接下来编辑什么:对话系统中视觉对齐的图像编辑后续建议
Source: https://huggingface.co/papers/2608.07565
摘要
对话助手越来越多地推荐后续编辑,以帮助用户继续任务。现有系统主要针对纯文本交互,图像创作对话尚未得到充分探索。在图像创作任务中,有用的后续编辑建议必须反映用户偏好、提供多样化的方向,并且能够在当前图像上执行。我们从 Qwen App 收集了 100,000 个真实的多轮图像创作对话样本,发现其中 80.1% 依赖于图像,这凸显了多模态推荐的必要性。我们通过一个三阶段框架来解决这一问题。在第一阶段,我们使用真实在线数据构建一个经过人工审核的合适后续编辑意图表,然后创建 SFT 目标并微调多模态策略(https://huggingface.co/papers?q=multimodal%20policy)。在第二阶段,为了使规则引导的 SFT 建议与真实用户选择对齐,我们利用用户点击反馈,通过多目标强化学习(https://huggingface.co/papers?q=multi-objective%20reinforcement%20learning)优化策略。在第三阶段,为了减少建议编辑与当前图像之间的视觉不一致性,我们引入视觉验证器(https://huggingface.co/papers?q=visual%20verifier)作为额外的训练监督。大量实验表明,我们的框架在自动评估和人工评估上都显著优于基线。在数百万用户参与的实时随机 A/B 测试中,我们的最终框架将视觉不一致性从 3.7% 降至 0.9%。此外,它将推荐点击率(CTR)显著提高了 32.70%,图像带走率提高了 16.32%,每位用户的平均对话轮次提高了 39.90%(所有 p<0.05)。
查看 arXiv 页面 (https://arxiv.org/abs/2608.07565) 查看 PDF (https://arxiv.org/pdf/2608.07565) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.07565)
在您的 agent 中获取此论文:
hf papers read 2608\.07565
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.07565 以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.07565 以从此页面链接。
引用此论文的 Spaces0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.07565 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将这篇论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。
相似文章
文本-视觉协同指导的图像编辑
一种名为TV-Edit的新框架,结合文本指令和视觉提示实现精确图像编辑,并附带基准TV-Edit-Bench用于评估。该方法在空间控制和语义忠实度上优于现有方法。
Uni-Edit:智能编辑是统一模型调优的通用任务
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
从计划到像素:学习规划和编排实现开放式图像编辑
一个针对长序列图像编辑的体验式框架,将规划与奖励驱动的执行相结合,以提高复杂多步编辑的连贯性和可靠性。
这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准
本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。
HP-Edit:面向图像编辑的人类偏好后训练框架
HP-Edit 提出一种后训练框架,通过 RLHF 将基于扩散的图像编辑模型与人类偏好对齐,依托全新 5 万张真实场景数据集及自动 VLM 评估器。