接下来编辑什么:对话系统中视觉对齐的图像编辑后续建议

Hugging Face Daily Papers 论文

摘要

一个三阶段多模态框架改进了对话式图像生成系统中的后续编辑推荐,利用SFT、多目标强化学习和视觉验证来减少视觉不一致性,并在实时A/B测试中提升参与度指标。

对话式助手越来越多地推荐后续编辑,以帮助用户继续任务。现有系统主要针对纯文本交互,图像创作对话尚未得到充分探索。在图像创作任务中,有用的后续编辑建议必须反映用户偏好、提供多样化的方向,并且能够在当前图像上执行。我们从 Qwen App 收集了 100,000 个真实的多轮图像创作对话样本,发现其中 80.1% 依赖于图像,这凸显了多模态推荐的必要性。我们使用三阶段框架来应对这一场景。在第一阶段,我们利用真实在线数据构建一个经过人工审核的合适后续编辑意图表,然后创建 SFT 目标并微调多模态策略。在第二阶段,为了使规则引导的 SFT 建议与真实用户选择保持一致,我们利用用户点击反馈,通过多目标强化学习优化策略。在第三阶段,为了减少建议编辑与当前图像之间的视觉不一致,我们引入视觉验证器作为额外的训练监督。大量实验表明,我们的框架在自动评估和人工评估上都显著优于基线。在一项涉及数百万用户的实时用户随机 A/B 测试中,我们的最终框架将视觉不一致率从 3.7% 降至 0.9%。此外,它还显著提高了推荐点击率 32.70%、图像采纳率 16.32% 以及每用户平均对话轮次 39.90%(所有 p<0.05)。
查看原文
查看缓存全文

缓存时间: 2026/08/11 10:21

论文页面 - 接下来编辑什么:对话系统中视觉对齐的图像编辑后续建议

Source: https://huggingface.co/papers/2608.07565

摘要

对话助手越来越多地推荐后续编辑,以帮助用户继续任务。现有系统主要针对纯文本交互,图像创作对话尚未得到充分探索。在图像创作任务中,有用的后续编辑建议必须反映用户偏好、提供多样化的方向,并且能够在当前图像上执行。我们从 Qwen App 收集了 100,000 个真实的多轮图像创作对话样本,发现其中 80.1% 依赖于图像,这凸显了多模态推荐的必要性。我们通过一个三阶段框架来解决这一问题。在第一阶段,我们使用真实在线数据构建一个经过人工审核的合适后续编辑意图表,然后创建 SFT 目标并微调多模态策略(https://huggingface.co/papers?q=multimodal%20policy)。在第二阶段,为了使规则引导的 SFT 建议与真实用户选择对齐,我们利用用户点击反馈,通过多目标强化学习(https://huggingface.co/papers?q=multi-objective%20reinforcement%20learning)优化策略。在第三阶段,为了减少建议编辑与当前图像之间的视觉不一致性,我们引入视觉验证器(https://huggingface.co/papers?q=visual%20verifier)作为额外的训练监督。大量实验表明,我们的框架在自动评估和人工评估上都显著优于基线。在数百万用户参与的实时随机 A/B 测试中,我们的最终框架将视觉不一致性从 3.7% 降至 0.9%。此外,它将推荐点击率(CTR)显著提高了 32.70%,图像带走率提高了 16.32%,每位用户的平均对话轮次提高了 39.90%(所有 p<0.05)。

查看 arXiv 页面 (https://arxiv.org/abs/2608.07565) 查看 PDF (https://arxiv.org/pdf/2608.07565) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.07565)

在您的 agent 中获取此论文:

hf papers read 2608\.07565

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.07565 以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.07565 以从此页面链接。

引用此论文的 Spaces0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.07565 以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将这篇论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。

相似文章

文本-视觉协同指导的图像编辑

Hugging Face Daily Papers

一种名为TV-Edit的新框架,结合文本指令和视觉提示实现精确图像编辑,并附带基准TV-Edit-Bench用于评估。该方法在空间控制和语义忠实度上优于现有方法。

这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准

Hugging Face Daily Papers

本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。