多轮图像编辑的在线自蒸馏
摘要
本文提出MT-OPSD,一个非策略自蒸馏框架,以解决多轮图像编辑中的退化问题,并引入LME-Bench用于评估长期鲁棒性。
查看缓存全文
缓存时间: 2026/09/29 08:14
论文页面 - 面向多轮图像编辑的在线策略自蒸馏
来源: https://huggingface.co/papers/2609.35611
摘要
基于指令的图像编辑在单轮编辑任务中已展现出优异性能,但实际编辑过程往往是迭代进行的,每一条新指令都需要应用于上一轮的输出结果。我们发现现有编辑模型在递归编辑下性能会迅速下降,其原因在于训练与推理时的条件分布存在不匹配:模型在训练时使用的是干净的源图像,但在推理时却必须反复以自身生成的不完美输出作为条件。为解决这一问题,我们提出MT-OPSD,这是一个在线策略自蒸馏框架。它利用模型自身生成的条件状态进行训练,并通过一个基于干净条件输入的教师模型提供编辑监督,而无需多轮编辑的标注数据。我们进一步引入了LME-Bench,这是一个包含100个十轮编辑会话的基准测试,用于评估模型在长时程任务中的鲁棒性。在三个不同编辑骨干网络上的实验表明,MT-OPSD显著提升了长时程编辑的成功率,减少了多轮编辑的崩溃现象,同时基本保留了单轮编辑的质量。
查看 arXiv 页面 (https://arxiv.org/abs/2609.35611)查看 PDF (https://arxiv.org/pdf/2609.35611)项目页面 (https://liangbingzhao.github.io/MT-OPSD/)GitHub1 (https://github.com/liangbingzhao/MT-OPSD)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.35611)
在您的智能体中获取此论文:
hf papers read 2609\.35611
还没有最新版本的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型链接本论文
在模型的 README.md 中引用 arxiv.org/abs/2609.35611 以将其链接到本页面。
引用本论文的数据集0
没有数据集链接本论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.35611 以将其链接到本页面。
引用本论文的 Spaces0
没有 Space 链接本论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.35611 以将其链接到本页面。
包含本论文的收藏集1
相似文章
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。
无需任何监督的同策略自蒸馏
介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。
β-OPSD:以策略优化推导,以自蒸馏训练
本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。
SMOPD: 用于脏历史多轮在策略自蒸馏的选择性令牌熵掩蔽
SMOPD是一种仅使用损失的稳定方法,用于多轮在策略自蒸馏,通过选择性令牌熵掩蔽来提高脏历史设置下的准确性,并展示了在Qwen3模型上的改进。
潜在同策略自蒸馏 (LOPD)
本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。