多轮图像编辑的在线自蒸馏

Hugging Face Daily Papers 论文

摘要

本文提出MT-OPSD,一个非策略自蒸馏框架,以解决多轮图像编辑中的退化问题,并引入LME-Bench用于评估长期鲁棒性。

基于指令的图像编辑在单轮设置中表现出色,但实际编辑往往是迭代的,每个指令都应用于上一轮的输出。我们发现现有编辑模型在递归编辑下迅速退化,并将此归因于条件分布中的训练-测试不匹配:模型在干净源图像上训练,但在推理时必须反复以其自身的不完美输出作为条件。为解决此问题,我们提出MT-OPSD,一个在线自蒸馏框架,该框架在模型自生成的条件状态下进行训练,使用干净条件教师的编辑监督,无需多轮标注。我们进一步引入LME-Bench,一个包含100个十轮编辑会话的基准,用于评估长期鲁棒性。在三个编辑骨干网络上的实验表明,MT-OPSD显著提高了长期编辑成功率并减少了多轮崩溃,同时在很大程度上保持了单轮编辑质量。
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:14

论文页面 - 面向多轮图像编辑的在线策略自蒸馏

来源: https://huggingface.co/papers/2609.35611

摘要

基于指令的图像编辑在单轮编辑任务中已展现出优异性能,但实际编辑过程往往是迭代进行的,每一条新指令都需要应用于上一轮的输出结果。我们发现现有编辑模型在递归编辑下性能会迅速下降,其原因在于训练与推理时的条件分布存在不匹配:模型在训练时使用的是干净的源图像,但在推理时却必须反复以自身生成的不完美输出作为条件。为解决这一问题,我们提出MT-OPSD,这是一个在线策略自蒸馏框架。它利用模型自身生成的条件状态进行训练,并通过一个基于干净条件输入的教师模型提供编辑监督,而无需多轮编辑的标注数据。我们进一步引入了LME-Bench,这是一个包含100个十轮编辑会话的基准测试,用于评估模型在长时程任务中的鲁棒性。在三个不同编辑骨干网络上的实验表明,MT-OPSD显著提升了长时程编辑的成功率,减少了多轮编辑的崩溃现象,同时基本保留了单轮编辑的质量。

查看 arXiv 页面 (https://arxiv.org/abs/2609.35611)查看 PDF (https://arxiv.org/pdf/2609.35611)项目页面 (https://liangbingzhao.github.io/MT-OPSD/)GitHub1 (https://github.com/liangbingzhao/MT-OPSD)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.35611)

在您的智能体中获取此论文:

hf papers read 2609\.35611

还没有最新版本的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

没有模型链接本论文

在模型的 README.md 中引用 arxiv.org/abs/2609.35611 以将其链接到本页面。

引用本论文的数据集0

没有数据集链接本论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.35611 以将其链接到本页面。

引用本论文的 Spaces0

没有 Space 链接本论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.35611 以将其链接到本页面。

包含本论文的收藏集1

相似文章

无需任何监督的同策略自蒸馏

Hugging Face Daily Papers

介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。

β-OPSD:以策略优化推导,以自蒸馏训练

Hugging Face Daily Papers

本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。

潜在同策略自蒸馏 (LOPD)

Hugging Face Daily Papers

本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。