FlowMimic: 基于像素对扭曲流场的无掩码视觉编辑与生成——面向在线视频编辑数据生成与模态模仿

Hugging Face Daily Papers 论文

摘要

FlowMimic 提出了一种方法,利用像素对扭曲流场实现跨视频和图像模态的无掩码视觉编辑与生成,能够从图像编辑样本实时生成视频编辑数据,并通过模仿损失对齐模态能力。

遵循视觉研究的主流方向,我们探索在单一模型中整合视频与图像模态的生成及编辑能力。当前收集视频编辑数据的常用方法依赖于耗时费力的人工流程——涉及对象掩码标注、通过 I2V 模型和 ControlNet 类引导进行易引入误差的配对合成,以及基于 VLM 的质量过滤或精炼——且任务扩展性有限。因此,视频编辑任务的多样性远不如图像编辑模型所能覆盖的范围。我们开发了一种像素对时间扭曲流场,可从图像编辑样本实时直接生成对应的视频编辑样本,并在多个层次的视频编辑任务上证明,模型仅需此类数据即可学习视频编辑。我们将图像模态视为视频模态的一种特殊形式,据此设计了一种模态模仿生成损失和一种模态模仿编辑损失,通过相互模仿来相对对齐两种模态的能力(进而对齐输出分布)。此外,基于语言的视觉编辑需要理解编辑指令和参考视觉内容、定位参考视觉内容中与指令对应的区域,并仅修改该区域。现有方法主要依赖外部辅助,例如微调额外的 MLLM 或在推理时显式提供掩码序列作为辅助输入。相比之下,我们希望模型内化这一能力。为此,我们引入了感知相关任务(如指代表达分割)以及相应的编辑区域感知的隐空间级别损失和注意力级别损失。
查看原文
查看缓存全文

缓存时间: 2026/07/21 10:36

论文页面 - FlowMimic:无需掩码的视觉编辑与生成——基于像素对扭曲流场的在线视频编辑数据生成与模态模仿

来源:https://huggingface.co/papers/2607.18227

摘要

顺应视觉研究的主流方向,我们探索在单一模型中整合视频与图像模态的生成与编辑能力。当前收集视频编辑数据的典型方法依赖于繁琐耗时的人工筛选流程——包括对象掩码标注、通过I2V模型与ControlNet式引导进行易出错的配对合成、以及基于VLM的质量过滤或优化——并且任务扩展性有限。因此,可支持的编辑任务多样性远不及图像编辑模型。我们开发了一种像素对时间扭曲流场,能够直接从图像编辑样本实时生成对应的视频编辑样本,并证明模型仅需此类数据即可学习视频编辑。我们将图像模态视为视频模态的一种特殊形式。据此,我们设计了模态模仿生成损失和模态模仿编辑损失,通过相互模仿使两种模态的能力(从而输出分布)相对对齐。此外,基于语言的视觉编辑要求理解编辑指令与参考视觉内容、定位参考视觉内容中指令对应的区域、并修改该区域。现有方法主要依赖外部辅助,例如微调额外的多模态大语言模型,或在推理时显式提供掩码序列作为辅助输入。相比之下,我们希望模型内化这一能力。为此,我们引入感知相关任务(如指代分割),并配套相应的编辑区域感知潜在级损失和注意力级损失。

查看arXiv页面 (https://arxiv.org/abs/2607.18227)
查看PDF (https://arxiv.org/pdf/2607.18227)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18227)

引用本文的模型 0

尚无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.18227 以便从此页面链接它。

引用本文的数据集 1

FlowMimic/Uncompressed 更新于约7小时前 • 13 (https://huggingface.co/datasets/FlowMimic/Uncompressed)

引用本文的Space 0

尚无Space链接此论文

请在Space README.md中引用 arxiv.org/abs/2607.18227 以便从此页面链接它。

包含本文的收藏 0

尚无收藏包含此论文

请将此论文添加到收藏 (https://huggingface.co/new-collection) 以便从此页面链接它。

相似文章

Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑

Hugging Face Daily Papers

Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。

掩码语言流模型

arXiv cs.CL

本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。

DanceOPD:基于策略的生成场蒸馏

Hugging Face Daily Papers

DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。