FlowMimic: 基于像素对扭曲流场的无掩码视觉编辑与生成——面向在线视频编辑数据生成与模态模仿
摘要
FlowMimic 提出了一种方法,利用像素对扭曲流场实现跨视频和图像模态的无掩码视觉编辑与生成,能够从图像编辑样本实时生成视频编辑数据,并通过模仿损失对齐模态能力。
查看缓存全文
缓存时间: 2026/07/21 10:36
论文页面 - FlowMimic:无需掩码的视觉编辑与生成——基于像素对扭曲流场的在线视频编辑数据生成与模态模仿
来源:https://huggingface.co/papers/2607.18227
摘要
顺应视觉研究的主流方向,我们探索在单一模型中整合视频与图像模态的生成与编辑能力。当前收集视频编辑数据的典型方法依赖于繁琐耗时的人工筛选流程——包括对象掩码标注、通过I2V模型与ControlNet式引导进行易出错的配对合成、以及基于VLM的质量过滤或优化——并且任务扩展性有限。因此,可支持的编辑任务多样性远不及图像编辑模型。我们开发了一种像素对时间扭曲流场,能够直接从图像编辑样本实时生成对应的视频编辑样本,并证明模型仅需此类数据即可学习视频编辑。我们将图像模态视为视频模态的一种特殊形式。据此,我们设计了模态模仿生成损失和模态模仿编辑损失,通过相互模仿使两种模态的能力(从而输出分布)相对对齐。此外,基于语言的视觉编辑要求理解编辑指令与参考视觉内容、定位参考视觉内容中指令对应的区域、并修改该区域。现有方法主要依赖外部辅助,例如微调额外的多模态大语言模型,或在推理时显式提供掩码序列作为辅助输入。相比之下,我们希望模型内化这一能力。为此,我们引入感知相关任务(如指代分割),并配套相应的编辑区域感知潜在级损失和注意力级损失。
查看arXiv页面 (https://arxiv.org/abs/2607.18227)
查看PDF (https://arxiv.org/pdf/2607.18227)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18227)
引用本文的模型 0
尚无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.18227 以便从此页面链接它。
引用本文的数据集 1
FlowMimic/Uncompressed 更新于约7小时前 • 13 (https://huggingface.co/datasets/FlowMimic/Uncompressed)
引用本文的Space 0
尚无Space链接此论文
请在Space README.md中引用 arxiv.org/abs/2607.18227 以便从此页面链接它。
包含本文的收藏 0
尚无收藏包含此论文
请将此论文添加到收藏 (https://huggingface.co/new-collection) 以便从此页面链接它。
相似文章
MIMFlow: 集成掩码图像建模与归一化流的端到端图像生成
MIMFlow 集成了掩码图像建模与归一化流,用于端到端图像生成,在 ImageNet 256x256 上实现了 2.50 的 FID,且使用的 token 数量比标准模型少 50%。
Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。
STARFlow2:连接语言模型与归一化流以实现统一的多模态生成
STARFlow2 是一项新的研究论文,介绍了一种将语言模型与自回归归一化流相结合的架构,用于统一的多模态生成。它通过使用共享的因果掩码机制处理交错的文本-图像序列,解决了现有系统中的结构不匹配问题。
掩码语言流模型
本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。
DanceOPD:基于策略的生成场蒸馏
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。