GRNEdit:基于生成细化网络中新二进制证据视角的高效通用视频编辑

Hugging Face Daily Papers 论文

摘要

GRNEdit是一个轻量级的两阶段框架,用于高效通用视频编辑,通过使用二进制语义决策和源证据,以比大型模型更少的参数实现高性能。

基于指令的通用视频编辑旨在将多样化的编辑操作统一在一个直观的界面中。现有方法通常依赖于资源密集型的条件处理,使用重型分支或昂贵的源拼接。是否有更高效的方式来建模编辑意图?因此,我们引入了GRNEdit,一个轻量级的两阶段框架。GRN通过比特组合编码视觉语义,启发了我们的方法。通过任务特定的微调,我们进一步将这种表示扩展,将编辑语义重新塑造为对每个比特的本地保留或翻转决策。因此,源信息被建模为支持观察到的二进制状态的逐坐标证据,而GRN主干网络负责将它们的全局组合解析为连贯的生成语义。在第一阶段,一个紧凑的编码器将离散的源代码转换为连续的证据信号,GRN在整个二进制细化过程中吸收这些信号。受无分类器引导的空提示训练启发,我们进一步为空条件赋予编辑特定的含义:空指令表示不进行编辑,并通过源重建进行监督。这条恒等路径不仅隐式地加强了第一阶段的证据利用和内容保留,还在与编辑状态相同的表示空间中产生了一个保留源的状态。因此,第二阶段可以直接将每个编辑状态与其保留源的对应状态进行比较,并利用它们的差异来修正未解决的目标比特决策。仅在0.6M对数据上训练,条件参数少于3%,GRNEdit-2B和GRNEdit-8B在OpenVE-Bench上分别获得了4.03和4.18的分数。2B模型超越了多个14B的开源编辑器,而8B模型的表现与领先的开源编辑器相当。
查看原文
查看缓存全文

缓存时间: 2026/08/18 11:51

论文页面 - GRNEdit:基于生成细化网络二元证据新视角的高效通用视频编辑

来源:https://huggingface.co/papers/2608.16328
发布于 8月17日

·

由 https://huggingface.co/HigherHu 提交

Higher (https://huggingface.co/HigherHu) 于 8月18日

摘要

GRNEdit 是一个轻量级的两阶段框架,通过二元语义决策与源证据对视频编辑意图进行建模,在极少量参数下实现了优异效果。

基于指令的通用视频编辑旨在将多样化的编辑操作统一到一个直观的接口中。现有方法通常依赖于资源密集型的条件处理,要么使用重型分支,要么依赖高成本的源拼接。是否存在一种高效的方法来建模编辑意图?为此,我们引入了 GRNEdit (https://huggingface.co/papers?q=GRNEdit),一个轻量级的两阶段框架。我们的方法受 GRN(生成细化网络)启发,通过比特的组合编码视觉语义。通过任务特定的微调,我们进一步发展了这一表示,将编辑语义重新定义为针对每个比特的局部“保留或翻转”决策。源信息因此被建模为支持观测到的二元状态的坐标级证据 (https://huggingface.co/papers?q=coordinate-wise%20evidence),而 GRN 骨干网络则负责将其全局组合解析为连贯的生成语义。在第一阶段,一个紧凑的编码器将离散的源代码转换为连续的证据信号,GRN 通过二元细化 (https://huggingface.co/papers?q=binary%20refinement) 过程吸收这些信号。受空提示训练 (https://huggingface.co/papers?q=null-prompt%20training)(用于无分类器引导 (https://huggingface.co/papers?q=classifier-free%20guidance))的启发,我们进一步为空条件赋予了编辑特定的含义:空指令表示无编辑操作,并通过源重建进行监督。这条恒等通路 (https://huggingface.co/papers?q=identity%20pathway) 不仅在第一阶段隐式地增强了证据利用和内容保留,还在与编辑状态相同的表示空间中产生了一个源保留状态 (https://huggingface.co/papers?q=source-preserving%20state)。因此,第二阶段可以直接将每个编辑状态与其对应的源保留状态进行比较,并利用它们的差异来修正未解决的目标比特决策。仅使用 0.6M 对数据进行训练,条件参数不到 3%,GRNEdit (https://huggingface.co/papers?q=GRNEdit)-2B 和 GRNEdit (https://huggingface.co/papers?q=GRNEdit)-8B 在 OpenVE-Bench (https://huggingface.co/papers?q=OpenVE-Bench) 上分别取得了 4.03 和 4.18 的分数。2B 模型超越了多个 14B 开源编辑器,而 8B 模型的表现与领先的开源编辑器相当。

查看 arXiv 页面 (https://arxiv.org/abs/2608.16328) | 查看 PDF (https://arxiv.org/pdf/2608.16328) | 项目页面 (https://foxerity.github.io/GRNEdit/) | GitHub4 (https://github.com/Foxerity/GRNEdit) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16328)

通过您的代理获取此论文:

hf papers read 2608\.16328

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2608.16328 以从本页链接它。

引用本文的数据集 0

没有数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2608.16328 以从本页链接它。

引用本文的 Spaces 0

没有 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2608.16328 以从本页链接它。

包含本文的收藏 0

没有收藏包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

流式视频编辑与便捷适配

Hugging Face Daily Papers

本文介绍了SVEET,一个用于高质量流式视频编辑的框架,它利用预训练的视频扩散模型,实现自动回归编辑,并在单个GPU上实现实时性能。