GRNEdit:基于生成细化网络中新二进制证据视角的高效通用视频编辑
摘要
GRNEdit是一个轻量级的两阶段框架,用于高效通用视频编辑,通过使用二进制语义决策和源证据,以比大型模型更少的参数实现高性能。
查看缓存全文
缓存时间: 2026/08/18 11:51
论文页面 - GRNEdit:基于生成细化网络二元证据新视角的高效通用视频编辑
来源:https://huggingface.co/papers/2608.16328
发布于 8月17日
·
由 https://huggingface.co/HigherHu 提交
Higher (https://huggingface.co/HigherHu) 于 8月18日
摘要
GRNEdit 是一个轻量级的两阶段框架,通过二元语义决策与源证据对视频编辑意图进行建模,在极少量参数下实现了优异效果。
基于指令的通用视频编辑旨在将多样化的编辑操作统一到一个直观的接口中。现有方法通常依赖于资源密集型的条件处理,要么使用重型分支,要么依赖高成本的源拼接。是否存在一种高效的方法来建模编辑意图?为此,我们引入了 GRNEdit (https://huggingface.co/papers?q=GRNEdit),一个轻量级的两阶段框架。我们的方法受 GRN(生成细化网络)启发,通过比特的组合编码视觉语义。通过任务特定的微调,我们进一步发展了这一表示,将编辑语义重新定义为针对每个比特的局部“保留或翻转”决策。源信息因此被建模为支持观测到的二元状态的坐标级证据 (https://huggingface.co/papers?q=coordinate-wise%20evidence),而 GRN 骨干网络则负责将其全局组合解析为连贯的生成语义。在第一阶段,一个紧凑的编码器将离散的源代码转换为连续的证据信号,GRN 通过二元细化 (https://huggingface.co/papers?q=binary%20refinement) 过程吸收这些信号。受空提示训练 (https://huggingface.co/papers?q=null-prompt%20training)(用于无分类器引导 (https://huggingface.co/papers?q=classifier-free%20guidance))的启发,我们进一步为空条件赋予了编辑特定的含义:空指令表示无编辑操作,并通过源重建进行监督。这条恒等通路 (https://huggingface.co/papers?q=identity%20pathway) 不仅在第一阶段隐式地增强了证据利用和内容保留,还在与编辑状态相同的表示空间中产生了一个源保留状态 (https://huggingface.co/papers?q=source-preserving%20state)。因此,第二阶段可以直接将每个编辑状态与其对应的源保留状态进行比较,并利用它们的差异来修正未解决的目标比特决策。仅使用 0.6M 对数据进行训练,条件参数不到 3%,GRNEdit (https://huggingface.co/papers?q=GRNEdit)-2B 和 GRNEdit (https://huggingface.co/papers?q=GRNEdit)-8B 在 OpenVE-Bench (https://huggingface.co/papers?q=OpenVE-Bench) 上分别取得了 4.03 和 4.18 的分数。2B 模型超越了多个 14B 开源编辑器,而 8B 模型的表现与领先的开源编辑器相当。
查看 arXiv 页面 (https://arxiv.org/abs/2608.16328) | 查看 PDF (https://arxiv.org/pdf/2608.16328) | 项目页面 (https://foxerity.github.io/GRNEdit/) | GitHub4 (https://github.com/Foxerity/GRNEdit) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16328)
通过您的代理获取此论文:
hf papers read 2608\.16328
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2608.16328 以从本页链接它。
引用本文的数据集 0
没有数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2608.16328 以从本页链接它。
引用本文的 Spaces 0
没有 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2608.16328 以从本页链接它。
包含本文的收藏 0
没有收藏包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
精炼本质上是可编辑的:基于生成精炼网络的免训练提示到提示图像编辑
RefineEdit 是一种免训练的提示到提示图像编辑方法,它使用生成精炼网络来增强编辑定位和背景保留,实现了顶级的基准分数。
一个编辑器,多样编辑:面向多样视频编辑的统一无训练框架
EditVid是一个统一的无训练视频编辑框架,利用稀疏因果记忆、令牌注入和软潜在混合,支持指令引导和主题引导的编辑,实现高保真并在基准测试中优于基线方法。
Crayotter:通过组相对偏好反向传播学习长视界视频编辑智能体
Crayotter 引入了组相对偏好反向传播(GRPB),一种训练长视界视频编辑智能体的方法,利用任务内偏好排序而非全局标量奖励。由此产生的 9B 模型在 AgenticVBench 上超越了多个专有系统。
流式视频编辑与便捷适配
本文介绍了SVEET,一个用于高质量流式视频编辑的框架,它利用预训练的视频扩散模型,实现自动回归编辑,并在单个GPU上实现实时性能。
JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑
JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。