Goku:百万规模通用数据集与指令驱动视频编辑基准

Hugging Face Daily Papers 论文

摘要

本文介绍了Goku,一个百万规模的指令驱动视频编辑数据集与基准,支持多任务和结构性操作。配套的模型Goku-Edit在指令遵循方面比开源模型提升了高达8%。

现有的基于指令的视频编辑数据集通常聚焦于单任务外观编辑,无法满足现实场景中复杂的创作需求。为弥补这一差距,我们提出了Goku,一个包含200万高质量、指令对齐的视频编辑对的大规模数据集,这是首个将任务边界从基础外观编辑扩展到多任务和结构性操作(例如,对主体运动的精确控制)的数据集。为应对这些复杂任务中固有的数据合成挑战,我们设计了一条高效的数据合成流水线,将复杂编辑分解为可控的子问题,并在整个过程中引入渐进式过滤系统以确保数据可靠性。此外,我们在Goku上探索了最优网络结构,并提出了Goku-Edit。为深入理解复杂编辑指令,Goku-Edit采用MLLM作为其文本编码器,并采用解耦的双分支设计:一个专用的掩码分支负责结构控制,使主分支专注于外观渲染。我们还提出了一个全面的视频编辑基准Goku-Bench,包含1000个人工验证的测试用例和7个新颖的编辑特定指标。在Goku-Bench上的评估显示,Goku-Edit在指令遵循方面比其它开源模型提升了高达8%。
查看原文
查看缓存全文

缓存时间: 2026/07/01 15:43

Paper page - Goku:百万级通用数据集与基于指令的视频编辑基准

来源:https://huggingface.co/papers/2606.30599 作者:

摘要

本文介绍了一个大规模的视频编辑数据集和模型,通过先进的数据合成和网络架构,支持多任务和结构性操作。

现有的基于指令的视频编辑数据集通常只关注单任务外观编辑,无法满足现实场景中复杂的创意需求。为弥补这一空白,我们提出了Goku,这是一个包含200万高质量、指令对齐的视频编辑对(https://huggingface.co/papers?q=instruction-aligned%20video%20editing%20pairs)的大规模数据集,是首个将任务边界从基础外观编辑扩展到多任务和结构性操作(例如,对主体运动的精确控制)的数据集。为了应对这些复杂任务中固有的数据合成挑战,我们设计了一个高效的数据合成流程(https://huggingface.co/papers?q=data%20synthesis%20pipeline),将复杂编辑分解为可控的子问题,并引入了一个渐进式过滤系统(https://huggingface.co/papers?q=progressive%20filtering%20system),确保整个过程中数据的可靠性。此外,我们探索了Goku上的最优网络结构,并提出了Goku-Edit。为了深入理解复杂的编辑指令,Goku-Edit采用了一个MLLM(https://huggingface.co/papers?q=MLLM)作为其文本编码器,并采用了解耦的双分支设计(https://huggingface.co/papers?q=decoupled%20dual-branch%20design):一个专用的掩码分支(https://huggingface.co/papers?q=mask%20branch)处理结构性控制,使主分支专注于外观渲染(https://huggingface.co/papers?q=appearance%20rendering)。此外,还提出了一个全面的视频编辑基准(https://huggingface.co/papers?q=video%20editing%20benchmark)Goku-Bench,包含1000个人工验证的测试用例和7个新颖的编辑特定指标(https://huggingface.co/papers?q=novel%20editing-specific%20metrics)。在Goku-Bench上的评估显示,Goku-Edit在指令遵循方面相比其他开源模型获得了高达+8%的提升。

查看 arXiv 页面(https://arxiv.org/abs/2606.30599)查看 PDF(https://arxiv.org/pdf/2606.30599)项目页面(https://flying-sky999.github.io/Goku.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.30599)

在您的代理中获取这篇论文:

hf papers read 2606\.30599

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.30599 以从此页面链接。

引用此论文的数据集2

Goku-2M/GOKU-2M 预览• 约2小时前更新 • 24 • 3 (https://huggingface.co/datasets/Goku-2M/GOKU-2M)

bigfacing/GOKU-2M 预览• 约2小时前更新 • 24 • 6 (https://huggingface.co/datasets/bigfacing/GOKU-2M)

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.30599 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

VEFX-Bench:通用视频编辑与视觉特效的全方位基准

Hugging Face Daily Papers

VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。

CoVEBench:视频编辑模型能否处理复杂指令?

Hugging Face Daily Papers

引入CoVEBench,这是一个用于评估组合视频编辑能力的新基准,解决了现有模型在处理复杂多步骤指令时的局限性。该基准包含416个视频、626条指令和9,990个检查项,揭示当前模型在组合编辑任务中表现不佳。

将机器人视频分割为可执行的子任务

Hacker News Top

本文介绍了WGO-Bench,一个用于机器人视频子任务标注的基准测试,包含100个片段和743个分割段,发现Gemini模型表现最佳,分割F1分数为0.306,标注准确率为61%,开源流程每小时视频成本为2.64美元。