Goku:百万规模通用数据集与指令驱动视频编辑基准
摘要
本文介绍了Goku,一个百万规模的指令驱动视频编辑数据集与基准,支持多任务和结构性操作。配套的模型Goku-Edit在指令遵循方面比开源模型提升了高达8%。
查看缓存全文
缓存时间: 2026/07/01 15:43
Paper page - Goku:百万级通用数据集与基于指令的视频编辑基准
来源:https://huggingface.co/papers/2606.30599 作者:
,
,
,
,
,
,
,
,
,
摘要
本文介绍了一个大规模的视频编辑数据集和模型,通过先进的数据合成和网络架构,支持多任务和结构性操作。
现有的基于指令的视频编辑数据集通常只关注单任务外观编辑,无法满足现实场景中复杂的创意需求。为弥补这一空白,我们提出了Goku,这是一个包含200万高质量、指令对齐的视频编辑对(https://huggingface.co/papers?q=instruction-aligned%20video%20editing%20pairs)的大规模数据集,是首个将任务边界从基础外观编辑扩展到多任务和结构性操作(例如,对主体运动的精确控制)的数据集。为了应对这些复杂任务中固有的数据合成挑战,我们设计了一个高效的数据合成流程(https://huggingface.co/papers?q=data%20synthesis%20pipeline),将复杂编辑分解为可控的子问题,并引入了一个渐进式过滤系统(https://huggingface.co/papers?q=progressive%20filtering%20system),确保整个过程中数据的可靠性。此外,我们探索了Goku上的最优网络结构,并提出了Goku-Edit。为了深入理解复杂的编辑指令,Goku-Edit采用了一个MLLM(https://huggingface.co/papers?q=MLLM)作为其文本编码器,并采用了解耦的双分支设计(https://huggingface.co/papers?q=decoupled%20dual-branch%20design):一个专用的掩码分支(https://huggingface.co/papers?q=mask%20branch)处理结构性控制,使主分支专注于外观渲染(https://huggingface.co/papers?q=appearance%20rendering)。此外,还提出了一个全面的视频编辑基准(https://huggingface.co/papers?q=video%20editing%20benchmark)Goku-Bench,包含1000个人工验证的测试用例和7个新颖的编辑特定指标(https://huggingface.co/papers?q=novel%20editing-specific%20metrics)。在Goku-Bench上的评估显示,Goku-Edit在指令遵循方面相比其他开源模型获得了高达+8%的提升。
查看 arXiv 页面(https://arxiv.org/abs/2606.30599)查看 PDF(https://arxiv.org/pdf/2606.30599)项目页面(https://flying-sky999.github.io/Goku.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.30599)
在您的代理中获取这篇论文:
hf papers read 2606\.30599
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.30599 以从此页面链接。
引用此论文的数据集2
Goku-2M/GOKU-2M 预览• 约2小时前更新 • 24 • 3 (https://huggingface.co/datasets/Goku-2M/GOKU-2M)
bigfacing/GOKU-2M 预览• 约2小时前更新 • 24 • 6 (https://huggingface.co/datasets/bigfacing/GOKU-2M)
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.30599 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
VEFX-Bench:通用视频编辑与视觉特效的全方位基准
VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。
CoVEBench:视频编辑模型能否处理复杂指令?
引入CoVEBench,这是一个用于评估组合视频编辑能力的新基准,解决了现有模型在处理复杂多步骤指令时的局限性。该基准包含416个视频、626条指令和9,990个检查项,揭示当前模型在组合编辑任务中表现不佳。
通过通用关键帧提取桥接VideoQA与视频引导的代理任务
本文介绍了VG-GUIBench,一个用于评估基于MLLM的GUI代理遵循视频教程能力的基准,并提出了TASKER,一种关键帧提取方法,可提升VideoQA和视频引导的代理任务的性能。
Uni-Edit:智能编辑是统一模型调优的通用任务
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
将机器人视频分割为可执行的子任务
本文介绍了WGO-Bench,一个用于机器人视频子任务标注的基准测试,包含100个片段和743个分割段,发现Gemini模型表现最佳,分割F1分数为0.306,标注准确率为61%,开源流程每小时视频成本为2.64美元。