netflix/void-model
摘要
Netflix 发布了 VOID,一种视频修复模型,能够从视频中移除物体,同时逼真地模拟物理交互(例如,当移除一个人时,物体会掉落)。该模型基于 CogVideoX 构建,并通过交互感知的四元掩码条件进行微调。
查看缓存全文
缓存时间: 2026/04/20 14:45
netflix/void-model · Hugging Face
来源:https://huggingface.co/netflix/void-model
https://huggingface.co/netflix/void-model#void-video-object-and-interaction-deletionVOID:视频对象与交互删除
VOID 能够从视频中移除物体,以及它们对场景产生的所有交互影响——不仅包括阴影和反射等次要效果,还涉及物理交互,例如移除人物后物体掉落等现象。
项目页面 (https://void-model.github.io/) | 论文 (https://arxiv.org/pdf/2604.02296) | GitHub (https://github.com/netflix/void-model) | 演示 (https://huggingface.co/spaces/sam-motamed/VOID)
https://huggingface.co/netflix/void-model#quick-start快速开始
在 Colab 中打开 (https://colab.research.google.com/github/netflix/void-model/blob/main/notebook.ipynb)
附带的 notebook 负责环境设置、下载模型、对示例视频进行推理并显示结果。需要配备40GB 以上显存的 GPU(例如 A100)。
https://huggingface.co/netflix/void-model#model-details模型详情
VOID 基于 CogVideoX-Fun-V1.5-5b-InP (https://huggingface.co/alibaba-pai/CogVideoX-Fun-V1.5-5b-InP) 构建,并通过交互感知的**四值掩码(quadmask)**条件进行微调,用于视频修复——这是一种四值掩码,编码了主要物体(移除)、重叠区域、受影响区域(掉落物体、移位物品)和背景(保留)。
https://huggingface.co/netflix/void-model#checkpoints检查点
| 文件 | 描述 | 是否必需 |
|---|---|---|
void_pass1.safetensors | 基础修复模型 | 是 |
void_pass2.safetensors | 利用扭曲噪声进行时间一致性优化 | 可选 |
对于大多数视频,仅使用 Pass 1 即可。Pass 2 增加了基于光流扭曲的潜在初始化,以提升较长片段的时间一致性。
https://huggingface.co/netflix/void-model#architecture架构
- 基础模型: CogVideoX 3D Transformer(5B 参数)
- 输入: 视频 + 四值掩码 + 描述移除后场景的文本提示
- 分辨率: 384x672(默认)
- 最大帧数: 197
- 调度器: DDIM
- 精度: BF16,配合 FP8 量化以节省内存
https://huggingface.co/netflix/void-model#usage使用方法
https://huggingface.co/netflix/void-model#from-the-notebook通过 Notebook 使用
最简单的方式——克隆仓库并运行 notebook.ipynb (https://github.com/netflix/void-model/blob/main/notebook.ipynb):
git clone https://github.com/netflix/void-model.git
cd void-model
https://huggingface.co/netflix/void-model#from-the-cli通过命令行使用
# 安装依赖
pip install -r requirements.txt
# 下载基础模型
hf download alibaba-pai/CogVideoX-Fun-V1.5-5b-InP \
--local-dir ./CogVideoX-Fun-V1.5-5b-InP
# 下载 VOID 检查点
hf download netflix/void-model \
--local-dir .
# 对样本运行 Pass 1 推理
python inference/cogvideox_fun/predict_v2v.py \
--config config/quadmask_cogvideox.py \
--config.data.data_rootdir="./sample" \
--config.experiment.run_seqs="lime" \
--config.experiment.save_path="./outputs" \
--config.video_model.transformer_path="./void_pass1.safetensors"
https://huggingface.co/netflix/void-model#input-format输入格式
每个视频需要在一个文件夹中放置三个文件:
my-video/
input_video.mp4 # 源视频
quadmask_0.mp4 # 四值掩码(0=移除, 63=重叠, 127=受影响, 255=保留)
prompt.json # {"bg": "移除后场景的描述"}
仓库中包含一个掩码生成流程(VLM-MASK-REASONER/),可利用 SAM2 + Gemini 从原始视频生成四值掩码。
https://huggingface.co/netflix/void-model#training训练
训练使用来自两个来源的成对反事实视频:
- HUMOTO——在 Blender 中通过物理模拟渲染的人与物体交互
- Kubric——使用 Google Scanned Objects 的纯物体交互
训练在 8x A100 80GB GPU 上进行,采用 DeepSpeed ZeRO Stage 2。完整的训练说明和数据生成代码请参见 GitHub 仓库 (https://github.com/netflix/void-model#%EF%B8%8F-training)。
https://huggingface.co/netflix/void-model#citation引用
@misc{motamed2026void,
title={VOID: Video Object and Interaction Deletion},
author={Saman Motamed and William Harvey and Benjamin Klein and Luc Van Gool and Zhuoning Yuan and Ta-Ying Cheng},
year={2026},
eprint={2604.02296},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2604.02296}
}
相似文章
@yoheinakajima: Netflix的技术栈
Netflix使用vLLM和NVIDIA Triton构建了一个内部LLM服务平台,通过统一的gRPC和兼容OpenAI的API将自托管模型集成到生产基础设施中,并分享了生产经验。
Flux 3 X Mimic:新一代视频-动作模型
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。
使用 NVIDIA NeMo Automodel 和 🤗 Diffusers 大规模微调视频和图像模型
NVIDIA NeMo Automodel 与 Hugging Face Diffusers 集成,支持对扩散模型进行可扩展的分布式微调,用于图像和视频生成,支持的模型包括 FLUX.1-dev、Wan 2.1 和 HunyuanVideo。
nvidia/Cosmos3-Super-Image2Video
NVIDIA 发布 Cosmos3-Super-Image2Video,该模型能够根据输入图像和文本指令生成时间上连贯的视频序列,是面向物理 AI 应用的 Cosmos 3 全模态世界模型平台的一部分。
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。