视频生成器作为通用视觉模型(8分钟阅读)
摘要
GenCeption 将预训练的视频生成模型重新利用为一个统一的单次前馈视觉模型,在多个任务上以极高的数据效率实现了最先进的性能,标志着向通用视觉智能的转变。
DeepMind 研究人员引入了 GenCeption,它将预训练的视频生成模型重新利用为一个通过文本指令控制的统一视觉系统。
查看缓存全文
缓存时间: 2026/07/14 22:55
# 视频生成模型是通用视觉学习者
来源:https://genception.github.io/
1Google DeepMind2多伦多大学3伦敦大学学院4牛津大学5麻省理工学院6隆德大学 \*在Google DeepMind期间完成的工作\。
ECCV 2026
## 概览
您的浏览器不支持视频标签。
## 快速总结
推动计算机视觉从任务特定时代迈向通用视觉智能——正如自然语言处理从任务特定模型演进为通用语言智能。
GenCeption将预训练的视频生成模型改造为统一、通用、前馈式的视觉模型,通过文本指令引导,以卓越的学习效率和引人入胜的涌现行为,在广泛视觉任务上达到SOTA性能。
### 视觉生成预训练
GenCeption利用视频生成模型作为表示预训练,并在统一架构中进行多任务后训练。
### 统一与前馈
GenCeption同时处理密集和稀疏视觉任务,将多步生成骨干转换为单步前馈模型。
### SOTA与涌现
GenCeption是多种视觉任务上的SOTA统一模型,具有卓越的学习效率和有趣的涌现行为。
## 方法论
您的浏览器不支持视频标签。
专用视觉模型使用独立的逐任务头部、骨干或损失函数,而GenCeption的统一视觉模型在所有任务中使用单一头部和骨干,由任务提示引导。
**方法论。** GenCeption利用视频生成扩散模型作为*预训练*基础,大规模捕获丰富的时空世界先验和原生视觉-语言对齐。在*后训练*阶段,模型被适配为前馈模型,主要在合成数据上进行微调,以处理多样的感知任务。GenCeption在多个视觉任务上展现出强大性能,并具有有趣的*涌现行为*,实现了从模拟到真实的无缝迁移以及对分布外物体类别的泛化。
**范式转变。** 这突显了从专用的、任务特定的计算机视觉模型向完全统一、通用的视觉模型转变——正如自然语言处理从任务特定模型演进为通用语言智能。
## 结果
雷达图:GenCeption(专家型和通用型)在深度、表面法线、相机姿态、分割和关键点任务上匹配或超越专用SOTA模型。
数据效率图:GenCeption在使用7倍到500倍更少训练帧的情况下,达到了与使用更多数据训练的模型相当的准确率。
**SOTA性能:** GenCeption与各任务专用SOTA模型(DepthAnything3、D4RT、VGGT-Ω、SAM3、Sapiens、DAVID、Genmo、Lotus-2)相比具有竞争力或更优。我们的*专家型*表示在单个任务上单独训练的模型,而*通用型*表示在多个任务上联合训练的单一模型。
**数据效率:** 在匹配的微调数据下,视频生成骨干优于替代预训练范式(V-JEPA、VideoMAE V2),展现出初步的扩展特性——随着更大模型和更多数据而改进,并且在使用7倍到500倍更少训练数据的情况下,达到了与D4RT和VGGT-Ω相当的性能。
## 架构
您的浏览器不支持视频标签。
GenCeption的架构概览,一个从文本到视频扩散模型改造而来的简单而强大的架构。给定输入视频和指定所需输出的文本提示,我们的统一模型(主要在合成数据上训练)能够通过单次前向传播执行广泛的密集和稀疏感知任务。密集视觉任务在RGB环境空间中统一,可在潜在空间中高效应用监督;稀疏视觉任务通过向扩散变压器(DiT)添加可学习令牌作为额外输入来实现。
## 视频任意任务能力
GenCeption能够无缝切换不同的视觉任务,就像人类在现实生活中所做的那样。
您的浏览器不支持视频标签。
## 原生视觉-语言对齐
给定自然语言描述,GenCeption准确分割所指对象——推理颜色、空间关系和运动——并通过利用文本到视频预训练的知识泛化到未见过的对象(例如,火箭)。
您的浏览器不支持视频标签。
## 理解复杂视觉世界
作为推动理解复杂视觉世界边界的例子,GenCeption在挑战性条件下(复杂运动、遮挡、自我中心视角、多视角等)预测4D人体关键点——为机器人技术和AR/VR领域的现实应用奠定基础的鲁棒4D人体理解。
您的浏览器不支持视频标签。
## 基于语言的4D重建
从单个视频中,GenCeption预测逐像素几何和相机姿态,将场景提升为4D点云——实现自由视角飞行和根据文本指令的语言对象定位。
您的浏览器不支持视频标签。
## 涌现行为
尽管主要在合成人体视频上微调,GenCeption却能无缝地从模拟迁移到真实视频,并泛化到分布外类别——这是生成式视频骨干内部存在通用"世界模型"的证据。
纯合成视频训练,模型**零样本迁移到真实视频**——无缝的模拟到真实迁移。
合成单物体视频训练,模型零样本泛化到具有**多个实例**的真实视频。
仅训练于人体,模型泛化到**未见类别**——动物和机器人。
## 引用
``
@inproceedings{wang2026genception,
title = {Video Generation Models are General-Purpose Vision Learners},
author = {Wang, Letian and Zhang, Chuhan and Kabra, Rishabh and Uijlings, Jasper and
Waslander, Steven and Zisserman, Andrew and Carreira, Joao and He, Kaiming and
Andriluka, Misha and Bazavan, Eduard Gabriel and Zanfir, Andrei and Sminchisescu, Cristian},
booktitle = {European Conference on Computer Vision (ECCV)},
year = {2026}
}
``
## 致谢
以下致谢并非详尽无遗。我们也感谢许多其他人士的支持、反馈和讨论,他们为这项工作做出了贡献,但在此未逐一列名。
我们衷心感谢Jeremiah Harmsen、Joëlle Barral、Chris Dyer、Rahul Sukthankar、Junlin Zhang、Miki Rubinstein、Thabo Beeler、Di Qiu、Jesús Pérez、Alberto García García、Sergio Orts Escolano、Erroll Wood、Iker J. de los Mozos和Emily Conn在整个项目中给予的宝贵支持。
我们还感谢以下人士(按姓氏字母顺序排列)在研究讨论、技术反馈和实施细节方面的宝贵交流:Thiemo Alldieck、Yanrui Bin、Ang Cao、Minghao Chen、Carlton Chu、Dima Damen、Shlomi Fruchter、Valentin Gabeur、Robert Geirhos、Tengda Han、Sicong Jiang、Zeren Jiang、Linyi Jin、Ruofan Liang、Ziwei Liao、Haotong Lin、Xingchao Liu、Yibo Liu、Shangbang Long、Viorica Patraucean、Cordelia Schmid、Hao Shao、Jianyuan Wang、Luyu Wang、Thaddäus Wiedemer、Ziyi Wu、Yuxi Xiao、Junyu Xie、Wei Yu、Shangzhan Zhang和Shuhong Zheng。
"视频生成模型是通用视觉学习者"的项目页面。
相似文章
视频生成模型是通用视觉学习者
本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。
视频生成模型作为世界模拟器
OpenAI的技术报告介绍了Sora视频生成模型,该模型通过视觉补丁统一多样化的视觉数据,支持大规模训练生成模型,能够生成长达一分钟的高清视频,支持可变的时长、宽高比和分辨率。
视觉作为统一多模态生成
本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。
VideoRAE:通过表示自编码器驯服视频基础模型进行生成建模
本文介绍了VideoRAE,一种表示自编码器,它利用冻结的视频基础模型来创建紧凑、可重建且利于生成的视频潜在表示。该模型在UCF-101上取得了最先进的结果,且收敛速度优于其他自编码器。
@AdinaYakup: SenseNova-Vision 商汤科技的新模型将所有计算机视觉视为生成任务 - 7B - CC BY-NC 4.0 (非商业性…
商汤科技发布了SenseNova-Vision,这是一个7B参数的模型,将所有计算机视觉任务统一为生成任务,并提供了开放权重、指令语料库、基准、论文和演示。