@_akhaliq:SCoPE 用于视频扩散Transformer的视线坐标位置编码 模型:https://huggingface.co/TencentAR…
摘要
SCoPE 是 TencentARC 提出的一个模型,它将相机视线作为位置坐标添加到预训练的视频扩散 Transformer 中,从而能够在保持图像到视频先验的同时实现相机轨迹控制。该发布包含一个用于 Wan2.2-I2V-A14B 推理的自包含检查点。
查看缓存全文
缓存时间: 2026/08/14 03:27
SCoPE
用于视频扩散Transformer的视线坐标位置编码
模型:https://t.co/y0ZbNTYQoy https://t.co/zZLjvLxAWR
TencentARC/SCoPE · Hugging Face
来源:https://huggingface.co/TencentARC/SCoPE
SCoPE:用于视频扩散Transformer的视线坐标位置编码
Minghao Yin · Jiahao Lu · Wenbo Hu · Wang Zhao · Ying Shan · Kai Han
项目主页 (https://visual-ai.github.io/scope/) · arXiv (https://arxiv.org/abs/2606.27345) · GitHub (https://github.com/TencentARC/SCoPE) · 许可证 (https://github.com/TencentARC/SCoPE/blob/main/LICENSE.txt)
SCoPE 预览图 (https://huggingface.co/TencentARC/SCoPE/blob/main/assets/teaser.png)
SCoPE 将相机视线作为位置坐标添加到预训练的视频扩散Transformer中。给定首帧、文本提示和相机轨迹,它生成的视频会遵循所要求的相机运动,同时保留原有的图像到视频先验。本仓库是 Wan2.2-I2V-A14B 的独立发布版:它包含推理所需的全部内容,因此无需单独下载 Wan2.2 检查点。
下载
pip install -U huggingface_hub
hf download TencentARC/SCoPE --local-dir checkpoints/SCoPE
检查点约为 67 GB。请将检查点和 Hugging Face 缓存都保存在本地存储中。
使用方法
安装 SCoPE 代码。发布权重使用 PyTorch 2.9.1 (CUDA 12.8) 进行训练和评估;由于更改 PyTorch 版本可能会改变数值输出,我们建议使用 uv (https://docs.astral.sh/uv/) 复现该确切环境:
git clone https://github.com/TencentARC/SCoPE.git
cd SCoPE
uv sync
source .venv/bin/activate
使用示例相机轨迹生成视频:
python inference.py \
--model_path checkpoints/SCoPE \
--case omni-misty-forest \
--trajectory truck_right \
--output_path outputs/omni-misty-forest.mp4
对于自定义输入:
python inference.py \
--model_path checkpoints/SCoPE \
--input_image path/to/first_frame.png \
--prompt "A person walks along a misty forest trail." \
--camera_path path/to/camera_poses.npy \
--x_fov 1.11847 \
--output_path outputs/custom.mp4
相机位姿使用 OpenCV 的相机到世界坐标,形状必须为 [81, 3, 4] 或 [81, 4, 4]。x_fov 是以弧度表示的水平视场角;针孔相机使用 xi=0。完整的文档、选项和演示请参阅 GitHub 仓库 (https://github.com/TencentARC/SCoPE)。
训练数据
SCoPE 使用 RealEstate10K、DL3DV、PanShot 和 OmniWorld 进行训练。这些数据集采用统一的相机协议:位姿相对于第一台相机表示,平移通过每个片段的近深度进行归一化,而绝对尺度由模型内部的可学习尺度门(learned scale gate)处理。用户需自行遵守相应数据集的许可和条款。
预期用途与限制
该模型旨在用于图像到视频生成和可控相机运动的研究。它继承了 Wan2.2 的视觉能力、偏差、安全限制和计算要求。对于不准确的相机位姿或内参、远超出训练分布的轨迹、严重遮挡或异常快速的相机运动,结果可能会退化。
引用
@article{yin2026scope,
title={SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers},
author={Yin, Minghao and Lu, Jiahao and Hu, Wenbo and Zhao, Wang and Shan, Ying and Han, Kai},
year={2026}
}
致谢
SCoPE 基于 Wan2.2 (https://github.com/Wan-Video/Wan2.2) 和 DiffSynth-Studio (https://github.com/modelscope/DiffSynth-Studio) 构建。感谢这些项目的作者和贡献者。
许可证
SCoPE 采用 Apache-2.0 许可证 (https://github.com/TencentARC/SCoPE/blob/main/LICENSE.txt) 发布。
相似文章
SpheRoPE:基于球形RoPE的零样本无优化360度全景生成
本文介绍了SpheRoPE,一个零样本且无需优化的框架,它将球形先验注入预训练的扩散变换器中,用于生成360度全景图像和视频,无需重新训练即可克服拓扑约束。
KVPO:基于ODE的原生GRPO框架通过KV语义探索实现自回归视频对齐
KVPO提出了一种基于ODE的原生在线GRPO框架,通过因果语义KV缓存探索和速度场替代策略,将流式自回归视频生成器与人类偏好对齐,在视觉质量和对齐度上实现了持续改进。
DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹
DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。
TrackCraft3R: 改造视频扩散变换器用于密集3D追踪
TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。
Track2View:通过配对3D点轨迹实现4D一致的相机控制视频生成
Track2View 通过将视频扩散转换器基于配对3D点轨迹进行条件生成,从视频中生成新的相机视角,实现了最先进的视觉质量,并显著降低了旋转和平移误差。