@_akhaliq:SCoPE 用于视频扩散Transformer的视线坐标位置编码 模型:https://huggingface.co/TencentAR…

X AI KOLs Timeline 模型

摘要

SCoPE 是 TencentARC 提出的一个模型,它将相机视线作为位置坐标添加到预训练的视频扩散 Transformer 中,从而能够在保持图像到视频先验的同时实现相机轨迹控制。该发布包含一个用于 Wan2.2-I2V-A14B 推理的自包含检查点。

SCoPE 用于视频扩散Transformer的视线坐标位置编码 模型:https://t.co/y0ZbNTYQoy https://t.co/zZLjvLxAWR
查看原文
查看缓存全文

缓存时间: 2026/08/14 03:27

SCoPE

用于视频扩散Transformer的视线坐标位置编码

模型:https://t.co/y0ZbNTYQoy https://t.co/zZLjvLxAWR


TencentARC/SCoPE · Hugging Face

来源:https://huggingface.co/TencentARC/SCoPE

SCoPE:用于视频扩散Transformer的视线坐标位置编码

Minghao Yin · Jiahao Lu · Wenbo Hu · Wang Zhao · Ying Shan · Kai Han

项目主页 (https://visual-ai.github.io/scope/) · arXiv (https://arxiv.org/abs/2606.27345) · GitHub (https://github.com/TencentARC/SCoPE) · 许可证 (https://github.com/TencentARC/SCoPE/blob/main/LICENSE.txt)

SCoPE 预览图 (https://huggingface.co/TencentARC/SCoPE/blob/main/assets/teaser.png)

SCoPE 将相机视线作为位置坐标添加到预训练的视频扩散Transformer中。给定首帧、文本提示和相机轨迹,它生成的视频会遵循所要求的相机运动,同时保留原有的图像到视频先验。本仓库是 Wan2.2-I2V-A14B 的独立发布版:它包含推理所需的全部内容,因此无需单独下载 Wan2.2 检查点。

下载

pip install -U huggingface_hub
hf download TencentARC/SCoPE --local-dir checkpoints/SCoPE

检查点约为 67 GB。请将检查点和 Hugging Face 缓存都保存在本地存储中。

使用方法

安装 SCoPE 代码。发布权重使用 PyTorch 2.9.1 (CUDA 12.8) 进行训练和评估;由于更改 PyTorch 版本可能会改变数值输出,我们建议使用 uv (https://docs.astral.sh/uv/) 复现该确切环境:

git clone https://github.com/TencentARC/SCoPE.git
cd SCoPE
uv sync
source .venv/bin/activate

使用示例相机轨迹生成视频:

python inference.py \
  --model_path checkpoints/SCoPE \
  --case omni-misty-forest \
  --trajectory truck_right \
  --output_path outputs/omni-misty-forest.mp4

对于自定义输入:

python inference.py \
  --model_path checkpoints/SCoPE \
  --input_image path/to/first_frame.png \
  --prompt "A person walks along a misty forest trail." \
  --camera_path path/to/camera_poses.npy \
  --x_fov 1.11847 \
  --output_path outputs/custom.mp4

相机位姿使用 OpenCV 的相机到世界坐标,形状必须为 [81, 3, 4][81, 4, 4]x_fov 是以弧度表示的水平视场角;针孔相机使用 xi=0。完整的文档、选项和演示请参阅 GitHub 仓库 (https://github.com/TencentARC/SCoPE)。

训练数据

SCoPE 使用 RealEstate10K、DL3DV、PanShot 和 OmniWorld 进行训练。这些数据集采用统一的相机协议:位姿相对于第一台相机表示,平移通过每个片段的近深度进行归一化,而绝对尺度由模型内部的可学习尺度门(learned scale gate)处理。用户需自行遵守相应数据集的许可和条款。

预期用途与限制

该模型旨在用于图像到视频生成和可控相机运动的研究。它继承了 Wan2.2 的视觉能力、偏差、安全限制和计算要求。对于不准确的相机位姿或内参、远超出训练分布的轨迹、严重遮挡或异常快速的相机运动,结果可能会退化。

引用

@article{yin2026scope,
  title={SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers},
  author={Yin, Minghao and Lu, Jiahao and Hu, Wenbo and Zhao, Wang and Shan, Ying and Han, Kai},
  year={2026}
}

致谢

SCoPE 基于 Wan2.2 (https://github.com/Wan-Video/Wan2.2) 和 DiffSynth-Studio (https://github.com/modelscope/DiffSynth-Studio) 构建。感谢这些项目的作者和贡献者。

许可证

SCoPE 采用 Apache-2.0 许可证 (https://github.com/TencentARC/SCoPE/blob/main/LICENSE.txt) 发布。

相似文章

DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹

Hugging Face Daily Papers

DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。

TrackCraft3R: 改造视频扩散变换器用于密集3D追踪

Hugging Face Daily Papers

TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。