zai-org/SCAIL-2 · Hugging Face
摘要
SCAIL-2 是一个用于端到端受控角色动画的开源模型,它使用驱动视频动画化参考角色,支持角色替换和多角色场景,无需中间姿态表示。
查看缓存全文
缓存时间: 2026/06/10 00:21
zai-org/SCAIL-2 · Hugging Face
来源:https://huggingface.co/zai-org/SCAIL-2
https://huggingface.co/zai-org/SCAIL-2#scail-2-unifying-controlled-character-animation-with-end-to-end-in-context-conditioningSCAIL-2:统一控制角色动画与端到端上下文条件化
SCAIL-2 是一个开源模型,用于端到端控制角色动画。它能够利用驱动视频对参考角色进行动画化,同时支持角色替换和多角色场景,而无需依赖中间姿态表示。
预告片
https://huggingface.co/zai-org/SCAIL-2#%F0%9F%94%8E-overview🔎 概述
以往的角色动画方法严重依赖中间表示,如骨架图或修复掩码。这些中间表示在复杂动作下存在歧义,限制了驱动源的种类(仅限人体动作),并且限制了替换和多角色动画的应用范围。
SCAIL-2 消除了这种依赖,实现了端到端驱动。通过使用多个现成模型(SCAIL-Preview、Wan-Animate、MoCha),合成了 60K 个运动对,并通过带有专用掩码通道和 RoPE 设计的统一动作迁移接口进行训练。结合统一化的反向驱动训练策略,使模型学会了超越其教师模型的能力,从而产生了涌现能力,例如:
- 跨身份角色替换
- 动物驱动场景
- 对高级控制中间表示(如 SAM3D-Body 网格渲染)的零样本支持
管道图
https://huggingface.co/zai-org/SCAIL-2#%F0%9F%93%A6-model📦 模型
项目详情分辨率端到端驱动支持 512p 和 704p;姿态驱动和替换在 704p 下表现更佳约束H 和 W 必须都能被 32 整除(例如 704×1280)训练混合分辨率和帧率内置模块Wan VAE 和 T5 已集成在检查点中,方便使用 下载后的文件布局:
SCAIL-2/ ├── Wan2.1_VAE.pth ├── model │ ├── 1 │ │ └── fsdp2_rank_0000_checkpoint.pt │ └── latest └── umt5-xxl └── ...
https://huggingface.co/zai-org/SCAIL-2#%F0%9F%9A%80-usage🚀 使用说明
推理代码、环境设置和详细说明均提供在项目仓库中。请参考项目页面 (https://teal024.github.io/SCAIL-E2E/) 和代码仓库了解如何运行模型。
https://huggingface.co/zai-org/SCAIL-2#%F0%9F%93%84-citation📄 引用
@article{yan2025scail, title={SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations}, author={Yan, Wenhao and Ye, Sheng and Yang, Zhuoyi and Teng, Jiayan and Dong, ZhenHui and Wen, Kairui and Gu, Xiaotao and Liu, Yong-Jin and Tang, Jie}, journal={arXiv preprint arXiv:2512.05905}, year={2025} }
相似文章
SCAIL-2: 统一受控角色动画与端到端上下文内条件化
SCAIL-2是一个框架,通过直接从驱动视频迁移运动而无需中间表示,实现了端到端的受控角色动画。它使用了统一任务分解、合成数据(MotionPair-60K)以及新颖的条件化技术,如上下文内掩码条件化和偏差感知DPO。
@Saccc_c: 我最近在尝试用 seedance 2.5 制作 AIGC,但一直困扰人物动作的流畅性,发现会出现几个常见的问题 1、空间方向很容易混乱 2、镜头切换后就失去了整体的连贯性 3、人物和道具很容易移动 我正困惑时,我挖掘到了一个开源的 AI …
作者分享了使用Seedance 2.5制作AIGC时遇到的人物动作问题,并介绍了Higgsfield开源的K-pop动作系列《Zephyr: Special》,总结了提示词编写的关键技巧。
meituan-longcat/LongCat-Video-Avatar-1.5 · Hugging Face
LongCat-Video-Avatar 1.5 是一个升级的开源框架,用于音频驱动的人像视频生成,具备更优的唇形同步、生产级稳定性及高效的8步推理能力。
@Saboo_Shubham_: 太疯狂了……这是 Hugging Face 上免费提供的开源视频模型。LongCat 刚刚发布了一个令人惊叹的视频……
LongCat 在 Hugging Face 上发布了一个开源视频数字人模型,可免费使用,并能实现令人印象深刻的效果。
通过AI 3D生成技术从单张参考图创建完整绑定的3D角色
一种新的AI模型能够从单张参考图生成完整绑定的3D角色,从而简化3D内容创作流程。