Vidu S1:实时交互式视频生成模型
摘要
Vidu S1 是一款实时交互式视频生成模型,支持语音控制数字角色动画,可在消费级GPU上实现无限长度输出和高帧率,达到最先进性能。
查看缓存全文
缓存时间: 2026/07/10 06:16
论文页面 - Vidu S1: 实时交互式视频生成模型
来源:https://huggingface.co/papers/2607.03118 发布于 7月3日
#1 当日论文 (https://huggingface.co/papers/date/2026-07-10) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Vidu S1 是一款实时交互式视频生成模型,支持语音控制数字角色动画,可在消费级硬件上实现无限长度输出和高帧率。
我们提出了 Vidu S1,一款实时交互式视频生成模型,支持对数字角色 (https://huggingface.co/papers?q=digital%20characters) 的语音控制 (https://huggingface.co/papers?q=voice%20control)。用户可通过语音指令随时控制视频生成内容。Vidu S1 支持无限长度的实时视频生成 (https://huggingface.co/papers?q=real-time%20video%20generation),无模糊、漂移或视觉失真。基于 TurboDiffusion (https://huggingface.co/papers?q=TurboDiffusion) 和 TurboServe (https://huggingface.co/papers?q=TurboServe) 构建,Vidu S1 可在普通消费级 GPU (https://huggingface.co/papers?q=consumer%20GPUs) 上以高达 42 FPS 输出 540p 实时视频。用户可上传真人、动漫和宠物的自定义图像,并选择不同语音音调以获得个性化体验。实验表明,Vidu S1 在所有测试指标上均取得最佳性能,同时完全满足实时推理要求。可玩的在线演示请访问 https://vidu.com/vidu-stream。
查看 arXiv 页面 (https://arxiv.org/abs/2607.03118) 查看 PDF (https://arxiv.org/pdf/2607.03118) 项目页面 (https://vidu.com/vidu-stream) GitHub43 (https://github.com/shengshu-ai/Vidu-S1) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.03118)
引用此论文的模型0
无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.03118 以在此页面建立链接。
引用此论文的数据集0
无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.03118 以在此页面建立链接。
引用此论文的 Spaces0
无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.03118 以在此页面建立链接。
包含此论文的收藏集2
相似文章
视频生成模型作为世界模拟器
OpenAI的技术报告介绍了Sora视频生成模型,该模型通过视觉补丁统一多样化的视觉数据,支持大规模训练生成模型,能够生成长达一分钟的高清视频,支持可变的时长、宽高比和分辨率。
@svpino: 这个模型能够生成连贯的、跨越多个场景的长达1小时以上的视频,毫无卡顿。我读了他们的论文,所以…
这条推文介绍了LingBot-World-Infinity,一个开放权重的视频生成模型,它采用一种训练技术来从错误中恢复,从而能够生成跨越多个场景的连贯的1小时视频。
Avatar V:可规模化的视频参考虚拟化身视频生成
Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。
SANA-Video:基于块线性扩散变压器的高效视频生成
SANA-Video是一个小型扩散模型,利用线性注意力和恒定内存KV缓存,高效生成高分辨率、长时长的视频,以显著更低的成本和更快的速度实现与现有模型相媲美的性能。
视频生成模型是通用视觉学习者
本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。