Vidu S1:实时交互式视频生成模型

Hugging Face Daily Papers 论文

摘要

Vidu S1 是一款实时交互式视频生成模型,支持语音控制数字角色动画,可在消费级GPU上实现无限长度输出和高帧率,达到最先进性能。

我们介绍了Vidu S1,一款支持语音控制数字角色的实时交互式视频生成模型。用户可以通过语音指令随时控制视频生成内容。Vidu S1支持无限长度的实时视频生成,无模糊、漂移或视觉失真。基于TurboDiffusion和TurboServe构建,Vidu S1可在常规消费级GPU上以高达42 FPS的帧率输出540p实时视频。用户可以上传真人、动漫和宠物的自定义图像,并选择不同的语音语调以获得个性化体验。实验表明,Vidu S1在所有测试指标上均达到最佳性能,同时完全满足实时推理需求。可玩的在线演示可在 https://vidu.com/vidu-stream 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:16

论文页面 - Vidu S1: 实时交互式视频生成模型

来源:https://huggingface.co/papers/2607.03118 发布于 7月3日

#1 当日论文 (https://huggingface.co/papers/date/2026-07-10) 作者:

摘要

Vidu S1 是一款实时交互式视频生成模型,支持语音控制数字角色动画,可在消费级硬件上实现无限长度输出和高帧率。

我们提出了 Vidu S1,一款实时交互式视频生成模型,支持对数字角色 (https://huggingface.co/papers?q=digital%20characters) 的语音控制 (https://huggingface.co/papers?q=voice%20control)。用户可通过语音指令随时控制视频生成内容。Vidu S1 支持无限长度的实时视频生成 (https://huggingface.co/papers?q=real-time%20video%20generation),无模糊、漂移或视觉失真。基于 TurboDiffusion (https://huggingface.co/papers?q=TurboDiffusion) 和 TurboServe (https://huggingface.co/papers?q=TurboServe) 构建,Vidu S1 可在普通消费级 GPU (https://huggingface.co/papers?q=consumer%20GPUs) 上以高达 42 FPS 输出 540p 实时视频。用户可上传真人、动漫和宠物的自定义图像,并选择不同语音音调以获得个性化体验。实验表明,Vidu S1 在所有测试指标上均取得最佳性能,同时完全满足实时推理要求。可玩的在线演示请访问 https://vidu.com/vidu-stream。

查看 arXiv 页面 (https://arxiv.org/abs/2607.03118) 查看 PDF (https://arxiv.org/pdf/2607.03118) 项目页面 (https://vidu.com/vidu-stream) GitHub43 (https://github.com/shengshu-ai/Vidu-S1) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.03118)

引用此论文的模型0

无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.03118 以在此页面建立链接。

引用此论文的数据集0

无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.03118 以在此页面建立链接。

引用此论文的 Spaces0

无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.03118 以在此页面建立链接。

包含此论文的收藏集2

相似文章

视频生成模型作为世界模拟器

OpenAI Blog

OpenAI的技术报告介绍了Sora视频生成模型,该模型通过视觉补丁统一多样化的视觉数据,支持大规模训练生成模型,能够生成长达一分钟的高清视频,支持可变的时长、宽高比和分辨率。

Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。

视频生成模型是通用视觉学习者

Hugging Face Daily Papers

本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。