TurboServe: 高效经济地服务流式视频生成
摘要
TurboServe 是一个专为流式视频生成工作负载设计的服务系统,采用在线调度方法,协调会话放置和 GPU 资源分配,以降低延迟和成本。
查看缓存全文
缓存时间: 2026/07/02 03:46
论文页面 - TurboServe:高效经济地服务流式视频生成
来源:https://huggingface.co/papers/2606.19271
摘要
TurboServe 是一个专为流式视频生成设计的服务系统,通过集成的调度、自动缩放和迁移机制,解决了会话状态管理和动态资源分配等挑战。
流式视频生成 (https://huggingface.co/papers?q=Streaming%20video%20generation) 正成为一种新型服务负载,用户与长期持续的会话交互,这些会话逐块渐进地生成视频。与离线视频生成或典型的 LLM 服务不同,流式视频生成 (https://huggingface.co/papers?q=streaming%20video%20generation) 必须在活跃和空闲期间保持会话状态,反复调度进行中的会话,并在严格的延迟目标下交付每个块。这在多用户、多 GPU 环境中带来了两个关键服务挑战:会话时长异构性——长时间运行的会话会使放置决策随时间变得次优;以及时间维度的用户需求异构性——活跃会话数量在突发和空闲期间剧烈波动。我们提出了 TurboServe,这是首个专门为流式视频生成 (https://huggingface.co/papers?q=streaming%20video%20generation) 工作负载设计的服务系统。TurboServe 将服务建模为一个在线调度 (https://huggingface.co/papers?q=online%20scheduling) 问题,协同管理会话放置和 GPU 配置 (https://huggingface.co/papers?q=GPU%20provisioning)。其闭环调度 (https://huggingface.co/papers?q=closed-loop%20scheduling) 算法结合了迁移感知放置 (https://huggingface.co/papers?q=migration-aware%20placement) 控制器(通过跨 GPU 重新平衡会话以降低每块最大延迟)和负载驱动自动缩放 (https://huggingface.co/papers?q=load-driven%20autoscaling) 控制器(根据工作负载变化调整 GPU 预算以提高成本效率)。为在运行时支持这些决策,TurboServe 实现了合并块处理 (https://huggingface.co/papers?q=coalesced%20chunk%20processing)(用于批处理同一 GPU 上的并发活跃会话)、GPU-CPU 卸载 (https://huggingface.co/papers?q=GPU-CPU%20offloading)(用于会话挂起和恢复)以及基于 NCCL 的 GPU-GPU 迁移 (https://huggingface.co/papers?q=NCCL-based%20GPU-GPU%20migration)(用于在线重新平衡)。我们使用 Shengshu Technology 的真实生产轨迹,在多种模型大小和最多 64 个 NVIDIA B300 GPU 的集群上评估了 TurboServe。与基线服务配置相比,TurboServe 将每块最坏情况延迟平均降低了 37.5%,总 GPU 运营成本平均降低了 37.2%。我们的代码已在 https://github.com/shengshu-ai/TurboServe 公开。
查看 arXiv 页面 (https://arxiv.org/abs/2606.19271)查看 PDF (https://arxiv.org/pdf/2606.19271)项目页面 (https://github.com/shengshu-ai/TurboServe)GitHub10 (https://github.com/shengshu-ai/TurboServe)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19271)
在你的代理中获取这篇论文:
hf papers read 2606\.19271
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.19271 即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.19271 即可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.19271 即可从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
流式力控视频生成
StreamForce 是一种因果统一视频生成模型,通过蒸馏流水线和自回归架构,为时变力提供实时、基于物理的响应,在力的遵循度和运动真实性方面达到了最先进的性能。
Stream-T1:用于流式视频生成的测试时扩展
Stream-T1 是一种针对流式视频生成提出的测试时扩展(TTS)框架,通过噪声传播和奖励剪枝等机制,提升了时间一致性和生成质量。该论文通过利用块级合成技术,解决了现有基于扩散模型的方法计算成本过高的问题。
@songhan_mit: SANA Streaming: 在单张5090上进行V2V
SANA Streaming 支持在单张NVIDIA RTX 5090 GPU上进行视频到视频生成。
@svpino: 无服务器,但针对模型的,来了!我在12年前就不再租用服务器了。我基本上把所有东西都迁移到了无服务器函数上……
Runpod 发布 FlashBoot,一种针对 AI 模型的无服务器方案,将空闲模型迁移到更便宜的存储,并在需要时将其调回 GPU,冷启动时间低于 200 毫秒,相比传统云服务降低成本 90%。
Stream-R1:流式视频生成的可靠性-困惑度感知奖励蒸馏
Stream-R1 提出了一种针对流式视频生成的可靠性-困惑度感知奖励蒸馏框架,通过自适应加权监督信号来提升视觉和动态质量,且不增加额外的计算开销。