TurboServe: 高效经济地服务流式视频生成

Hugging Face Daily Papers 论文

摘要

TurboServe 是一个专为流式视频生成工作负载设计的服务系统,采用在线调度方法,协调会话放置和 GPU 资源分配,以降低延迟和成本。

流式视频生成正成为一种新的服务负载,用户与长期存在的会话交互,这些会话逐块渐进地生成视频。与离线视频生成或典型的 LLM 服务不同,流式视频生成必须在活动期和空闲期保持会话状态,重复调度正在进行的会话,并在严格的延迟目标下交付每个块。这在多用户、多 GPU 环境中带来了两个关键的服务挑战:会话持续时间异构性,长期运行的会话会随着时间的推移使放置决策变得次优;以及时间上的用户需求异构性,活跃会话数量在爆发期和空闲期之间剧烈波动。 我们提出了 TurboServe,这是第一个专门为流式视频生成工作负载设计的服务系统。TurboServe 将服务建模为一个在线调度问题,联合协调会话放置和 GPU 资源分配。其闭环调度算法结合了一个迁移感知的放置控制器,该控制器在 GPU 之间重新平衡会话以降低每个块的最大延迟,以及一个负载驱动的自动扩缩控制器,该控制器根据工作负载变化调整 GPU 预算以提高成本效率。为了在运行时支持这些决策,TurboServe 实现了合并块处理以在同一 GPU 上批处理并发活跃会话,GPU-CPU 卸载用于会话挂起和恢复,以及基于 NCCL 的 GPU-GPU 迁移用于在线重新平衡。我们使用来自 Shengshu Technology 的真实生产轨迹,在多个模型大小和最多 64 个 NVIDIA B300 GPU 的 GPU 集群上评估了 TurboServe。与基线服务配置相比,TurboServe 平均将最坏情况下的每块延迟降低了 37.5%,总 GPU 运营成本降低了 37.2%。我们的代码已公开在 https://github.com/shengshu-ai/TurboServe。
查看原文
查看缓存全文

缓存时间: 2026/07/02 03:46

论文页面 - TurboServe:高效经济地服务流式视频生成

来源:https://huggingface.co/papers/2606.19271

摘要

TurboServe 是一个专为流式视频生成设计的服务系统,通过集成的调度、自动缩放和迁移机制,解决了会话状态管理和动态资源分配等挑战。

流式视频生成 (https://huggingface.co/papers?q=Streaming%20video%20generation) 正成为一种新型服务负载,用户与长期持续的会话交互,这些会话逐块渐进地生成视频。与离线视频生成或典型的 LLM 服务不同,流式视频生成 (https://huggingface.co/papers?q=streaming%20video%20generation) 必须在活跃和空闲期间保持会话状态,反复调度进行中的会话,并在严格的延迟目标下交付每个块。这在多用户、多 GPU 环境中带来了两个关键服务挑战:会话时长异构性——长时间运行的会话会使放置决策随时间变得次优;以及时间维度的用户需求异构性——活跃会话数量在突发和空闲期间剧烈波动。我们提出了 TurboServe,这是首个专门为流式视频生成 (https://huggingface.co/papers?q=streaming%20video%20generation) 工作负载设计的服务系统。TurboServe 将服务建模为一个在线调度 (https://huggingface.co/papers?q=online%20scheduling) 问题,协同管理会话放置和 GPU 配置 (https://huggingface.co/papers?q=GPU%20provisioning)。其闭环调度 (https://huggingface.co/papers?q=closed-loop%20scheduling) 算法结合了迁移感知放置 (https://huggingface.co/papers?q=migration-aware%20placement) 控制器(通过跨 GPU 重新平衡会话以降低每块最大延迟)和负载驱动自动缩放 (https://huggingface.co/papers?q=load-driven%20autoscaling) 控制器(根据工作负载变化调整 GPU 预算以提高成本效率)。为在运行时支持这些决策,TurboServe 实现了合并块处理 (https://huggingface.co/papers?q=coalesced%20chunk%20processing)(用于批处理同一 GPU 上的并发活跃会话)、GPU-CPU 卸载 (https://huggingface.co/papers?q=GPU-CPU%20offloading)(用于会话挂起和恢复)以及基于 NCCL 的 GPU-GPU 迁移 (https://huggingface.co/papers?q=NCCL-based%20GPU-GPU%20migration)(用于在线重新平衡)。我们使用 Shengshu Technology 的真实生产轨迹,在多种模型大小和最多 64 个 NVIDIA B300 GPU 的集群上评估了 TurboServe。与基线服务配置相比,TurboServe 将每块最坏情况延迟平均降低了 37.5%,总 GPU 运营成本平均降低了 37.2%。我们的代码已在 https://github.com/shengshu-ai/TurboServe 公开。

查看 arXiv 页面 (https://arxiv.org/abs/2606.19271)查看 PDF (https://arxiv.org/pdf/2606.19271)项目页面 (https://github.com/shengshu-ai/TurboServe)GitHub10 (https://github.com/shengshu-ai/TurboServe)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19271)

在你的代理中获取这篇论文:

hf papers read 2606\.19271

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.19271 即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.19271 即可从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.19271 即可从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将这篇论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

流式力控视频生成

Hugging Face Daily Papers

StreamForce 是一种因果统一视频生成模型,通过蒸馏流水线和自回归架构,为时变力提供实时、基于物理的响应,在力的遵循度和运动真实性方面达到了最先进的性能。

Stream-T1:用于流式视频生成的测试时扩展

Hugging Face Daily Papers

Stream-T1 是一种针对流式视频生成提出的测试时扩展(TTS)框架,通过噪声传播和奖励剪枝等机制,提升了时间一致性和生成质量。该论文通过利用块级合成技术,解决了现有基于扩散模型的方法计算成本过高的问题。