FlashRT:引导智能体部署实时多模态应用的智能体框架

Hugging Face Daily Papers 论文

摘要

FlashRT是一个智能体框架,指导编码智能体自动优化和部署实时多模态应用,在NVIDIA B200 GPU上实现高达70倍的延迟降低,在AMD MI355X上实现3.6倍的吞吐量提升。

实时多模态应用,包括语音智能体和交互式视频生成,将异构模型组合成流水线,其高效部署需要针对特定应用做出关于放置、流式传输和模型内并行的决策。现有的服务系统和自动并行编译器局限于有限的转换和固定的工作负载假设,因此要在新应用上实现高性能,需要手动构建高效的实现。我们提出FlashRT,这是一个智能体框架,指导编码智能体将开发者编写的简单参考实现提升为优化的多GPU部署,灵活权衡延迟和吞吐量等目标指标。利用新的程序链范式,FlashRT引导通用编码智能体经过多轮转换过程:智能体将参考实现转换为中间表示(IR)以捕获数据依赖性和持久状态范围,通过顺序解释器验证该IR,并执行静态分析以识别候选转换。然后,智能体在测量门控优化循环中迭代实现、验证和基准测试每个候选方案,以生成跨不同硬件预算的有效部署。在包括视频世界模型和多模态大语言模型在内的各种应用中,FlashRT将参考实现转换为高效部署,在NVIDIA B200 GPU上实现高达约70倍的延迟降低和2.8倍的吞吐量提升。在AMD MI355X GPU上,FlashRT实现了相同的峰值延迟降低,同时将峰值吞吐量提升提高到3.6倍,表明智能体驱动的优化在专家优化不太成熟的平台上更具可扩展性。事实上,对于Qwen3-Omni的文本到音频推理,FlashRT在AMD MI355X上将响应延迟比专家级vLLM-Omni实现降低了65%。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:35

论文页面 - FlashRT:引导智能体部署实时多模态应用的智能体工具框架

来源:https://huggingface.co/papers/2607.18171

摘要

实时多模态应用,包括语音智能体和交互式视频生成,将异构模型组合成流水线,其高效部署需要针对具体应用做出关于放置、流式传输和模型内并行性的决策。现有的服务系统和自动并行编译器局限于有限的转换和固定的工作负载假设,因此要为新应用实现高性能,需要手工打造高效的实现。我们提出FlashRT,一个智能体工具框架,它引导编码智能体将开发者编写的简单参考实现提升为优化的多GPU部署,并能灵活权衡延迟和吞吐量等目标指标。FlashRT采用一种新的程序链范式,指导通用编码智能体通过多轮转换过程:智能体首先将参考实现转换为中间表示(IR)以捕获数据依赖关系和持久状态作用域,通过顺序解释器验证该IR,并进行静态分析以识别候选转换。然后,智能体在测量门控优化循环中迭代地实现、验证和评估每个候选方案,从而生成跨不同硬件预算的有效部署。在各种应用中,包括视频世界模型和多模态LLM,FlashRT将参考实现转换为高效部署,在NVIDIA B200 GPU上可实现高达约70倍的延迟降低和2.8倍的吞吐量提升。在AMD MI355X GPU上,FlashRT实现了同等的峰值延迟降低,同时将峰值吞吐量提升提高至3.6倍,这表明在专家优化较不成熟的平台上,智能体驱动的优化更具可扩展性。事实上,对于Qwen3-Omni文本到音频推理,FlashRT在AMD MI355X上相较于专家级vLLM-Omni实现,响应延迟降低了65%。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18171)查看 PDF (https://arxiv.org/pdf/2607.18171)项目页面 (https://infini-ai-lab.github.io/flashrt-blog/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18171)

在您的智能体中获取此论文:

hf papers read 2607\.18171

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.18171 即可从本页面链接它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.18171 即可从本页面链接它。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.18171 即可从本页面链接它。

包含此论文的收藏集0

没有包含此论文的收藏集

添加此论文到一个收藏集 (https://huggingface.co/new-collection) 即可从本页面链接它。

相似文章

Step 3.7 Flash

Product Hunt

Step 3.7 Flash 是一款快速代理模型,旨在实时观察并采取行动。

FlashDrive:面向自动驾驶的快速视觉-语言-动作推理

arXiv cs.AI

FlashDrive是一种算法-系统协同设计框架,通过流式KV缓存复用、非自回归扩散草稿和自适应步长缓存,将自动驾驶视觉-语言-动作模型的推理延迟降低4.7倍(在单块GPU上从717毫秒降至151毫秒),且精度损失可忽略不计。

面向长时应用开发的Harness设计

Anthropic Engineering

Anthropic工程师详细介绍了一种多智能体Harness设计,利用生成器与评估器智能体提升Claude在长时间内自主构建完整、高质量前端应用的能力。