FlashRT:引导智能体部署实时多模态应用的智能体框架
摘要
FlashRT是一个智能体框架,指导编码智能体自动优化和部署实时多模态应用,在NVIDIA B200 GPU上实现高达70倍的延迟降低,在AMD MI355X上实现3.6倍的吞吐量提升。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - FlashRT:引导智能体部署实时多模态应用的智能体工具框架
来源:https://huggingface.co/papers/2607.18171
摘要
实时多模态应用,包括语音智能体和交互式视频生成,将异构模型组合成流水线,其高效部署需要针对具体应用做出关于放置、流式传输和模型内并行性的决策。现有的服务系统和自动并行编译器局限于有限的转换和固定的工作负载假设,因此要为新应用实现高性能,需要手工打造高效的实现。我们提出FlashRT,一个智能体工具框架,它引导编码智能体将开发者编写的简单参考实现提升为优化的多GPU部署,并能灵活权衡延迟和吞吐量等目标指标。FlashRT采用一种新的程序链范式,指导通用编码智能体通过多轮转换过程:智能体首先将参考实现转换为中间表示(IR)以捕获数据依赖关系和持久状态作用域,通过顺序解释器验证该IR,并进行静态分析以识别候选转换。然后,智能体在测量门控优化循环中迭代地实现、验证和评估每个候选方案,从而生成跨不同硬件预算的有效部署。在各种应用中,包括视频世界模型和多模态LLM,FlashRT将参考实现转换为高效部署,在NVIDIA B200 GPU上可实现高达约70倍的延迟降低和2.8倍的吞吐量提升。在AMD MI355X GPU上,FlashRT实现了同等的峰值延迟降低,同时将峰值吞吐量提升提高至3.6倍,这表明在专家优化较不成熟的平台上,智能体驱动的优化更具可扩展性。事实上,对于Qwen3-Omni文本到音频推理,FlashRT在AMD MI355X上相较于专家级vLLM-Omni实现,响应延迟降低了65%。
查看 arXiv 页面 (https://arxiv.org/abs/2607.18171)查看 PDF (https://arxiv.org/pdf/2607.18171)项目页面 (https://infini-ai-lab.github.io/flashrt-blog/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18171)
在您的智能体中获取此论文:
hf papers read 2607\.18171
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.18171 即可从本页面链接它。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.18171 即可从本页面链接它。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.18171 即可从本页面链接它。
包含此论文的收藏集0
没有包含此论文的收藏集
添加此论文到一个收藏集 (https://huggingface.co/new-collection) 即可从本页面链接它。
相似文章
远程代理管理器
用于远程管理和控制AI代理的工具
Step 3.7 Flash
Step 3.7 Flash 是一款快速代理模型,旨在实时观察并采取行动。
如果你使用 Open Code 或其他代理程序,但没有并行使用代理,那么你会损失大量的 t/s。基准测试:RTX5090,通过 LM Studio 加载 Qwen3.6 35B,并行任务数设为 8
基准测试表明,在 RTX 5090 上使用 LM Studio 并行运行 4-5 个代理可最大化吞吐量,而更多代理会因显存和计算分割导致收益递减。
FlashDrive:面向自动驾驶的快速视觉-语言-动作推理
FlashDrive是一种算法-系统协同设计框架,通过流式KV缓存复用、非自回归扩散草稿和自适应步长缓存,将自动驾驶视觉-语言-动作模型的推理延迟降低4.7倍(在单块GPU上从717毫秒降至151毫秒),且精度损失可忽略不计。
面向长时应用开发的Harness设计
Anthropic工程师详细介绍了一种多智能体Harness设计,利用生成器与评估器智能体提升Claude在长时间内自主构建完整、高质量前端应用的能力。