就绪队列:在LLM智能体控制中界定GPU机会并避免主机往返
摘要
本文研究LLM智能体服务的GPU控制门控,分析并发队列调度和设备端路由与主机重新分发的对比,以减少主机往返并提高GPU利用率。
查看缓存全文
缓存时间: 2026/08/13 15:33
论文页面 - Ready Cohorts:界定GPU机会并避免LLM-Agent控制中的主机往返
来源:https://huggingface.co/papers/2608.12123
摘要
两项研究通过分析并发队列调度、设备端路由与主机重新分派,为LLM-agent服务定义了可度量的GPU控制门限。
LLM-agent(https://huggingface.co/papers?q=LLM-agent)服务反复执行模型调用与工具调用之间的小型确定性转换:对结果进行路由、更新状态,并发出下一个效应。我们探究了该控制路径在何时能为GPU执行提供足够的并发工作,以及当GPU计算的路由决策保留在设备端时会发生什么变化。我们使用固定分区份额F、精确离线份额P*、局部上界U和在线达成份额A,形式化了就绪队列边界(https://huggingface.co/papers?q=cohort%20boundary)。在零服务时间、无限容量且相等相对启动截止时间(https://huggingface.co/papers?q=launch%20deadline)的条件下,一个专门的动态规划程序(https://huggingface.co/papers?q=dynamic%20program)可以精确计算P*。在一个固定的851会话公共轨迹面板的平稳泊松重放(https://huggingface.co/papers?q=Poisson%20replay)中,主要条件在100,000个目标活跃会话、K=256和50毫秒启动截止时间(https://huggingface.co/papers?q=launch%20deadline)下得到F=30.19%、P*=43.00%和U=45.85%。精确打包(https://huggingface.co/papers?q=packing)恢复了固定窗口边界处损失的81.83%的机会。从结果派生的路由键是一个条件代理,而不是可执行身份的证明。一项独立的机制研究将GPU计算的二值决策(https://huggingface.co/papers?q=GPU-computed%20binary%20decision)保留在设备端,而不是将四个字节返回主机并重新分派。在四种命名的GPU放置方案中,设备驻留路径(https://huggingface.co/papers?q=device-resident%20path)在所有36种配置下都更快;放置方案内的行中位数比率从1.19倍到2.39倍不等。在这两种可接受机制中,所有14,557,440次测试的批量调用(https://huggingface.co/papers?q=batched%20invocations)都与单独实现的主机 oracle 匹配。一个不消除任何主机决策的固定嵌套设备图(https://huggingface.co/papers?q=nested%20device%20graph)在五种放置方案的60种配置中全部更慢。综上所述,这些研究为GPU智能体控制确立了两种可度量的门限:截止时间可行的队列供给和观测放置(https://huggingface.co/papers?q=observation%20placement)。需要一个联合的有限在线运行时来度量A、CPU迁移和服务级收益。
- 查看 arXiv 页面:https://arxiv.org/abs/2608.12123
- 查看 PDF:https://arxiv.org/pdf/2608.12123
- 项目页面:https://huggingface.co/spaces/josefchen/ready-cohorts
- GitHub0:https://github.com/josefchen/ready-cohorts
- 添加到收藏:https://huggingface.co/login?next=%2Fpapers%2F2608.12123
在你的 agent 中获取这篇论文:
hf papers read 2608\.12123
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
没有模型链接该论文
在模型的 README.md 中引用 arxiv.org/abs/2608.12123 即可从此页面链接到它。
引用该论文的数据集 1
josefchen/ready-cohorts 预览 • 约6小时前更新 • 33 • 1
引用该论文的 Spaces 1
包含该论文的集合 0
没有包含该论文的集合
将此论文添加到集合(https://huggingface.co/new-collection)中即可从此页面链接到它。
相似文章
@dangerm00se: 我让 fable 做的主要事情是路由跨越本地 API 和 cerebras 的 moa 和 rlm 实验。让你的 agent 去…
作者分享了 Hermes Mixture-of-Agents 实验中的发现,包括投票器升级、GPU 拓扑和缓存经济学,表明本地前缀缓存可以使长代理会话几乎免费,并且两个独立的 GPU 实例优于单个分区实例。
基于阈值的LLM推理独占批处理
本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。
迈向多模型LLM调度器:关于卸载和抢占的实证洞见
本文对在共享异构硬件上调度多个LLM进行了实证研究,重点关注CPU-GPU卸载和抢占的性能影响。研究发现,卸载会导致非线性的解码吞吐量下降,尤其是对于较小的模型,而抢占开销主要由模型状态重载主导,为未来多模型调度器的设计提供了指导。
Topology-Aware Data Movement for Disaggregated GPU Inference
This paper presents a topology-aware data movement orchestrator for disaggregated LLM inference, which dynamically selects optimal transport based on interconnect hierarchy and overlaps KV cache transfer with computation, achieving 3-18x transfer latency reduction over uniform RDMA.
@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。