标签
AugServe 提出了一种状态感知的请求调度框架,具有动态批处理级别的 token 预算,以缓解队头阻塞并提高增强型 LLM 推理服务的有效吞吐量,相比 vLLM 实现了高达 6.5 倍的吞吐量提升。
根据 Artificial Analysis 的基准测试,Modular 的 MAX 推理服务在 FLUX.2-dev 上实现了比竞争对手快3倍的图像生成速度。