inference-serving

标签

Cards List
#inference-serving

AugServe:面向增强型大语言模型推理服务的自适应请求调度

arXiv cs.CL · 2026-07-13 缓存

AugServe 提出了一种状态感知的请求调度框架,具有动态批处理级别的 token 预算,以缓解队头阻塞并提高增强型 LLM 推理服务的有效吞吐量,相比 vLLM 实现了高达 6.5 倍的吞吐量提升。

0 人收藏 0 人点赞
#inference-serving

@Modular: Modular 现已在 @ArtificialAnlys 上线,图像生成速度比竞争对手快3倍。MAX推理服务运行 @bfl_ai…

X AI KOLs Following · 2026-07-02 缓存

根据 Artificial Analysis 的基准测试,Modular 的 MAX 推理服务在 FLUX.2-dev 上实现了比竞争对手快3倍的图像生成速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈