inference-serving

标签

Cards List
#inference-serving

@cyrusasg:推理服务是自动化研究最干净的目标之一。目前很多注意力集中在内核生成,但……

X AI KOLs Timeline ↗ · 2026-09-15 缓存

这条推文将推理服务确定为自动化研究的主要目标,强调在延迟、质量和吞吐量约束下的端到端优化,在统一搜索空间中涵盖各个方面,并暗示了未来的发展。

0 人收藏 0 人点赞
#inference-serving

AugServe:面向增强型大语言模型推理服务的自适应请求调度

arXiv cs.CL ↗ · 2026-07-13 缓存

AugServe 提出了一种状态感知的请求调度框架,具有动态批处理级别的 token 预算,以缓解队头阻塞并提高增强型 LLM 推理服务的有效吞吐量,相比 vLLM 实现了高达 6.5 倍的吞吐量提升。

0 人收藏 0 人点赞
#inference-serving

@Modular: Modular 现已在 @ArtificialAnlys 上线,图像生成速度比竞争对手快3倍。MAX推理服务运行 @bfl_ai…

X AI KOLs Following ↗ · 2026-07-02 缓存

根据 Artificial Analysis 的基准测试,Modular 的 MAX 推理服务在 FLUX.2-dev 上实现了比竞争对手快3倍的图像生成速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈