prefill-decode

标签

Cards List
#prefill-decode

ExFold:统一专家折叠框架实现无训练MoE预填充-解码加速

arXiv cs.LG · 2026-08-27 缓存

ExFold是一个统一的无训练框架,通过将被排除专家的贡献折叠到保留专家中,加速MoE模型推理,实现高达1.41倍的加速,同时保持高质量。

0 人收藏 0 人点赞
#prefill-decode

@CyrusHakha:我们在大规模服务LLM的客户中反复看到一种模式:预填充-解码分离常被当作一根魔杖……

X AI KOLs Following · 2026-06-15 缓存

基于客户模式,讨论大规模LLM服务中预填充-解码分离的微妙现实,并在AMD + vLLM上进行了验证。

0 人收藏 0 人点赞
#prefill-decode

@MaxForAI: http://Z.ai和清华这篇ZCube,做Infra的家人们值得看下。 很多人聊AI infra,第一反应还是GPU、显存、量化、推理框架。 但到长上下文和Prefill-Decode分离之后,网络已经不再是机房里的「配角」了。 每一…

X AI KOLs Timeline · 2026-05-21

ZCube是一种新的网络架构,通过打平拓扑并混合单/多轨接入,优化了长上下文和PD分离场景下的KV Cache传输,在GLM-5.1生产集群中实现了交换机/光模块成本降低33%、GPU推理吞吐提升15%、TTFT P99下降40.6%。

0 人收藏 0 人点赞
#prefill-decode

预填充即服务:下一代模型的 KVCache 可跨数据中心

Hacker News Top · 2026-04-19 缓存

研究者提出“预填充即服务”(PrfaaS),将长上下文预填充卸载到远程计算密集型集群,并通过普通以太网流式传输 KVCache,实现独立扩缩容,使 1T 参数混合模型吞吐提升 32–54%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈