prefill

标签

Cards List
#prefill

Llama-CPP 并行代理 --> 解码时很好,但一个代理的 prefill 会让所有其他代理陷入停顿

Reddit r/LocalLLaMA · 昨天

一位用户报告称,在 Llama-CPP 中使用并行子代理时,解码性能很好,但单个代理的 prefill(例如处理网络搜索)会使所有其他代理停滞不前,并请求调优建议。

0 人收藏 0 人点赞
#prefill

预填充 vs. 解码与本地大语言模型的投资回报率:预填充被低估了吗?

Reddit r/LocalLLaMA · 2026-07-06

一项分析对比了大语言模型推理中的预填充与解码阶段,探讨在本地大语言模型部署中,预填充在投资回报率方面是否未被充分重视。

0 人收藏 0 人点赞
#prefill

@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…

X AI KOLs Timeline · 2026-06-29 缓存

解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。

0 人收藏 0 人点赞
#prefill

GLM 5.2 在 Mac Studio 上的提速 PR

Reddit r/LocalLLaMA · 2026-06-23

GLM 5.2 在配备 512GB RAM 的 Mac Studio 上带来了重大性能提升,在高上下文长度下实现超过 100 t/s 的预填充速度,并支持超过 10 万 token 上下文的 4 位量化,详细信息见 oMLX 创建者的拉取请求。

0 人收藏 0 人点赞
#prefill

@robertnishihara: 一个关于RL中解耦重要性的绝佳案例。来自论文:LLM生成在预填充和解码之间交替…

X AI KOLs Following · 2026-06-20 缓存

Robert Nishihara 强调了一篇关于解耦RL工作负载的论文,表明使用计算优化的H800进行预填充,带宽优化的H20进行解码,可以分别将rollout时间减少21-51%和47%,强调没有单一硬件类型适合所有阶段。

0 人收藏 0 人点赞
#prefill

模型在预填充阶段做笔记:KV缓存可编辑且可组合

arXiv cs.LG · 2026-06-17 缓存

本文提出,Transformer中的KV缓存充当了记忆化结论的笔记本,使得无需完全重计算即可进行精确编辑和组合。该方法在保持跨模型规模决策等价性的同时,实现了显著的延迟降低。

0 人收藏 0 人点赞
#prefill

ggml-webgpu: 提升k-quants的预填充速度并重构Q4/Q5/Q8及k-quants的矩阵乘法 by yomaytk · Pull Request #24225 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-06-09 缓存

提升了k-quants的预填充速度,并重构了llama.cpp WebGPU后端中Q4/Q5/Q8及k-quants的矩阵乘法。

0 人收藏 0 人点赞
#prefill

@rohanpaul_ai: Chamath 谈 AI 计算中重要的“prefill”和“decode”。Prefill 是计算密集型;大规模并行 GPU 占优,所以……

X AI KOLs Following · 2026-05-24 缓存

Chamath 解释了 AI 计算的两个关键阶段:prefill(计算密集型,利于 Nvidia 等并行 GPU)和 decode(内存带宽受限,依赖于扫描已生成的 token)。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈