prefill

标签

Cards List
#prefill

解耦量化:专用于大语言模型预填充与解码阶段

Hugging Face Daily Papers ↗ · 6天前 缓存

本文介绍了解耦量化,一种针对大语言模型预填充和解码阶段定制量化方法以提升推理效率和准确性的技术。

0 人收藏 0 人点赞
#prefill

RBS-Attention:面向长上下文大语言模型的半径约束稀疏预填充方法

arXiv cs.AI ↗ · 2026-09-21 缓存

RBS-Attention引入了一种无需训练的稀疏预填充方法,采用双分支选择来缓解长上下文LLM推理中的均值稀释问题,在H100 GPU上实现最高20.65倍加速,同时在基准测试中保持接近稠密模型的质量。

0 人收藏 0 人点赞
#prefill

@dongxi_nlp: https://x.com/dongxi_nlp/status/2099713825402425623

X AI KOLs Timeline ↗ · 2026-09-15 缓存

本文解释了AI模型中预填充和解码阶段的工作原理,以及它们对生成速度和性能的影响,帮助理解AI响应延迟的成因。

0 人收藏 0 人点赞
#prefill

双流Transformer:将主预填充路径与额外解码计算解耦

arXiv cs.AI ↗ · 2026-08-14 缓存

本文介绍了双流Transformer,一种通过添加辅助流进行续写预测、同时共享权重和主KV缓存来解耦预填充和解码计算的架构,从而实现分阶段计算分配并提高效率。

0 人收藏 0 人点赞
#prefill

Llama-CPP 并行代理 --> 解码时很好,但一个代理的 prefill 会让所有其他代理陷入停顿

Reddit r/LocalLLaMA ↗ · 2026-08-11

一位用户报告称,在 Llama-CPP 中使用并行子代理时,解码性能很好,但单个代理的 prefill(例如处理网络搜索)会使所有其他代理停滞不前,并请求调优建议。

0 人收藏 0 人点赞
#prefill

预填充 vs. 解码与本地大语言模型的投资回报率:预填充被低估了吗?

Reddit r/LocalLLaMA ↗ · 2026-07-06

一项分析对比了大语言模型推理中的预填充与解码阶段,探讨在本地大语言模型部署中,预填充在投资回报率方面是否未被充分重视。

0 人收藏 0 人点赞
#prefill

@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…

X AI KOLs Timeline ↗ · 2026-06-29 缓存

解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。

0 人收藏 0 人点赞
#prefill

GLM 5.2 在 Mac Studio 上的提速 PR

Reddit r/LocalLLaMA ↗ · 2026-06-23

GLM 5.2 在配备 512GB RAM 的 Mac Studio 上带来了重大性能提升,在高上下文长度下实现超过 100 t/s 的预填充速度,并支持超过 10 万 token 上下文的 4 位量化,详细信息见 oMLX 创建者的拉取请求。

0 人收藏 0 人点赞
#prefill

@robertnishihara: 一个关于RL中解耦重要性的绝佳案例。来自论文:LLM生成在预填充和解码之间交替…

X AI KOLs Following ↗ · 2026-06-20 缓存

Robert Nishihara 强调了一篇关于解耦RL工作负载的论文,表明使用计算优化的H800进行预填充,带宽优化的H20进行解码,可以分别将rollout时间减少21-51%和47%,强调没有单一硬件类型适合所有阶段。

0 人收藏 0 人点赞
#prefill

模型在预填充阶段做笔记:KV缓存可编辑且可组合

arXiv cs.LG ↗ · 2026-06-17 缓存

本文提出,Transformer中的KV缓存充当了记忆化结论的笔记本,使得无需完全重计算即可进行精确编辑和组合。该方法在保持跨模型规模决策等价性的同时,实现了显著的延迟降低。

0 人收藏 0 人点赞
#prefill

ggml-webgpu: 提升k-quants的预填充速度并重构Q4/Q5/Q8及k-quants的矩阵乘法 by yomaytk · Pull Request #24225 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-06-09 缓存

提升了k-quants的预填充速度,并重构了llama.cpp WebGPU后端中Q4/Q5/Q8及k-quants的矩阵乘法。

0 人收藏 0 人点赞
#prefill

@rohanpaul_ai: Chamath 谈 AI 计算中重要的“prefill”和“decode”。Prefill 是计算密集型;大规模并行 GPU 占优,所以……

X AI KOLs Following ↗ · 2026-05-24 缓存

Chamath 解释了 AI 计算的两个关键阶段:prefill(计算密集型,利于 Nvidia 等并行 GPU)和 decode(内存带宽受限,依赖于扫描已生成的 token)。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈