decode

标签

Cards List
#decode

解耦量化:专用于大语言模型预填充与解码阶段

Hugging Face Daily Papers ↗ · 6天前 缓存

本文介绍了解耦量化,一种针对大语言模型预填充和解码阶段定制量化方法以提升推理效率和准确性的技术。

0 人收藏 0 人点赞
#decode

@dongxi_nlp: https://x.com/dongxi_nlp/status/2099713825402425623

X AI KOLs Timeline ↗ · 2026-09-15 缓存

本文解释了AI模型中预填充和解码阶段的工作原理,以及它们对生成速度和性能的影响,帮助理解AI响应延迟的成因。

0 人收藏 0 人点赞
#decode

@Hass_Abdallah11: 我们有两篇新的 Colfax 文章,关于优化 FlashAttention-4,其中包括我(解码)和 Jack Carlisle(反向传播)的工作…

X AI KOLs Timeline ↗ · 2026-09-08 缓存

文章详细介绍了 FlashAttention-4 的优化技术,包括用于解码的 S/P 乒乓方法以重叠操作,在 NVIDIA Blackwell GPU 上实现了高达 16% 的性能提升。

0 人收藏 0 人点赞
#decode

双流Transformer:将主预填充路径与额外解码计算解耦

arXiv cs.AI ↗ · 2026-08-14 缓存

本文介绍了双流Transformer,一种通过添加辅助流进行续写预测、同时共享权重和主KV缓存来解耦预填充和解码计算的架构,从而实现分阶段计算分配并提高效率。

0 人收藏 0 人点赞
#decode

A 124B 在单台 DGX Spark 上单次响应生成了 15,128 个 token,解码速度全程保持 35.62 → 35.68 tok/s

Reddit r/LocalLLaMA ↗ · 2026-08-13

对 Ling-3.0-flash (124B) 在单台 DGX Spark 上单次响应生成 15,128 个 token 的观察,解码吞吐稳定在约 35.6 tok/s,凸显了长上下文解码性能。

0 人收藏 0 人点赞
#decode

Llama-CPP 并行代理 --> 解码时很好,但一个代理的 prefill 会让所有其他代理陷入停顿

Reddit r/LocalLLaMA ↗ · 2026-08-11

一位用户报告称,在 Llama-CPP 中使用并行子代理时,解码性能很好,但单个代理的 prefill(例如处理网络搜索)会使所有其他代理停滞不前,并请求调优建议。

0 人收藏 0 人点赞
#decode

llama.cpp b9966 针对 sm-tensor

Reddit r/LocalLLaMA ↗ · 2026-07-11

llama.cpp b9966 引入了一个针对 -sm tensor 模式的修复,该修复缓存了正则表达式模式,消除了解码线程中每个张量每个标记的 29 次重新编译,从而显著减少了 CPU 开销。

0 人收藏 0 人点赞
#decode

@_avichawla: LLM推理中的预填充与解码。你是否注意到,LLM的第一个令牌总是需要片刻才出现…

X AI KOLs Timeline ↗ · 2026-06-29 缓存

解释LLM推理的两个阶段——预填充和解码,详细说明GPU瓶颈如何从预填充时的计算受限转变为解码时的内存受限,以及KV缓存的重要性。

0 人收藏 0 人点赞
#decode

@robertnishihara: 一个关于RL中解耦重要性的绝佳案例。来自论文:LLM生成在预填充和解码之间交替…

X AI KOLs Following ↗ · 2026-06-20 缓存

Robert Nishihara 强调了一篇关于解耦RL工作负载的论文,表明使用计算优化的H800进行预填充,带宽优化的H20进行解码,可以分别将rollout时间减少21-51%和47%,强调没有单一硬件类型适合所有阶段。

0 人收藏 0 人点赞
#decode

@rohanpaul_ai: Chamath 谈 AI 计算中重要的“prefill”和“decode”。Prefill 是计算密集型;大规模并行 GPU 占优,所以……

X AI KOLs Following ↗ · 2026-05-24 缓存

Chamath 解释了 AI 计算的两个关键阶段:prefill(计算密集型,利于 Nvidia 等并行 GPU)和 decode(内存带宽受限,依赖于扫描已生成的 token)。

0 人收藏 0 人点赞
#decode

@no_stp_on_snek: @antirez Turbo3 击败 fp8,在32K上下文下解码 tok/s 提升5%,还在调试中,但我一直在你的‘厨房’里折腾 TQ+

X AI KOLs Following ↗ · 2026-05-23 缓存

Turbo3 在32K上下文下,相比 fp8 解码速度提升了5%(每秒 tokens 数),这是量化或模型优化方面的性能改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈