memory-bandwidth

标签

Cards List
#memory-bandwidth

@Alacritic_Super: LLM推理的最大瓶颈不是算术运算,而是数据移动。一次乘加运算仅需…

X AI KOLs Timeline · 2026-07-15 缓存

一条科普线程,解释LLM推理的主要瓶颈是数据移动而非计算,并强调了量化、KV缓存优化和FlashAttention等减少内存流量技术的要点。

0 人收藏 0 人点赞
#memory-bandwidth

统一内存,详解:为何迷你PC能运行大型GPU无法运行的70B模型

Hacker News Top · 2026-07-10 缓存

阐释了迷你PC中的统一内存如何使其能够运行超过高端GPU显存容量的大型70B参数AI模型,尽管因内存带宽较低而导致速度较慢。

0 人收藏 0 人点赞
#memory-bandwidth

@Alacritic_Super: 如果你认真对待LLM推理,学习FlashAttention。它是现代…背后最重要的优化之一。

X AI KOLs Timeline · 2026-07-08 缓存

一条推文推荐在LLM推理中学习FlashAttention,强调其在优化GPU内存流量和加速注意力机制方面的重要性,并附有FlashAttention、FlashAttention-2和FlashAttention-3的GitHub仓库和论文链接。

0 人收藏 0 人点赞
#memory-bandwidth

@smolix: Here's part 1 (of 5) of my short course on efficient LLM inference that I taught at Columbia University. Slides are hea…

X AI KOLs Timeline · 2026-07-02 缓存

Part 1 of a 5-part short course on efficient LLM inference taught at Columbia University. Covers hardware bottlenecks, GPU memory bandwidth limits, and techniques like model compression and KV cache optimization to reduce inference cost.

0 人收藏 0 人点赞
#memory-bandwidth

@RayFernando1337: https://x.com/RayFernando1337/status/2070621713952579990

X AI KOLs Following · 2026-06-26 缓存

关于是在本地运行AI模型还是通过API运行的详细分析,涵盖了RTX 5090、RTX PRO 6000和DGX Spark等硬件选项,重点讨论了内存与带宽的权衡、成本考虑以及隐私需求。

0 人收藏 0 人点赞
#memory-bandwidth

@TheAhmadOsman: 本地AI硬件 = 容量 × 带宽 × 软件栈 - 容量决定能装下什么 - 带宽告诉你有多难…

X AI KOLs Following · 2026-06-21 缓存

一份关于本地AI硬件在内存容量、带宽和软件栈方面的详细比较,涵盖GPU、Apple Silicon、AMD、Intel、Tenstorrent等,重点关注AI推理中哪些瓶颈最关键。

0 人收藏 0 人点赞
#memory-bandwidth

基于阈值的LLM推理独占批处理

arXiv cs.AI · 2026-06-02 缓存

本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。

0 人收藏 0 人点赞
#memory-bandwidth

RTX Spark 将拥有高达 600GB/s 的内存带宽。

Reddit r/LocalLLaMA · 2026-06-01

据报道,NVIDIA 即将推出的 RTX Spark GPU 将拥有高达 600GB/s 的内存带宽,是 DGX Spark 的两倍,使用 128GB LPDDR5X 内存。

0 人收藏 0 人点赞
#memory-bandwidth

即将推出的N1X可能成为赢家

Reddit r/LocalLLaMA · 2026-05-31

一则泄露消息透露了英伟达即将推出的N1X和N1处理器的细节,包括支持16通道DDR5内存,带宽超过500 GB/s。

0 人收藏 0 人点赞
#memory-bandwidth

标准GPU上的实时LLM推理:每请求3k tokens/秒

Hacker News Top · 2026-05-29 缓存

Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。

0 人收藏 0 人点赞
#memory-bandwidth

受内存限制但不限于带宽:物理AI推理中批量1的LLM解码差距

Hugging Face Daily Papers · 2026-05-28 缓存

本文研究了物理AI系统中批量1的LLM解码的性能差距,发现更快的内存带宽并没有按比例减少延迟,因为启动开销的存在,并且量化效率在不同硬件间差异显著。

0 人收藏 0 人点赞
#memory-bandwidth

@rohanpaul_ai: Chamath 谈 AI 计算中重要的“prefill”和“decode”。Prefill 是计算密集型;大规模并行 GPU 占优,所以……

X AI KOLs Following · 2026-05-24 缓存

Chamath 解释了 AI 计算的两个关键阶段:prefill(计算密集型,利于 Nvidia 等并行 GPU)和 decode(内存带宽受限,依赖于扫描已生成的 token)。

0 人收藏 0 人点赞
#memory-bandwidth

内存

Reddit r/artificial · 2026-05-24

解释了为什么由于KV缓存随上下文长度和并发用户数扩展,LLM推理越来越受内存带宽限制,以及像vLLM和PagedAttention这样的系统如何提高内存利用率。

0 人收藏 0 人点赞
#memory-bandwidth

从第一性原理出发让深度学习飞速运行

Hacker News Top · 2026-05-23 缓存

一篇综合性的博客文章,解释如何通过理解三个关键组成部分来优化深度学习性能:计算、内存带宽和开销,利用第一性原理识别性能区间并专注于有效的优化。

0 人收藏 0 人点赞
#memory-bandwidth

CODA: 将Transformer块重写为GEMM-尾声程序

Hacker News Top · 2026-05-22 缓存

介绍CODA,一种GPU内核抽象,将Transformer操作表达为GEMM加尾声程序以减少数据移动,覆盖Transformer块中几乎所有非注意力计算。

0 人收藏 0 人点赞
#memory-bandwidth

在Strix Halo、RTX 3090和RTX 5070上运行相同模型,只为获得自己的数据

Reddit r/LocalLLaMA · 2026-05-16

作者在Strix Halo、RTX 3090和RTX 5070上使用了多个后端,进行了55次推理基准测试。结果揭示,显存带宽主导解码速度,RTX 5070在小模型上击败RTX 3090,而推理模型因隐藏的推理内容看起来慢约5倍。

0 人收藏 0 人点赞
#memory-bandwidth

@cHHillee: 在现代机器学习加速器中,浮点运算能力(FLOPS)已呈现爆炸式增长。然而,瓶颈往往不在于 FLOPS,而在于内存带宽…

X AI KOLs Following · 2026-05-11 缓存

Thinky 将人机交互带宽视为一个日益严峻的瓶颈,其状况类似于机器学习加速器中的内存带宽问题,并提出了针对这一局限性的解决方案。

0 人收藏 0 人点赞
#memory-bandwidth

本地 AI 硬件内存带宽(2026 年版)

X AI KOLs · 2026-05-25 缓存

本文深入解析内存带宽作为本地 AI 硬件性能的关键指标,对比了 NVIDIA、Apple、AMD、Intel 等厂商在不同性能层级下的当前 GPU 与统一内存系统。

0 人收藏 0 人点赞
#memory-bandwidth

https://www.youtube.com/watch?v=aE0onltJlOo

YouTube AI Channels · 2026-05-21 缓存

该讲座介绍了GPU架构作为SIMD(向量/数组)处理器的灵活演化,讨论了数据并行性、存储体分组、体冲突、串行瓶颈以及SIMD指令历史(如MMX),强调GPU如何利用数据并行性并应对串行瓶颈。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈