memory-bandwidth

标签

Cards List
#memory-bandwidth

基于阈值的LLM推理独占批处理

arXiv cs.AI · 2026-06-02 缓存

本文分析了混合批处理与独占批处理在LLM推理中的权衡,表明最优选择取决于GPU内存带宽。提出了一种基于阈值的混合调度器,可在两种方法间动态切换,在带宽受限的GPU上实现高达41.9%的吞吐量提升。

0 人收藏 0 人点赞
#memory-bandwidth

RTX Spark 将拥有高达 600GB/s 的内存带宽。

Reddit r/LocalLLaMA · 2026-06-01

据报道,NVIDIA 即将推出的 RTX Spark GPU 将拥有高达 600GB/s 的内存带宽,是 DGX Spark 的两倍,使用 128GB LPDDR5X 内存。

0 人收藏 0 人点赞
#memory-bandwidth

即将推出的N1X可能成为赢家

Reddit r/LocalLLaMA · 2026-05-31

一则泄露消息透露了英伟达即将推出的N1X和N1处理器的细节,包括支持16通道DDR5内存,带宽超过500 GB/s。

0 人收藏 0 人点赞
#memory-bandwidth

标准GPU上的实时LLM推理:每请求3k tokens/秒

Hacker News Top · 2026-05-29 缓存

Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。

0 人收藏 0 人点赞
#memory-bandwidth

受内存限制但不限于带宽:物理AI推理中批量1的LLM解码差距

Hugging Face Daily Papers · 2026-05-28 缓存

本文研究了物理AI系统中批量1的LLM解码的性能差距,发现更快的内存带宽并没有按比例减少延迟,因为启动开销的存在,并且量化效率在不同硬件间差异显著。

0 人收藏 0 人点赞
#memory-bandwidth

@rohanpaul_ai: Chamath 谈 AI 计算中重要的“prefill”和“decode”。Prefill 是计算密集型;大规模并行 GPU 占优,所以……

X AI KOLs Following · 2026-05-24 缓存

Chamath 解释了 AI 计算的两个关键阶段:prefill(计算密集型,利于 Nvidia 等并行 GPU)和 decode(内存带宽受限,依赖于扫描已生成的 token)。

0 人收藏 0 人点赞
#memory-bandwidth

内存

Reddit r/artificial · 2026-05-24

解释了为什么由于KV缓存随上下文长度和并发用户数扩展,LLM推理越来越受内存带宽限制,以及像vLLM和PagedAttention这样的系统如何提高内存利用率。

0 人收藏 0 人点赞
#memory-bandwidth

从第一性原理出发让深度学习飞速运行

Hacker News Top · 2026-05-23 缓存

一篇综合性的博客文章,解释如何通过理解三个关键组成部分来优化深度学习性能:计算、内存带宽和开销,利用第一性原理识别性能区间并专注于有效的优化。

0 人收藏 0 人点赞
#memory-bandwidth

CODA: 将Transformer块重写为GEMM-尾声程序

Hacker News Top · 2026-05-22 缓存

介绍CODA,一种GPU内核抽象,将Transformer操作表达为GEMM加尾声程序以减少数据移动,覆盖Transformer块中几乎所有非注意力计算。

0 人收藏 0 人点赞
#memory-bandwidth

在Strix Halo、RTX 3090和RTX 5070上运行相同模型,只为获得自己的数据

Reddit r/LocalLLaMA · 2026-05-16

作者在Strix Halo、RTX 3090和RTX 5070上使用了多个后端,进行了55次推理基准测试。结果揭示,显存带宽主导解码速度,RTX 5070在小模型上击败RTX 3090,而推理模型因隐藏的推理内容看起来慢约5倍。

0 人收藏 0 人点赞
#memory-bandwidth

@cHHillee: 在现代机器学习加速器中,浮点运算能力(FLOPS)已呈现爆炸式增长。然而,瓶颈往往不在于 FLOPS,而在于内存带宽…

X AI KOLs Following · 2026-05-11 缓存

Thinky 将人机交互带宽视为一个日益严峻的瓶颈,其状况类似于机器学习加速器中的内存带宽问题,并提出了针对这一局限性的解决方案。

0 人收藏 0 人点赞
#memory-bandwidth

本地 AI 硬件内存带宽(2026 年版)

X AI KOLs · 2026-05-25 缓存

本文深入解析内存带宽作为本地 AI 硬件性能的关键指标,对比了 NVIDIA、Apple、AMD、Intel 等厂商在不同性能层级下的当前 GPU 与统一内存系统。

0 人收藏 0 人点赞
#memory-bandwidth

https://www.youtube.com/watch?v=aE0onltJlOo

YouTube AI Channels · 2026-05-21 缓存

该讲座介绍了GPU架构作为SIMD(向量/数组)处理器的灵活演化,讨论了数据并行性、存储体分组、体冲突、串行瓶颈以及SIMD指令历史(如MMX),强调GPU如何利用数据并行性并应对串行瓶颈。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈