gpu-optimization

标签

Cards List
#gpu-optimization

v100s上Qwen3.6 27B NVFP4达366 t/s

Reddit r/LocalLLaMA · 昨天

介绍了v100-skinny,一个自定义内核库,支持在V100(sm70)GPU上进行快速NVFP4推理,在最佳情况下的抽取中为Qwen3.6 27B实现366 t/s,而结构化生成和代码生成的速度较低。

0 人收藏 0 人点赞
#gpu-optimization

@PyTorch: In this post, you’ll learn how to use the PyTorch Torch Inductor compiler and kernel fusion to improve memory bandwidth…

X AI KOLs Timeline · 2026-08-04 缓存

NVIDIA and PyTorch explain how kernel fusion in CUDA improves GPU memory bandwidth by combining multiple operations into a single kernel, reducing round-trips through global memory and kernel launch overhead.

0 人收藏 0 人点赞
#gpu-optimization

@PyTorch: FBTriton 是 Meta 开发其实验性 GPU 优化解决方案(包括 TLX/torchTLX 和…)的 Triton 仓库

X AI KOLs Timeline · 2026-07-30 缓存

Meta 的 FBTriton 是 OpenAI Triton 编译器的一个下游分支,能够在上游保持同步的同时,快速开发 TLX 和 autoWS 等 GPU 优化。本文详细介绍了其持续的上游合并策略、分层 L1/L2/L3 验证框架,以及在平衡创新与生产稳定性方面的实际挑战。

0 人收藏 0 人点赞
#gpu-optimization

Nifer 太疯狂了。在 Qwen 3.6 35B 上实现每秒 700 个 token(无思考模式)。专为 RTX 5090 打造。同时支持完整的 25 万上下文。

Reddit r/LocalLLaMA · 2026-07-27

Nifer 是一款工具,能够在 Qwen 3.6 35B 上实现每秒 700 个 token 的推理(无思考模式),专为 RTX 5090 优化,并支持完整的 25 万上下文。

0 人收藏 0 人点赞
#gpu-optimization

Qwen 3.6 27B 在 262K 上下文以内表现稳定。使用 Rope/Yarn 缩放,你们最高达到了多少?

Reddit r/LocalLLaMA · 2026-07-16

用户分享了将 Qwen 3.6 27B 推至 262K 上下文并获得连贯结果的体验,并讨论了使用 Rope/Yarn 缩放进一步扩展的方法,以及在 RTX 3090 Ti 上的 kv-cache 交换策略。

0 人收藏 0 人点赞
#gpu-optimization

LongStraw:在固定GPU预算下实现超200万Token的长上下文强化学习

Hugging Face Daily Papers · 2026-07-16 缓存

LongStraw是一个架构感知的执行栈,用于在固定GPU预算下进行百万Token级别的RL后训练,已在Qwen和GLM模型上展示了高达210万位置的执行能力。

0 人收藏 0 人点赞
#gpu-optimization

ExLlamaV3 v1.0.0 - 重大性能升级

Reddit r/LocalLLaMA · 2026-07-15

ExLlamaV3 v1.0.0 为本地运行大型语言模型带来了重大性能升级。

0 人收藏 0 人点赞
#gpu-optimization

@Alacritic_Super: LLM推理的最大瓶颈不是算术运算,而是数据移动。一次乘加运算仅需…

X AI KOLs Timeline · 2026-07-15 缓存

一条科普线程,解释LLM推理的主要瓶颈是数据移动而非计算,并强调了量化、KV缓存优化和FlashAttention等减少内存流量技术的要点。

0 人收藏 0 人点赞
#gpu-optimization

@no_stp_on_snek: 这太厉害了!3090 级别的 GPU 欢呼吧!

X AI KOLs Following · 2026-07-10 缓存

Unsloth AI 发布了量化版 Qwen3.6 模型,在消费级 GPU 上运行速度快了 2.5 倍。其中 27B 模型可适配 24GB 显存,35B-A3B 模型实现了高吞吐量。

1 人收藏 1 人点赞
#gpu-optimization

在RTX GPU上探索FlashAttention-3/4优化

Reddit r/LocalLLaMA · 2026-07-09

本文探讨了FlashAttention-3/4优化是否对RTX GPU有益,得出结论:由于消费级显卡的硬件限制,FA-2已是天花板。

0 人收藏 0 人点赞
#gpu-optimization

@Alacritic_Super: 如果你认真对待LLM推理,学习FlashAttention。它是现代…背后最重要的优化之一。

X AI KOLs Timeline · 2026-07-08 缓存

一条推文推荐在LLM推理中学习FlashAttention,强调其在优化GPU内存流量和加速注意力机制方面的重要性,并附有FlashAttention、FlashAttention-2和FlashAttention-3的GitHub仓库和论文链接。

0 人收藏 0 人点赞
#gpu-optimization

@Hikari_07_jp: 大家来看这篇文章!Jetha Chan是我理想中的工程师。他对SM100(数据…

X AI KOLs Timeline · 2026-07-05

Jetha Chan对SM100数据中心GPU的Attention核进行了反汇编,发现并修复了低效之处,从而显著提升了性能。

0 人收藏 0 人点赞
#gpu-optimization

打破 GPU 气泡

Hacker News Top · 2026-06-30 缓存

Moondream 的 Photon 推理引擎通过流水线解码消除了 GPU 气泡,实现了近乎实时的 VLM 推理,解码吞吐量提升高达 35%。

0 人收藏 0 人点赞
#gpu-optimization

使用 NVIDIA NeMo AutoModel 加速 Transformer 微调

Hugging Face Blog · 2026-06-24 缓存

NVIDIA NeMo AutoModel 利用 HuggingFace Transformers v5,在微调 Mixture-of-Experts 模型时,无需修改代码(只需一个导入),即可实现 3.4 至 3.7 倍的训练吞吐量提升和 29% 至 32% 的 GPU 内存减少。

0 人收藏 0 人点赞
#gpu-optimization

@robertnishihara: 一个关于RL中解耦重要性的绝佳案例。来自论文:LLM生成在预填充和解码之间交替…

X AI KOLs Following · 2026-06-20 缓存

Robert Nishihara 强调了一篇关于解耦RL工作负载的论文,表明使用计算优化的H800进行预填充,带宽优化的H20进行解码,可以分别将rollout时间减少21-51%和47%,强调没有单一硬件类型适合所有阶段。

0 人收藏 0 人点赞
#gpu-optimization

@h100envy: Daniel Han 创建了 Unsloth,这正是半数开源项目能在单张 GPU 而非集群上微调模型的原因。他还……

X AI KOLs Timeline · 2026-06-17 缓存

Daniel Han 构建了 Unsloth,该工具通过重写 GPU 内核,使单张 GPU 的微调速度提升 2 到 3 倍,让众多开源用户无需集群即可训练模型。

0 人收藏 0 人点赞
#gpu-optimization

MiniMax 稀疏注意力

Hugging Face Daily Papers · 2026-06-11 缓存

MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。

0 人收藏 0 人点赞
#gpu-optimization

PyTorch 性能分析(第 2 部分):从 nn.Linear 到融合 MLP

Hugging Face Blog · 2026-06-11 缓存

本篇博文继续 PyTorch 性能分析系列内容,探讨 nn.Linear、MLP 块以及使用 Triton 内核的融合技术,以优化性能。

0 人收藏 0 人点赞
#gpu-optimization

@raphaelsrty:在GPU上计算最大相似度(ColBERT、ColPali的评分步骤)可以被优化,这正是@tonywu_71所做的。我……

X AI KOLs Following · 2026-06-10 缓存

Tony Wu发布了late-interaction-kernels (LIK):用于MaxSim的融合Triton内核,MaxSim是ColBERT和ColPali背后的评分步骤,已集成到PyLate和colpali-engine中,提供了内存效率和性能提升。

0 人收藏 0 人点赞
#gpu-optimization

Luce Spark:无需卸载开销,在16GB GPU上运行35B MoE模型

Reddit r/LocalLLaMA · 2026-06-08

Luce Spark 是一款开源工具,通过智能地将热门专家缓存到 GPU 上,同时将其他专家保留在系统 RAM 中,从而在 16GB GPU 上运行 35B MoE 模型。它采用校准放置和有限异步缓存,保持高吞吐量,避免了常见的卸载速度断崖。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈