标签
介绍了v100-skinny,一个自定义内核库,支持在V100(sm70)GPU上进行快速NVFP4推理,在最佳情况下的抽取中为Qwen3.6 27B实现366 t/s,而结构化生成和代码生成的速度较低。
NVIDIA and PyTorch explain how kernel fusion in CUDA improves GPU memory bandwidth by combining multiple operations into a single kernel, reducing round-trips through global memory and kernel launch overhead.
Meta 的 FBTriton 是 OpenAI Triton 编译器的一个下游分支,能够在上游保持同步的同时,快速开发 TLX 和 autoWS 等 GPU 优化。本文详细介绍了其持续的上游合并策略、分层 L1/L2/L3 验证框架,以及在平衡创新与生产稳定性方面的实际挑战。
Nifer 是一款工具,能够在 Qwen 3.6 35B 上实现每秒 700 个 token 的推理(无思考模式),专为 RTX 5090 优化,并支持完整的 25 万上下文。
用户分享了将 Qwen 3.6 27B 推至 262K 上下文并获得连贯结果的体验,并讨论了使用 Rope/Yarn 缩放进一步扩展的方法,以及在 RTX 3090 Ti 上的 kv-cache 交换策略。
LongStraw是一个架构感知的执行栈,用于在固定GPU预算下进行百万Token级别的RL后训练,已在Qwen和GLM模型上展示了高达210万位置的执行能力。
一条科普线程,解释LLM推理的主要瓶颈是数据移动而非计算,并强调了量化、KV缓存优化和FlashAttention等减少内存流量技术的要点。
Unsloth AI 发布了量化版 Qwen3.6 模型,在消费级 GPU 上运行速度快了 2.5 倍。其中 27B 模型可适配 24GB 显存,35B-A3B 模型实现了高吞吐量。
本文探讨了FlashAttention-3/4优化是否对RTX GPU有益,得出结论:由于消费级显卡的硬件限制,FA-2已是天花板。
一条推文推荐在LLM推理中学习FlashAttention,强调其在优化GPU内存流量和加速注意力机制方面的重要性,并附有FlashAttention、FlashAttention-2和FlashAttention-3的GitHub仓库和论文链接。
Jetha Chan对SM100数据中心GPU的Attention核进行了反汇编,发现并修复了低效之处,从而显著提升了性能。
Moondream 的 Photon 推理引擎通过流水线解码消除了 GPU 气泡,实现了近乎实时的 VLM 推理,解码吞吐量提升高达 35%。
NVIDIA NeMo AutoModel 利用 HuggingFace Transformers v5,在微调 Mixture-of-Experts 模型时,无需修改代码(只需一个导入),即可实现 3.4 至 3.7 倍的训练吞吐量提升和 29% 至 32% 的 GPU 内存减少。
Robert Nishihara 强调了一篇关于解耦RL工作负载的论文,表明使用计算优化的H800进行预填充,带宽优化的H20进行解码,可以分别将rollout时间减少21-51%和47%,强调没有单一硬件类型适合所有阶段。
Daniel Han 构建了 Unsloth,该工具通过重写 GPU 内核,使单张 GPU 的微调速度提升 2 到 3 倍,让众多开源用户无需集群即可训练模型。
MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。
本篇博文继续 PyTorch 性能分析系列内容,探讨 nn.Linear、MLP 块以及使用 Triton 内核的融合技术,以优化性能。
Tony Wu发布了late-interaction-kernels (LIK):用于MaxSim的融合Triton内核,MaxSim是ColBERT和ColPali背后的评分步骤,已集成到PyLate和colpali-engine中,提供了内存效率和性能提升。
Luce Spark 是一款开源工具,通过智能地将热门专家缓存到 GPU 上,同时将其他专家保留在系统 RAM 中,从而在 16GB GPU 上运行 35B MoE 模型。它采用校准放置和有限异步缓存,保持高吞吐量,避免了常见的卸载速度断崖。