@reprompting: 使用共享内存归约的朴素CUDA softmax。归约似乎是一个非常直接的概念。
摘要
一条推文分享了一个使用共享内存归约的朴素CUDA softmax实现,并指出归约非常直接。
使用共享内存归约的朴素CUDA softmax。归约似乎是一个非常直接的概念。https://t.co/rJgj1omslJ
查看缓存全文
缓存时间: 2026/06/17 18:02
使用共享内存归约的朴素CUDA softmax。归约似乎是一个相当直接的概念。https://t.co/rJgj1omslJ
相似文章
SignMuon: 通信高效的分布式Muon优化
SignMuon是一种1位、感知矩阵的分布式训练优化器,它结合了signSGD的多数投票符号聚合与Muon的极坐标步骤框架,在float32基础上实现32倍带宽缩减,同时在CIFAR-10/ResNet-50和nanoGPT等基准测试上保持强大的收敛性和性能。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2087928032904523980
一条科普帖,讲解GPU的工作原理,重点在于主导LLM服务性能的内存-计算不对称性,并说明量化、投机解码和连续批处理等技术如何从这一根本约束出发。
@hardmaru: 人脑极其高效,因为它只激活特定思维所需的神经元。现代LLM…
本文介绍了TwELL和Hybrid稀疏格式,配合自定义CUDA内核,有效利用LLM中的非结构化稀疏性,在H100 GPU上实现了训练和推理速度提升超过20%,同时降低了能耗和内存使用。
反思优化
一篇博客文章,讨论针对受约束的分类概率分布的优化技术,使用softmax重参数化和log barrier方法,应用于蛋白质结合剂设计。
内存墙变得昂贵:KV缓存是你应该停止崇拜softmax注意力的原因
文章讨论DDR5内存价格上涨如何标志着AI领域更广泛的内存瓶颈,特别是LLM中softmax注意力的KV缓存,并强调了旨在减少内存使用的后Transformer架构,如线性注意力和状态空间模型。