[R] 确定性注意力变换器在H100上的实测能效 (0.63 J/token)
摘要
本文介绍了一个自定义的 Rust + CUDA 注意力变换器引擎,在H100上实现了0.63 J/token的能效,并具备位精确确定性,超越了典型模型。计划在专利授权后开源发布。
我一直在研究一个自定义的 Rust + CUDA 注意力变换器引擎(GAE + ATE + WNSM + 可逆训练),目标是实现确定性和实际能效。最近在H100 NVL(28层7B级堆栈,连续批次)上的持续数据:吞吐量:约403 tokens/秒 能效:0.63 J/token 功耗:约254 W 中位板级功率。该引擎具有位精确性(AUDIT验证),支持在同一堆栈上进行推理和训练,并可在多种硬件后端上运行(H100、M2 Pro、消费级GPU、WebGPU)。完整的基准测试、方法及证据请访问网站:https://luxiedge.com。计划在本月专利授权后开源(双许可证)。如果您对能效数据或类似工作有任何想法,欢迎讨论。
相似文章
基于哈密顿启发的注意力机制用于可扩展射频发射器指纹识别
提出了一种哈密顿Transformer,一种物理信息注意力机制,通过强制保范数值动力学用于射频发射器指纹识别,在同一天条件下达到99.12%的准确率,在150个发射器时达到61.64%,优于CNN和Transformer基线。
Z1T(15分钟阅读)
Extropic引入Z1T,一种针对其概率性Z1硬件优化的稀疏类Transformer模型,通过算法-硬件协同设计提升Transformer推理的能效。
@h100envy: 构建了NVIDIA TensorRT-LLM内核的CMU博士用68分钟讲解快速注意力——比1200美元的GPU课程更胜一筹
一位开发了NVIDIA现用于TensorRT-LLM的内核的CMU博士讲解了快速注意力,内容涵盖融合CUDA内核、FlashInfer、Triton和分页KV注意力,使同一GPU每秒能处理更多token。
从Token到瓦时:现代GPU上LLM推理的分析能耗估算
本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。
@waterloo_intern: 在阅读了一些关于后Transformer时代的ML研究后,我感到沮丧,因为似乎它已经收敛到了超优…
这条推文讨论了由于硬件限制,ML研究如何收敛于基于注意力、优化矩阵乘法(matmul)的算法,借鉴了‘硬件彩票’概念,并指出OpenAI的9个月芯片流片是硬件-研究协同设计的潜在迹象。