[R] 确定性注意力变换器在H100上的实测能效 (0.63 J/token)

Reddit r/LocalLLaMA 论文

摘要

本文介绍了一个自定义的 Rust + CUDA 注意力变换器引擎,在H100上实现了0.63 J/token的能效,并具备位精确确定性,超越了典型模型。计划在专利授权后开源发布。

我一直在研究一个自定义的 Rust + CUDA 注意力变换器引擎(GAE + ATE + WNSM + 可逆训练),目标是实现确定性和实际能效。最近在H100 NVL(28层7B级堆栈,连续批次)上的持续数据:吞吐量:约403 tokens/秒 能效:0.63 J/token 功耗:约254 W 中位板级功率。该引擎具有位精确性(AUDIT验证),支持在同一堆栈上进行推理和训练,并可在多种硬件后端上运行(H100、M2 Pro、消费级GPU、WebGPU)。完整的基准测试、方法及证据请访问网站:https://luxiedge.com。计划在本月专利授权后开源(双许可证)。如果您对能效数据或类似工作有任何想法,欢迎讨论。
查看原文

相似文章

Z1T(15分钟阅读)

TLDR AI

Extropic引入Z1T,一种针对其概率性Z1硬件优化的稀疏类Transformer模型,通过算法-硬件协同设计提升Transformer推理的能效。

从Token到瓦时:现代GPU上LLM推理的分析能耗估算

arXiv cs.LG

本文提出了一种分析结构化、经验校准的方法,用于在不直接测量的情况下估算NVIDIA H100 GPU上LLM推理的能耗,该方法将预填充和解码阶段分开,并将能耗分解为计算、参数访问、KV缓存写入和注意力读取组件。