@rohanpaul_ai: @TensordyneInc 在推理机架方面取得了重大突破。他们刚刚宣布了一款AI推理机架,声称……
摘要
Tensordyne 发布了 Napier AI 推理机架,声称通过使用对数空间数学来降低能耗和晶体管使用量,其吞吐量是 Nvidia NVL72 GB300 的 13 倍,可能颠覆推理硬件格局。
查看缓存全文
缓存时间: 2026/06/17 19:59
来自 @TensordyneInc 的重大推理机架突破。
他们刚刚发布了一款 AI 推理机架,据内部模拟对比,在处理 DeepSeek-R1 时,其机架吞吐量是 NVIDIA NVL72 GB300 的 13 倍。
这一突破之所以重要,是因为 Tensordyne 从数学层面攻克了推理难题。
AI 芯片在数字移动和乘法运算上消耗了大量能量。
Napier(其 AI 推理机架)工作于对数空间,在该空间中乘法变为加法,而加法的构建、切换、散热成本更低,且每个 token 可重复数十亿次。
因此,Napier 并未将大量晶体管预算花在沉重的乘法电路上,而是尝试从数学本身做减法。
这意味着用于计算的芯片面积更少,留给 SRAM 的面积更多,从而每个 token 的功耗更低,相同的机架能容纳更多推理能力。
如果 Napier 已将对数数学优化到足够精确和快速以用于真实推理,那么它不仅是在机架中堆叠更多算力,更是改变了模型服务背后基本运算的成本。
AI 推理不再仅仅是 FLOPS 的竞赛。这是一场机架级别的较量,关乎功耗、内存局部性、互连延迟以及在经济学失效前能服务多少付费 token。
根据内部模拟,他们报告称 TDN 机架在 DeepSeek-R1 上达到了每秒 363,000 个 token,用户速度为每秒 210 个 token,而 NVIDIA 的 NVL72 GB300 为每秒 27,400 个 token。
相似文章
@TensordyneInc: https://x.com/TensordyneInc/status/2066567307984531834
Tensordyne推出了Napier,一种在硅片上使用对数数学的推理系统,声称对MoE和推理模型有巨大的效率提升,并采用风冷机架。
Tensordyne 发布对数AI计算芯片:每瓦特令牌数比NVIDIA Blackwell多17倍,吞吐量高13倍。
Tensordyne 宣布了一项突破性推理系统,在硬件中使用对数数学,声称每瓦特令牌数比NVIDIA Blackwell多17倍,吞吐量高13倍,这是通过将对数空间中的复杂乘法替换为简单加法实现的。
@LambLabs:Lamb Labs(YC S26)正在构建定制AI推理芯片,可实现20,000+ tok/s的速度,且每瓦特智能(Intelligence per Watt)比传统GPU高63倍……
Lamb Labs(YC S26)宣布推出定制AI推理芯片,声称速度可达20,000+ tok/s,且每瓦特智能(Intelligence per Watt)比传统GPU高63倍,并指出GPU之所以被广泛采用是因为其可用性,而非其适用性。
进展(3分钟阅读)
Etched宣布在低电压推理和集群规模内存方面取得突破,应用于其AI推理硬件,首批机架将于今年夏季发货,并拥有10亿美元的客户合同。
AMD与Cerebras推出AI推理解决方案(10分钟阅读)
AMD与Cerebras宣布联合推出AI推理解决方案,该方案将AMD Helios机架级解决方案与Cerebras晶圆级引擎相结合,旨在实现超低延迟和高吞吐量。这种解耦式推理工作流预计每瓦每秒可处理的token数量提升高达5倍。