D-Matrix Raptor 3D-DRAM 加速器:面向 Hot Chips 2026 的生成式推断

Hacker News Top 新闻

摘要

D-Matrix 在 Hot Chips 2026 上展示了其 Raptor 3D-DRAM 加速器,该加速器通过直接将计算单元堆叠在 DRAM 晶圆上,解决了生成式 AI 推断中的内存容量和带宽挑战。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/14 11:46

# d-Matrix Raptor 3D-DRAM 加速器亮相 Hot Chips 2026,专为生成式推理打造 来源:https://www.servethehome.com/d-matrix-raptor-3d-dram-accelerator-for-generative-inference-at-hot-chips-2026/ d-Matrix Raptor 3D-DRAM (https://www.servethehome.com/wp-content/uploads/2026/08/meta-3d-dram-based-accelerator-for-genai-slide-17.jpg)d\-Matrix Raptor 3D\-DRAM 接下来,d\-Matrix 将在 Hot Chips 2026 上展示其 Raptor 3D\-DRAM 加速器,用于生成式推理。这家公司已引起广泛关注,我们此前也进行过报道,包括 Hot Chips 2025 上的d\-Matrix Corsair 用于 AI 推理的存内计算 (https://www.servethehome.com/d-matrix-corsair-in-memory-computing-for-ai-inference-at-hot-chips-2025/)。我们还发现他们在研发网络技术,如面向数据中心级 AI 推理的新型 d\-Matrix JetStream 400G 以太网卡 (https://www.servethehome.com/the-new-d-matrix-jetstream-400g-ethernet-card-for-data-center-scale-ai-inference/)。让我们看看他们今年带来了什么。 现场报道,如有笔误请见谅。 模型权重不断增长,而 KV 缓存的大小随上下文长度乘以批处理大小而变化。因此,64 个用户、1M 上下文可能意味着大约 935 GB 的 KV 缓存。权重和缓存共同构成了一个既关乎容量又关乎带宽的问题,而且这两方面都在持续增长。 d-Matrix 数据规模增长问题 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-02/)d\-Matrix The Growing Data ProblemSRAM 满足带宽目标,但仅限于极小规模。一对 Corsair SRAM 加速卡在约 1 ns 延迟下可达到约 300 TB/s 带宽,但容量仅约 4 GB。6T SRAM 单元比 DRAM 单元大约 10 倍,在 GB 规模下漏功耗高达数十瓦。这使得 SRAM 适用于推测解码中的草稿模型,而非存储前沿模型权重。这似乎是 NVIDIA 将 Groq 用于此目的的一个例子。 d-Matrix SRAM:带宽优势 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-04/)d\-Matrix SRAM: Bandwidth AdvantageHBM 解决了容量问题,但在带宽方面举步维艰。引脚速度和每个基础裸片的 I/O 宽度提升缓慢,且堆叠数量受限于可用封装边缘(beachfront),每个封装大约 8\-16 个堆叠。d\-Matrix 引用 HBM4 封装(如 NVIDIA Vera Rubin 和 AMD Instinct MI455)的实际带宽上限约为 20 TB/s。 d-Matrix HBM:带宽问题 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-05/)d\-Matrix HBM: The Bandwidth Issue如此高的带宽伴随着功耗代价。以 2.4 pJ/bit 计算,通过 HBM 推送 100 TB/s 仅在数据通路(fabric)流量之前就需要约 1.92 kW。当今的封装在边缘(beachfront)和功耗预算方面均不足以用 HBM 达到 SRAM 级别的带宽。 d-Matrix HBM:功耗问题 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-06/)d\-Matrix HBM: The Power Problemd\-Matrix 的解决方案是将计算直接堆叠在 DRAM 裸片之上。堆叠带来了散热挑战,因为数百瓦的功耗必须通过温度敏感的 DRAM 堆叠中的 TSV 散出,同时还存在由 IR 压降引起的供电挑战。d\-Matrix 表示,采用不超过 0.5 W/mm² 的 1\-Hi 逻辑顶置堆叠,可以通过液冷散热,并将 DRAM 温度控制在 100°C 以下。 d-Matrix 3D-DRAM:时机已到的构想 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-07/)d\-Matrix 3D\-DRAM: An idea whose time has come3D DRAM 在能耗阶梯上处于两个极端之间。片上 SRAM 的成本约为 50 fJ,而包含芯片级能耗的 2.5D HBM4 系统运行在 2.5 到 5 pJ 范围内。垂直 3D I/O 的能耗约为 0.3 到 0.4 pJ,比 HBM 低约 10 倍,因为它是一条无 PHY 的毫米级路径,而非厘米级中介层(interposer)路由。堆叠层数少于 HBM 也意味着裸片面积更大,良率更高。 d-Matrix 为什么选择 3D-DRAM? (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-08/)d\-Matrix Why 3D\-DRAM?d\-Matrix 现在将这种技术视角映射到 LLM 推理工作负载的行为上。预填充(Prefill)阶段并行处理许多提示词元(prompt tokens),受计算吞吐量限制;而解码(Decode)阶段一次生成一个词元,通常受内存带宽限制。注意力机制在采用高 GQA 和推测解码时可能转为计算密集型,而 MoE 即使在适中批处理大小下仍保持内存密集型。解码阶段是需要巨大带宽的阶段。如果您看过我们的NVIDIA GB10 (https://www.servethehome.com/nvidia-dgx-spark-review-the-gb10-machine-is-so-freaking-cool/) 或AMD Strix Halo (https://www.servethehome.com/amd-ryzen-ai-halo-developer-system-review-amd-goes-for-local-ai/) 报道,内存带宽是这类系统面临的主要挑战。 d-Matrix LLM 推理 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-10/)d\-Matrix LLM Inference由于解码阶段主导了实际运行时间(wall\-clock runtime),内存密集部分最为关键。d\-Matrix 强调,大部分推理时间都花在解码阶段,因此提高解码带宽能提升整体推理性能。 d-Matrix 大部分实际推理时间花在解码阶段 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-11/)d\-Matrix Majority of wall\-clock inference time is spent in decode以每卡 32GB 容量、4\-bit 权重和 8\-bit KV 缓存计算,d\-Matrix 的尺寸设计使其能装入一个机架。72 卡的规模扩展(scale\-up)可以托管像 Kimi K3 这样的前沿模型,支持 1M 上下文。分解式(disaggregation)和多机架架构则超越了单个 Raptor 机架的范围。 d-Matrix 1Hi 32GB 3D-DRAM:前沿 LLM 可装入一个 Raptor 机架 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-12/)d\-Matrix 1Hi 32GB 3D\-DRAM: Frontier LLMs fit in one Raptor Rack围绕这种内存构建系统,是内存子系统、数据移动架构和工作负载映射的协同设计练习。 d-Matrix 构建基于 3D-DRAM 的推理系统 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-14/)d\-Matrix Building a 3D\-DRAM Based Inference System现在,d\-Matrix 展示了其采用全网状(mesh)封装的拓扑结构,并讨论其通信协议。 d-Matrix 低延迟架构(卡内与卡间) (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-15/)d\-Matrix Low Latency Fabric Intra\-Card and Inter\-Cardd\-Matrix 的具体实现名为 Raptor。一块采用台积电 N4 工艺的逻辑裸片通过 36 微米面对面对面(face\-to\-face)堆叠在 3D DRAM 裸片之上,d\-Matrix 称该工艺已证实可靠、低成本、可量产且良率高。 d-Matrix Raptor 3D-DRAM (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-17/)d\-Matrix Raptor 3D\-DRAM将裸片转化为可工作的系统,暴露了一系列广泛的集成挑战。d\-Matrix 在此重点阐述了其中四个。 d-Matrix 3D-DRAM 集成全景 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-18/)d\-Matrix The 3D\-DRAM Integration Landscape这四个问题并非相互独立。d\-Matrix 探讨了 bank 映射、I/O 功耗和热可靠性这三个相互纠缠的挑战,指出其中任何一个问题的解决方案都会限制另外两个问题的设计空间。 d-Matrix 这些挑战相互纠缠 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-19/)d\-Matrix Challenges Are Entangled每个张量引擎(tensor engine)每次访问需要 128B 的 flit(流控制单元)。而来自 32B bank 的列访问(column access)每次只能提供 32B,这意味着每个通道需要 4 个 bank。d\-Matrix 的裸片拥有 840 个 bank(扣除 72 个备用后为 768 个),分布在 256 个通道上,每个通道仅有 3 个 bank。这种 flit 大小与可用 bank 数量无法整除。 d-Matrix 挑战 1:Bank 到通道的映射问题 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-20/)d\-Matrix Challenge 1: The Bank\-to\-Channel Mapping Problem每个通道 3 个 bank,单次访问返回 96B,因此传输一个 128B flit 需要两次访问并获取 192B,在约 33 TB/s 的带宽下浪费约 33%。列交错(Column staggering)可以打包 flit,但需要 192B 的移位缓冲器,并且会使时序和验证复杂化。 d-Matrix 挑战 1:过度取数困境 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-21/)d\-Matrix Challenge 1: The Overfetch Dilemma流阻塞(Stream blocking)技术回收了这部分浪费。d\-Matrix 将一次部分 32B 访问的数据分给三个 flit 使用,因此 4 次 96B 的访问提供了 3 个 128B 的 flit,输入 384B 与输出 384B 完全匹配。过度取数降为零,每次列访问都被利用,且无需移位网络。 d-Matrix 解决方案:流阻塞 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-22/)d\-Matrix Solution: Stream Blocking以 0.37 pJ/bit 的能耗移动 100 TB/s 的数据,仅 I/O 功耗就达到 296 W,而传统的 DBI(数据总线反转)技术可以节省 20%。HBM 能使用 DBI 是因为其多周期突发(burst)允许 PHY 看到整个突发,但 d\-Matrix 的单周期 256 位 3D\-DRAM 链路没有突发,也没有带外(sideband)引脚来指示反转选择。 d-Matrix 挑战 2:I/O 功耗墙 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-23/)d\-Matrix Challenge 2: The I/O Power Wall流翻转(Stream flipping)技术无需引脚即可实现这 20% 的节能。每个 flit 与前一个进行比较,并在需要时进行反转,将翻转(toggle)次数降至接近零,每个 flit 仅需携带一个与 ECC 并行的元数据位。d\-Matrix 称其开销仅为 0.8%,无需更改 PHY。 d-Matrix 解决方案:流翻转(无引脚 DBI) (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-24/)d\-Matrix Solution: Stream Flipping Pinless DBI在 105°C 结温下,散热构成了第三个挑战。良率至关重要,因为 840 个 bank 意味着即使 1% 的故障率也会威胁到整个通道,而丢弃已封装(bonded)的裸片在经济上是不可行的。禁用一个故障 bank 会使其所在通道变窄,单个弱通道可能限制整个切片(slice)的性能,而更高的温度会导致更多的软错误。数据保持时间从 85°C 时的 32 ms 下降到 105°C 时的 4 ms,要求刷新频率提高 8 倍,同时 ECC 和清洗(scrub)操作必须跟上。这就是 Hot Chips 如此精彩的原因,因为我们深入到了如此硬核的细节。 d-Matrix 挑战 3:105°C 下的 DRAM 可靠性 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-25/)d\-Matrix Challenge 3: DRAM Reliability at 105°C为应对这一切,d\-Matrix 将 ECC 和 DBI 位交错插入每个子阵列(subarray)的最后几列,将通用 ECC 与 Reed\-Solomon 码结合使用。读取行数减少 16 到 32 倍,使得刷新频率增加 8 倍的代价仅为约 1.37%,将带宽保持在接近 100 TB/s,损失低于 1.4%。 d-Matrix 解决方案:热感知刷新与 ECC (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-26/)d\-Matrix Solution: Thermal\-Aware Refresh & ECCBank 链(Bank chaining)技术在 bank 失效时保持通道对称性。两级物理多路复用器(mux)让第一级跳过第一个故障点,第二级跳过第二个故障点,因此小芯片的 72 个备用 bank 可以吸收裸片上任何位置的故障。备用 bank 进行回填(backfill),通道保持均匀,布线成本可忽略不计。 d-Matrix 解决方案:Bank 链 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-27/)d\-Matrix Solution: Bank Chaining现在,d\-Matrix 展示了一个看似与 HBM4 和 NVIDIA Rubin R200 在硅面积上的对比。Raptor 的数据约为每平方毫米 32.6 GB/s,而 HBM 部件约为 1.5 GB/s,带宽密度提高了约 20 倍;同时,每 GB/s 功耗为 2.96 mW,而对方为 40 mW,提升了 13.5 倍。这相当出色。 d-Matrix 结论 - 1 (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-28/)d\-Matrix Conclusions – 1Raptor 的成果宣称在服务 3 万亿参数级模型、支持 1M 上下文时,可达到每用户约 1000 词元/秒。d\-Matrix 的核心论点是,适中的单卡内存容量配合高带宽,在低延迟推理中能取胜。如果能亲眼看到它实际运行起来就好了。希望有一天我们能做到。 d-Matrix Raptor 为服务 3T 级模型(1M 上下文)提供约 1000 词元/秒/用户的持续性能! (https://www.servethehome.com/meta-3d-dram-based-accelerator-for-genai-slide-29/)d\-Matrix Raptor sustains ~1000 TPS/User for serving 3T class model at 1M context这确实很出色(如果它能工作的话),但要是能多听一些关于其缺点的讨论就好了。 ## 最后总结 Raptor 是一项架构上的押注,将带宽和容量捆绑在一个封装中用于推理。d\-Matrix 与 HBM4 和 Rubin R200 的对比数据,在实际功耗密度(GB/s)和每 GB/s 功耗方面显示出真实优势。如果 3D DRAM 能弥合内存带宽鸿沟,它将重塑 AI 系统中加速器厂商对容量与带宽的权衡方式。每当有人提出一种看似偏离当前主流架构的解决方案时,我的第一个问题通常是“为什么其他人不用它?”你不得不想象像 NVIDIA 这样的公司,在某个地方肯定有人思考过将 DRAM 堆叠在逻辑之上。这个方案确实很有趣,希望我们能尽快看到它的实际运行。 我们在 Substack 上有完整的回顾,包括所有这些内容在受欢迎程度上的排名: Hot Chips 2026 回顾与数据 by Patrick Kennedy 数据已出炉,这里是今年在 Hot Chips 上引起热议的亮点 在 Substack 上阅读 (https://axautikgroupllc.substack.com/p/hot-chips-2026-recap-and-data)

相似文章

内存计算:DRAM 即将能进行数学运算

Hacker News Top

三星在 Hot Chips 2026 上展示了具有集成计算单元的 16 GB LPDDR5X 内存包,提供 614 GB/s 内部带宽,通过克服内存带宽限制显著提升 AI 推理性能。