@fahdmirza: Luce Megakernel 刚刚证明NVIDIA的效率差距是软件问题而非硬件问题——一台2020年的RTX 3090在220W功耗下…

X AI KOLs Following 工具

摘要

Luce Megakernel 证明NVIDIA的效率差距是软件问题,在RTX 3090上相比llama.cpp实现了1.8倍吞吐量,并以更低的成本匹敌Apple M5 Max的效率。

Luce Megakernel 刚刚证明NVIDIA的效率差距是软件问题而非硬件问题 一台2020年的RTX 3090在220W功耗下现在匹敌Apple M5 Max的效率,并实现1.8倍吞吐量 413 tok/s 解码 vs llama.cpp 的 267 tok/s——同一块GPU,不同的软件 1.87 tok/J——匹敌Apple M5 Max,系统成本不到其三分之一 将Qwen3.5-0.8B的所有24层融合到单个CUDA内核中——零CPU往返 在同一硬件上比PyTorch HuggingFace快25倍 混合DeltaNet与Attention架构——首个为此模式构建的megakernel 完整解析与实时基准测试见下方
查看原文
查看缓存全文

缓存时间: 2026/05/16 19:22

Luce Megakernel 刚刚证明了 NVIDIA 的效率差距是软件问题而非硬件问题

一块 2020 年的 RTX 3090 在 220W 功耗下现在与 Apple M5 Max 效率相当,且吞吐量是其 1.8 倍

  • 解码速度 413 tok/s vs. llama.cpp 的 267 tok/s —— 同一张 GPU,不同软件
  • 1.87 tok/J —— 以不到三分之一系统成本达到 Apple M5 Max 的水平
  • Qwen3.5-0.8B 全部 24 层融合进单个 CUDA kernel —— 零 CPU 往返
  • 同硬件上比 PyTorch HuggingFace 快 25 倍
  • 混合 DeltaNet 与 Attention 架构 —— 为此模式构建的首个 megakernel

完整分析及实时基准测试见下文

确实如此。

相似文章

Luce Megakernel: 为什么没有人谈论这个?

Reddit r/LocalLLaMA

Lucebox Hub 为本地 LLM 推理提供优化的 CUDA 内核(Megakernel、DFlash、PFlash),在各种模型和 GPU 上相比 llama.cpp 实现了显著的加速(2-10 倍)。

Luce Spark:无需卸载开销,在16GB GPU上运行35B MoE模型

Reddit r/LocalLLaMA

Luce Spark 是一款开源工具,通过智能地将热门专家缓存到 GPU 上,同时将其他专家保留在系统 RAM 中,从而在 16GB GPU 上运行 35B MoE 模型。它采用校准放置和有限异步缓存,保持高吞吐量,避免了常见的卸载速度断崖。