@fahdmirza: Luce Megakernel 刚刚证明NVIDIA的效率差距是软件问题而非硬件问题——一台2020年的RTX 3090在220W功耗下…
摘要
Luce Megakernel 证明NVIDIA的效率差距是软件问题,在RTX 3090上相比llama.cpp实现了1.8倍吞吐量,并以更低的成本匹敌Apple M5 Max的效率。
查看缓存全文
缓存时间: 2026/05/16 19:22
Luce Megakernel 刚刚证明了 NVIDIA 的效率差距是软件问题而非硬件问题
一块 2020 年的 RTX 3090 在 220W 功耗下现在与 Apple M5 Max 效率相当,且吞吐量是其 1.8 倍
- 解码速度 413 tok/s vs. llama.cpp 的 267 tok/s —— 同一张 GPU,不同软件
- 1.87 tok/J —— 以不到三分之一系统成本达到 Apple M5 Max 的水平
- Qwen3.5-0.8B 全部 24 层融合进单个 CUDA kernel —— 零 CPU 往返
- 同硬件上比 PyTorch HuggingFace 快 25 倍
- 混合 DeltaNet 与 Attention 架构 —— 为此模式构建的首个 megakernel
完整分析及实时基准测试见下文
确实如此。
相似文章
Luce Megakernel: 为什么没有人谈论这个?
Lucebox Hub 为本地 LLM 推理提供优化的 CUDA 内核(Megakernel、DFlash、PFlash),在各种模型和 GPU 上相比 llama.cpp 实现了显著的加速(2-10 倍)。
@Snixtp: 针对单张 RTX 3090 的更多能效测试 长文速读:- 我在单张 RTX 3090 上测试了 8 个本地大语言模型(LLM),功率限制从 100W 到 45…
本文展示了 8 个本地大语言模型在 RTX 3090 上的基准测试结果,显示功率能效在约 225W 时达到峰值,而在满功率下收益递减。
@TheAhmadOsman: 为什么我关注你硬件的推理引擎/软件栈? - 2x RTX 3090s: ~14.5 tok/s → ~64 tok/s 提升到…
不同硬件上推理引擎性能对比:在2x RTX 3090s上从基线迁移到TP=2的vLLM,性能从~14.5 tok/s提升至~64 tok/s;在RTX PRO 6000上迁移到Sglang,性能从~32 tok/s提升至~110 tok/s。推荐在CUDA/多GPU场景使用vLLM/Sglang,在边缘设备使用llama.cpp。
Luce Spark:无需卸载开销,在16GB GPU上运行35B MoE模型
Luce Spark 是一款开源工具,通过智能地将热门专家缓存到 GPU 上,同时将其他专家保留在系统 RAM 中,从而在 16GB GPU 上运行 35B MoE 模型。它采用校准放置和有限异步缓存,保持高吞吐量,避免了常见的卸载速度断崖。
@TeksEdge:一位本地性能达人仅用单张RTX 3090运行Qwen3.8-27B,达到约381 tok/s。这位开发者将24GB的RTX 3090变成了一个mo…
一位开发者通过使用DFlash2和前缀缓存等优化技术,在单张RTX 3090上运行Qwen3.8-27B模型,实现了高达381 tok/s的推理速度,特别适用于RAG和编程助手等文档相关任务。