Luce Megakernel: 为什么没有人谈论这个?
摘要
Lucebox Hub 为本地 LLM 推理提供优化的 CUDA 内核(Megakernel、DFlash、PFlash),在各种模型和 GPU 上相比 llama.cpp 实现了显著的加速(2-10 倍)。
查看缓存全文
缓存时间: 2026/05/16 01:07
面向速度打造的本地 LLM 推理服务器。采用自定义内核、推测性预填充与解码、量化 GGUF 路径。每个项目都是针对特定模型族和硬件目标对我们引擎的全新优化。
Apache 2.0 · Lucebox.com
相似文章
@davideciffa:非常自豪地宣布,我们刚刚发布了 Luce KVFlash。在 Lucebox 中以 256k 上下文运行您偏好的模型,无需…
宣布发布 Luce KVFlash,这是一个在 Lucebox 中以 256k 上下文运行模型的工具,无需担心 KVCache 和 OOM,通过推测预填充和动态卸载,在长上下文场景下解码速度提升高达 2.9 倍。
@fahdmirza: Luce Megakernel 刚刚证明NVIDIA的效率差距是软件问题而非硬件问题——一台2020年的RTX 3090在220W功耗下…
Luce Megakernel 证明NVIDIA的效率差距是软件问题,在RTX 3090上相比llama.cpp实现了1.8倍吞吐量,并以更低的成本匹敌Apple M5 Max的效率。
Luce Spark:无需卸载开销,在16GB GPU上运行35B MoE模型
Luce Spark 是一款开源工具,通过智能地将热门专家缓存到 GPU 上,同时将其他专家保留在系统 RAM 中,从而在 16GB GPU 上运行 35B MoE 模型。它采用校准放置和有限异步缓存,保持高吞吐量,避免了常见的卸载速度断崖。
像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代
KernelPro是一个闭环多智能体系统,利用LLM和微剖析工具自动优化GPU内核代码,在KernelBench上实现了2.42×/4.69×/5.30×的几何平均加速,并在相同速度下实测能耗降低11.6%。
@davideciffa: Lucebox 的大日子!Codex、Hermes 和 OpenClaw 现在可以在搭载 Qwen3.6-27B 的推测性推理引擎上本地运行。F…
Lucebox 宣布,Codex、Hermes 和 OpenClaw 现在可以使用其推测性推理引擎配合 Qwen3.6-27B 模型在本地运行,并提供完整的 OpenAI 工具调用兼容性。