WASTE 推理引擎(14 分钟阅读)

TLDR AI 工具

摘要

WASTE 是一个开源推理引擎,通过将专家权重存储在 NVMe 上,运行比主机可用内存大得多的模型。它展示了在配备 64GB 统一内存的 MacBook Pro 上运行 Kimi K3(一个 2.78T 参数的 MoE 模型)的能力。

WASTE 是一个开源推理引擎,旨在运行权重远超主机可用内存的模型。这是更广泛努力的第一步,旨在让越来越强大的模型能够在更多硬件上运行。该项目旨在为个人和组织提供对基础设施成本、数据隐私、可用性和部署的更大控制。WASTE 首个完全支持的模型是 Kimi K3,它可以在配备 64GB 统一内存的 MacBook Pro 上运行。
查看原文
查看缓存全文

缓存时间: 2026/07/31 18:27

# WASTE 推理引擎 来源:https://marcobambini.substack.com/p/the-waste-inference-engine 今天我们发布了 WASTE(https://github.com/sqliteai/waste),这是一个开源推理引擎,专为运行权重远大于宿主机可用内存的模型而设计。 WASTE 完全支持的首个模型是 Kimi K3,一个 2.78 万亿参数的混合专家模型。我们将原本 1.42 TB 的检查点转换为 982 GB 的容器,并在配备 64 GB 统一内存的 MacBook Pro 上运行了完整模型。**这不是蒸馏、剪枝或精简后的变体**。 目前一次典型执行如下所示: `` $ waste run ~/models/k3.waste "What is the capital of Italy?" waste: no --budget, using 46.24 GB of 64.00 GB (expert cache 17.56 GB) The capital of Italy is Rome. [16 tokens, 49.31 s, 0.32 tok/s] `` 当前性能大约为每秒 0.33 个 token,尚不适合大多数交互式应用。然而,这一结果表明,可用 RAM 并不一定要对可在本地执行的模型总大小施加硬性限制。 WASTE 是更广泛工作中的一个初步步骤,旨在让日益强大的模型可以在由使用它们的人员和组织所控制的硬件上运行。 其目标是提供对基础设施成本、数据隐私、可用性和部署的更大控制权。 Kimi K3 是一个混合专家模型。尽管它包含 896 个路由专家,但对给定 token,每一层只选择 16 个专家。 因此,在计算的任何特定时刻,大多数模型权重都是非活跃的。 WASTE 利用这一特性,将模型分为两个主要部分。 模型主干常驻内存。专家权重保留在 NVMe 存储上,在被

相似文章

使用29 GB内存以0.50 tok/s运行Kimi K3

Hacker News Top

WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。

稀疏设计(5分钟阅读)

TLDR AI

Moonshot的Kimi K3是一个2.8万亿参数的开源权重模型,拥有896个专家(每个token激活16个),体现了在保持活跃计算不变的情况下扩大总参数的趋势,并使用注意力压缩来减少KV缓存大小,使得前沿推理更容易实现,但存储成本较高。

MawForge:面向本地混合专家推理的内存受限专家物化

arXiv cs.LG

MawForge 提出了一种内存受限的方法,用于在受限的统一内存机器上服务大型混合专家(MoE)语言模型,通过将完整模型存储在磁盘上,并按需将专家张量物化到有限缓存中。在 MacBook Pro M5 Pro 上的实验表明,能够在 24GB 内存范围内有效服务 34GB 和 25GB 的模型,并分析了缓存大小权衡和推测解码结果。