@mohitwt_: 推理工程第20/30天:构建一个推测解码运行时,用较小的模型提前草拟多个token…

X AI KOLs Following 工具

摘要

一位开发者正在构建Octane,这是一个面向消费级硬件上的本地LLM推理的推测解码运行时,目标是实现2-3倍的加速,同时保持完全相同的输出质量。目前处于积极开发阶段,已实现分页KV缓存、连续批处理和批量注意力。

推理工程第20/30天 正在构建一个推测解码运行时,它使用较小的模型提前草拟多个token,然后与较大的模型并行验证它们,从而在保持完全相同的输出质量的同时获得2-3倍的加速。该引擎将根据你的硬件和模型自动选择最佳的草拟策略。 Octane将是一个本地推理引擎,将推测解码带给消费级硬件。目前已实现的功能包括:基于块的内存管理的分页KV缓存、用于并发请求的连续批处理引擎、支持GQA的批量注意力、多种采样策略(greedy、temperature、top-k、top-p),以及HuggingFace模型集成。 目前正在研究自回归生成。我觉得推测解码应该让每个人都能轻松使用,而且这对我来说也是一个很棒的学习项目。你可以在这里查看进度:
查看原文
查看缓存全文

缓存时间: 2026/08/08 09:07

推理工程第 20/30 天

正在构建一个投机解码运行时,它使用较小的模型预先起草多个 token,然后与较大的模型并行验证,在保持精确输出质量的同时获得 2-3 倍加速。该引擎将根据你的硬件和模型自动选择最佳起草策略。

octane 将是一个本地推理引擎,将投机解码带到消费级硬件上。目前已经实现的内容包括:基于块内存管理的分页 KV 缓存,用于并发请求的连续批处理引擎,支持 GQA 的批量注意力,多种采样策略(贪心、temperature、top-k、top-p),以及 HuggingFace 模型集成。

目前正在开发自回归生成。我觉得投机解码应该让所有人都能轻松使用,这对我来说也是一个很好的学习项目,你可以在这里查看进度:


Mog9/Octane

来源:https://github.com/Mog9/Octane

Octane

面向本地 LLM 推理的投机解码运行时。

Octane 将生产级投机解码带到消费级硬件上。它使用较小的模型起草多个 token,与较大的模型并行验证,并在保持精确输出质量的同时实现 2-3 倍加速。

什么是投机解码?

投机解码通过使用较小的“草稿”模型提前提出多个 token,然后与较大的“目标”模型并行验证,从而加速 LLM 推理。由于验证在单次前向传播中完成,你既能获得小模型的速度,又能获得大模型的质量。

Octane 让这一切对所有人都触手可及——无需复杂设置,无需特殊硬件要求。

当前实现

Octane 正在积极开发中。以下已实现的功能:

核心引擎

  • 分页 KV 缓存:基于块的内存管理,消除碎片化,并支持高效的并发请求处理
  • 连续批处理:通过动态请求调度和准入控制并行处理多个请求
  • 批量注意力:通过分组预填充和批量解码的优化注意力计算,支持 GQA(分组查询注意力)
  • 采样策略:贪心、temperature、top-k 和 top-p 采样,支持按请求配置

基础设施

  • HuggingFace 集成:从 HuggingFace Hub 加载任何兼容模型
  • 线程安全的请求管理:通过正确的状态管理安全处理并发请求
  • GPU 内存优化:自动内存分配和管理,以实现最大吞吐量

状态

**目前处于积极开发阶段。**核心引擎基础设施已完成,我正在开发自回归生成流水线。投机解码将是下一个重要里程碑。

相似文章

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

AngelSpec:面向实际场景的高性能推测解码推理

arXiv cs.CL

AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。