@mohitwt_: 推理工程第20/30天:构建一个推测解码运行时,用较小的模型提前草拟多个token…
摘要
一位开发者正在构建Octane,这是一个面向消费级硬件上的本地LLM推理的推测解码运行时,目标是实现2-3倍的加速,同时保持完全相同的输出质量。目前处于积极开发阶段,已实现分页KV缓存、连续批处理和批量注意力。
查看缓存全文
缓存时间: 2026/08/08 09:07
推理工程第 20/30 天
正在构建一个投机解码运行时,它使用较小的模型预先起草多个 token,然后与较大的模型并行验证,在保持精确输出质量的同时获得 2-3 倍加速。该引擎将根据你的硬件和模型自动选择最佳起草策略。
octane 将是一个本地推理引擎,将投机解码带到消费级硬件上。目前已经实现的内容包括:基于块内存管理的分页 KV 缓存,用于并发请求的连续批处理引擎,支持 GQA 的批量注意力,多种采样策略(贪心、temperature、top-k、top-p),以及 HuggingFace 模型集成。
目前正在开发自回归生成。我觉得投机解码应该让所有人都能轻松使用,这对我来说也是一个很好的学习项目,你可以在这里查看进度:
Mog9/Octane
来源:https://github.com/Mog9/Octane
Octane
面向本地 LLM 推理的投机解码运行时。
Octane 将生产级投机解码带到消费级硬件上。它使用较小的模型起草多个 token,与较大的模型并行验证,并在保持精确输出质量的同时实现 2-3 倍加速。
什么是投机解码?
投机解码通过使用较小的“草稿”模型提前提出多个 token,然后与较大的“目标”模型并行验证,从而加速 LLM 推理。由于验证在单次前向传播中完成,你既能获得小模型的速度,又能获得大模型的质量。
Octane 让这一切对所有人都触手可及——无需复杂设置,无需特殊硬件要求。
当前实现
Octane 正在积极开发中。以下已实现的功能:
核心引擎
- 分页 KV 缓存:基于块的内存管理,消除碎片化,并支持高效的并发请求处理
- 连续批处理:通过动态请求调度和准入控制并行处理多个请求
- 批量注意力:通过分组预填充和批量解码的优化注意力计算,支持 GQA(分组查询注意力)
- 采样策略:贪心、temperature、top-k 和 top-p 采样,支持按请求配置
基础设施
- HuggingFace 集成:从 HuggingFace Hub 加载任何兼容模型
- 线程安全的请求管理:通过正确的状态管理安全处理并发请求
- GPU 内存优化:自动内存分配和管理,以实现最大吞吐量
状态
**目前处于积极开发阶段。**核心引擎基础设施已完成,我正在开发自回归生成流水线。投机解码将是下一个重要里程碑。
相似文章
@_avichawla: Anthropic. Google. Meta. 每个人都在用来自1990年代的一个想法将LLM推理速度提升2-3倍。在1990年代,CPU设计者…
推测解码受1990年代CPU分支预测启发,现被Anthropic、Google和Meta用于将LLM推理速度提升2-3倍。它使用一个小模型来猜测未来的token,并用一个大模型并行验证它们,从而避免了解码期间GPU空闲时间。
@charles_irl:推测就是一切。在这篇博客中,我们宣布与Z Lab共同发布六款最新的DFla…
Modal和Z Lab发布了六款新的DFlash推测解码草稿模型,用于Qwen 3.x,在B200上实现了每秒超过1000个token,并认为推测解码是最有影响力的推理优化。
什么是推测性解码?(在paperswithco.de上热门)[R]
推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。
AngelSpec:面向实际场景的高性能推测解码推理
AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。
@asmah2107: 给所有询问推理工程应该构建什么的人:> 推理服务器(C++/Rust)> 分页KV缓存(如vLL…
一条推文列出了在推理工程中应构建的关键项目,以理解生产级LLM系统,包括推理服务器、分页KV缓存、推测解码、量化库和防护措施。