@DeRonin_: DeepSeek 刚发布了一篇5页论文和免费GitHub仓库,能让任何LLM响应速度提升80%,这项技术叫推测性解码...
摘要
DeepSeek 发布了一篇论文以及采用MIT许可证的开源实现(DSpark),通过使用小型“猜测”模型和大型“检查”模型,将LLM响应速度提升高达80%,同时兼顾速度与准确率,无需权衡取舍。
查看缓存全文
缓存时间: 2026/06/27 20:01
DeepSeek 刚刚发布了一篇5页的论文和一个免费的GitHub仓库,能让任何LLM的响应速度提高80%
这种技术叫做推测解码(speculative decoding)。简单来说:
猜测 → 检查 → 保留 → 重复
猜测:一个小而快的模型预测接下来几个词 检查:大而聪明的模型一次性检查所有猜测 保留:锁定正确的,修正第一个错误的 重复:再来一次,速度比正常快2-4倍
DeepSeek的版本(DSpark)是首个将两种一直存在取舍的方法结合起来的方案:同时获得速度和准确性
在其旗舰模型上的生产环境结果:处理请求量增加50%,响应速度提升高达80%
如何使用它:
仅使用AI应用:预计它们很快会明显变快 用AI构建:将其集成到你的技术栈中,立即获得2倍加速 运行你自己的模型:今天就克隆仓库,并将其应用于你运行的任何模型
其他AI实验室一直对此秘而不宣。现在它免费开源在GitHub上,采用MIT许可证
这完全改变了我这周对AI产品的思考方式
本月最重磅的发布之一
仓库和论文见下方 ↓
以下是其工作原理的完整解析:
Github Repo: https://github.com/deepseek-ai/DeepSpec/tree/main… Paper: https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf…
兄弟,你为什么写得像个机器人?
你这样做是为什么?这样一点也不可信……
我打算把它用于我的研究引擎,因为在这种场景下,速度和抓取能力至关重要
只要尝试选择最优路由
方式
相似文章
DeepSeek开源DSpark,一个可将LLM推理速度提升高达85%的新框架(阅读时间18分钟)
DeepSeek开源了DSpark,这是一个采用MIT许可证的框架,利用推测解码技术将LLM推理速度提升高达85%,支持包括自家DeepSeek-V4、阿里巴巴Qwen和谷歌Gemma在内的多个模型系列。
@danielhanchen: DeepSeek刚刚发布了用于V4 Flash和Pro的DSpark,一种新的投机解码方法,将吞吐量提升51%至400%!…
DeepSeek发布了DSpark,一种投机解码方法,可将V4 Flash和Pro的吞吐量提升51%至400%,同时还开源了DeepSpec代码库,用于训练和评估草稿模型。
DeepSeek 开源推理优化,生成速度提升 60–85% [pdf]
DeepSeek 开源了 DeepSpec,这是一个用于训练和评估推测解码草稿模型的全栈代码库,可实现 60-85% 的生成速度提升。它包含数据准备、训练和评估脚本,支持多种草稿模型算法(DSpark、DFlash、Eagle3)。
@dzhulgakov:来自 @deepseek_ai 的 DSpark 巧妙融合了多种投机解码思路,将吞吐量提升 1.5 到 5 倍…
来自 DeepSeek AI 的 DSpark 集成了投机解码思路,在生产系统中实现 1.5 到 5 倍的吞吐量提升。本推文从基础开始讲解了 10 个关键思路。
@_avichawla: 研究人员发现了一种让大语言模型(LLM)提速 8.5 倍的方法!(且不影响准确度)投机解码相当有效……
研究人员提出了 DFlash 技术,这是一种利用块扩散模型(block diffusion models)进行投机解码的方法,可在不损失准确度的情况下,将大语言模型推理速度提升高达 8.5 倍。该技术已集成到 vLLM 和 SGLang 等主要框架中。