@DeRonin_: DeepSeek 刚发布了一篇5页论文和免费GitHub仓库,能让任何LLM响应速度提升80%,这项技术叫推测性解码...

X AI KOLs Following 论文

摘要

DeepSeek 发布了一篇论文以及采用MIT许可证的开源实现(DSpark),通过使用小型“猜测”模型和大型“检查”模型,将LLM响应速度提升高达80%,同时兼顾速度与准确率,无需权衡取舍。

DeepSeek 刚发布了一篇5页论文和免费GitHub仓库,能让任何LLM响应速度提升80% 这项技术叫做推测性解码。用大白话说就是: 猜测 → 检查 → 保留 → 重复 > 猜测:一个小型快速模型预测接下来的几个词 > 检查:大型智能模型一次性检查所有猜测 > 保留:锁定正确的词,修正第一个错误的词 > 重复:再次进行,速度比正常情况快2-4倍 DeepSeek 的版本(DSpark)首次结合了两种始终需要权衡的方法:同时获得速度和准确率 在其旗舰模型上的生产效果:能够处理多50%的请求,响应速度提升高达80% 如何使用它: > 仅使用AI应用:预计很快会明显提速 > 使用AI进行开发:将此技术集成到你的技术栈中,立即获得2倍加速 > 运行自己的模型:立即克隆该仓库,并应用到你运行的任何模型上 其他AI实验室一直对此技术保密。现在它免费、开源可选、采用MIT许可证 这完全改变了我本周对AI产品的思考方式 本月最具影响力的发布之一 下方是仓库和论文 ↓
查看原文
查看缓存全文

缓存时间: 2026/06/27 20:01

DeepSeek 刚刚发布了一篇5页的论文和一个免费的GitHub仓库,能让任何LLM的响应速度提高80%

这种技术叫做推测解码(speculative decoding)。简单来说:

猜测 → 检查 → 保留 → 重复

猜测:一个小而快的模型预测接下来几个词 检查:大而聪明的模型一次性检查所有猜测 保留:锁定正确的,修正第一个错误的 重复:再来一次,速度比正常快2-4倍

DeepSeek的版本(DSpark)是首个将两种一直存在取舍的方法结合起来的方案:同时获得速度和准确性

在其旗舰模型上的生产环境结果:处理请求量增加50%,响应速度提升高达80%

如何使用它:

仅使用AI应用:预计它们很快会明显变快 用AI构建:将其集成到你的技术栈中,立即获得2倍加速 运行你自己的模型:今天就克隆仓库,并将其应用于你运行的任何模型

其他AI实验室一直对此秘而不宣。现在它免费开源在GitHub上,采用MIT许可证

这完全改变了我这周对AI产品的思考方式

本月最重磅的发布之一

仓库和论文见下方 ↓

以下是其工作原理的完整解析:

Github Repo: https://github.com/deepseek-ai/DeepSpec/tree/main… Paper: https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf…

兄弟,你为什么写得像个机器人?

你这样做是为什么?这样一点也不可信……

我打算把它用于我的研究引擎,因为在这种场景下,速度和抓取能力至关重要

只要尝试选择最优路由

方式

相似文章

DeepSeek 开源推理优化,生成速度提升 60–85% [pdf]

Hacker News Top

DeepSeek 开源了 DeepSpec,这是一个用于训练和评估推测解码草稿模型的全栈代码库,可实现 60-85% 的生成速度提升。它包含数据准备、训练和评估脚本,支持多种草稿模型算法(DSpark、DFlash、Eagle3)。