LM Studio 终于支持 MTP 推测解码
摘要
LM Studio 在最新的 Beta 更新中增加了对 MTP 推测解码的支持,提升了本地大语言模型的推理速度。
https://preview.redd.it/1uuzjm0ll72h1.png?width=923&format=png&auto=webp&s=1af7d7594be1e08ff7ad6797e2bc53e9410769a3 更新到 0.4.14 Build 2 (Beta),并确保你的 llama.cpp 引擎版本为 2.15.0。https://preview.redd.it/x0vdwjb3n72h1.png?width=742&format=png&auto=webp&s=6367de44208004d2f50194d78a542c46b040dceb 你还需要选择“手动选择模型加载参数”,并在加载模型前启用 MTP,它默认不是开启的。
相似文章
@lmstudio: MTP 已在 LM Studio 0.4.14 中可用。请打开声音。
LM Studio 0.4.14 引入了 MTP(多轮提示)支持,增强了其本地 AI 模型能力。
llama + spec: 由 am17an 提交的 MTP 支持 · Pull Request #22673 · ggml-org/llama.cpp
拉取请求为 llama.cpp 添加多令牌预测(MTP)支持,启用推测解码以加速推理。
llama.cpp MTP推测解码简化:2026年7月在密集模型上大获成功,MoE上表现平平
对llama.cpp中原生MTP推测解码的分析表明,像Qwen3.6-27B这样的密集模型获得了显著的加速(1.4倍至2.2倍),但在MoE架构上结果不尽人意,由于每步开销已经很低,收益微乎其微。
模型:由 satindergrewal 添加 Hy3 (hy_v3) 支持及 MTP 推测解码 · 拉取请求 #25395 · ggml-org/llama.cpp
此拉取请求为 llama.cpp 添加了对 Hy3 (hy_v3) 模型的支持及 MTP 推测解码,从而实现了该架构的高效推理。
@_avichawla: 研究人员发现了一种让大语言模型(LLM)提速 8.5 倍的方法!(且不影响准确度)投机解码相当有效……
研究人员提出了 DFlash 技术,这是一种利用块扩散模型(block diffusion models)进行投机解码的方法,可在不损失准确度的情况下,将大语言模型推理速度提升高达 8.5 倍。该技术已集成到 vLLM 和 SGLang 等主要框架中。