multi-token-prediction

标签

Cards List
#multi-token-prediction

在 M3 Ultra 上原生支持 DSpark MTP 的 DeepSeek V4.1F Q4(40 t/s / 800 t/s)

Reddit r/LocalLLaMA ↗ · 2026-09-15

作者针对 Apple M3 Ultra 优化了 DeepSeek V4.1 Flash,使用 DSpark 推测解码实现了高达 40 t/s 的解码速度,同时保持了与上游模型字节级一致的准确性。

0 人收藏 0 人点赞
#multi-token-prediction

接受长度越高,文本越慢:Ling在单台Spark上的n=1/2/3 MTP测试

Reddit r/LocalLLaMA ↗ · 2026-09-07

对Ling-3.0-flash的基准测试显示,在多令牌预测中,更高的接受长度会降低文本吞吐量,其中n=1是所评估工作负载中最高效的设置。

0 人收藏 0 人点赞
#multi-token-prediction

GLM-5.3 在 HF Viewer 中

Reddit r/LocalLLaMA ↗ · 2026-08-28

GLM-5.3 是一个与 GLM-5.2 架构相同的 AI 模型,通过训练取得了显著改进,现在可在 HF Viewer 中可视化,展示稀疏注意力和 MoE 路由等复杂功能。

0 人收藏 0 人点赞
#multi-token-prediction

JonathanColetti/Qwen3.8-27B-无审查-GGUF

Hugging Face Models Trending ↗ · 2026-08-14 缓存

一个量化的GGUF版本,基于Qwen3.8-27B模型,具有减少的拒绝行为,保留了多token预测,并提供多种量化选项以供llama.cpp使用。

0 人收藏 0 人点赞
#multi-token-prediction

使用 Q4_K MTP 草稿模型与 Gemma 4 31b 解码速度提升 10%

Reddit r/LocalLLaMA ↗ · 2026-08-06

有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。

0 人收藏 0 人点赞
#multi-token-prediction

AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

arXiv cs.CL ↗ · 2026-08-04 缓存

This paper introduces AdaMTP, an adaptive training paradigm for multi-token prediction that dynamically aligns prediction horizons with sequence predictability using entropy-based segmentation, consistently outperforming standard MTP on math, code, and general benchmarks across three LLM backbones.

0 人收藏 0 人点赞
#multi-token-prediction

AngelSpec:面向实际场景的高性能推测解码推理

arXiv cs.CL ↗ · 2026-07-29 缓存

AngelSpec 提出了一个统一的训练与推理框架,用于推测解码,该框架联合优化自回归多 token 预测和块并行扩散草稿模型,以处理异构实际工作负载。在 Hy3 模型系列上的实验显示,相对于自回归解码,加速比高达 2.4 倍,并且吞吐量比 DFlash 高出 11.8%。

0 人收藏 0 人点赞
#multi-token-prediction

充分发挥MTP的性能

Reddit r/LocalLLaMA ↗ · 2026-07-24

一份通过调整n_max参数来优化MTP(多令牌预测)性能的指南,附带了多种模型(如Gemma-31b和Qwen)在P100和V100 GPU上的基准测试结果。

0 人收藏 0 人点赞
#multi-token-prediction

I benchmarked Unsloth's Qwen3.6-27B NVFP4 on 1x/2x 5090s. MTP is great until it really isn't.

Reddit r/LocalLLaMA ↗ · 2026-07-21

详细基准测试:Unsloth的Qwen3.6-27B NVFP4模型在RTX 5090 GPU上的表现,显示MTP(多令牌预测)在短上下文的单次请求中能显著加速,但在批量并发或长上下文场景下则会带来不利影响。

0 人收藏 0 人点赞
#multi-token-prediction

@TeksEdge:我对谷歌 Gemma 4 技术报告最惊讶的是,他们通过大量……进行了极其激进的优化

X AI KOLs Timeline ↗ · 2026-07-08 缓存

对谷歌 Gemma 4 技术报告的评论,指出他们通过量化感知训练(QAT)和多令牌预测(MTP)进行了激进的优化,以实现更快的推理。

0 人收藏 0 人点赞
#multi-token-prediction

Qwen 27B

Reddit r/LocalLLaMA ↗ · 2026-07-03

一位用户报告称,在q6kxl量化与多token预测下,Qwen 27B在4090+3090系统上使用LCPP实现了50-90 token/s的解码速度和1500-2200 token/s的预填充速度,并指出它在各种编码任务中表现稳定、快速且连贯。

0 人收藏 0 人点赞
#multi-token-prediction

README_EN.md · openpangu/openPangu-2.0-Flash at main

Reddit r/LocalLLaMA ↗ · 2026-07-01 缓存

openPangu-2.0-Flash 是一个拥有920亿参数(其中60亿激活参数)的MoE模型,基于昇腾训练,支持512k上下文长度并具备快速思考能力。它在推理和编码基准测试上表现强劲,采用了MLA注意力及多令牌预测等架构创新。

0 人收藏 0 人点赞
#multi-token-prediction

@ollama:Gemma 4 在 Apple Silicon 上使用 Ollama 和 MLX 提速近 90%!性能提升得益于改进的多 token 预…

X AI KOLs Following ↗ · 2026-07-01 缓存

Ollama 宣布,Gemma 4 在 Apple Silicon 上使用 MLX 后速度提升近 90%,这得益于默认启用的改进多 token 预测机制,并支持自动调节以避免减速。

0 人收藏 0 人点赞
#multi-token-prediction

EntMTP:利用熵引导的多令牌预测加速大语言模型推理

arXiv cs.CL ↗ · 2026-06-29 缓存

提出EntMTP,一种无需训练的调度器,基于局部熵估计自适应调整树形注意力拓扑以进行投机解码,相较于Hydra实现1.09-1.15倍加速,相较于Medusa最高达1.36倍加速。

0 人收藏 0 人点赞
#multi-token-prediction

利用冻结的多令牌预测在Pixel上加速Gemini Nano模型(10分钟阅读)

TLDR AI ↗ · 2026-06-29 缓存

谷歌研究院推出了一种新架构,使用冻结的Multi-Token Prediction在Pixel设备上加速Gemini Nano模型,显著提升了设备端AI特性的速度和能效。

0 人收藏 0 人点赞
#multi-token-prediction

量化是否会影响MTP的草案率?

Reddit r/LocalLLaMA ↗ · 2026-06-27

本文探讨了量化是否会影响多token预测模型中的草案率,并分析了模型压缩与推理效率之间的潜在权衡。

0 人收藏 0 人点赞
#multi-token-prediction

关于推测解码/MTP的交互式解释器

Reddit r/LocalLLaMA ↗ · 2026-06-26 缓存

一个交互式指南,解释了大语言模型中的推测解码和多令牌预测,涵盖了从拒绝采样到Qwen 3.6和Gemma 4中使用的MTP等技术,配有实时图表和滑块。

0 人收藏 0 人点赞
#multi-token-prediction

MTP 下的质量较差 - Qwen 3.6, Gemma 4

Reddit r/LocalLLaMA ↗ · 2026-06-25

用户报告称,Qwen 3.6 和 Gemma 4 的 MTP 版本在代码审查任务中的输出质量低于非 MTP 版本,尽管其 token 生成速率更高,但实际速度提升微乎其微。

0 人收藏 0 人点赞
#multi-token-prediction

@jakevin7: 最近在看 GLM 5.2 相关的文档,发现一些有趣的内容分享一下。 GLM-5.2 用了 MTP(Multi-Token Prediction)来加速推理:用一个轻量的"草稿模型"先快速预测多个 token,再用大模型一次性验证,接受则跳…

X AI KOLs Following ↗ · 2026-06-19 缓存

GLM-5.2采用了MTP(Multi-Token Prediction)技术加速推理,并修复了GLM-5.1中MTP训练推理不一致导致的KV cache混用问题。

0 人收藏 0 人点赞
#multi-token-prediction

SuperThoughts:叠加态中的推理令牌

arXiv cs.LG ↗ · 2026-06-15 缓存

SuperThoughts 将连续的思维链令牌压缩为潜在表示,并每步解码两个令牌,在数学推理基准上实现了约20-30%的思维链长度缩减,准确率损失极小,同时将推理吞吐量提高了一倍。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈