标签
本文提出一种基于 rollout 的训练框架(Anchor-Label Relabelling 与 In-Rollout Anchors),用于在离策略语料上训练的推测解码块草稿模型中恢复完整的监督信号,在不改动训练文本的情况下,将贪心解码下的接受长度较 DFlash 最多提升 36.5%。
DEdit 提出了一种基于扩散的草稿生成器,用于投机解码,通过 token 到 token 的预测迭代式地编辑草稿,并采用 ProposalMix 训练方案在修复错误的同时保留正确的 token。在七个基准测试上,该方法在 Qwen3-4B 和 Qwen3-8B 上分别实现了 5.72× 和 5.97× 的宏平均加速。
在同一台 Mac Studio M5 Ultra 256GB 上,使用相同框架对比了 Qwen3.8-Flash-Next(182GB oQ8e)与 Laguna-S-2.1 GGUF 在最高 262K 上下文下的表现。Qwen 在预填充阶段保持约 4,200 tok/s 的线性速度,解码稳定;而 Laguna 则呈超线性退化;质量方面双方 4/4 打平,但答题风格迥异。
两套社区推理栈在同一对 NVIDIA DGX Spark 上运行 320B GLM-5.3-Flash 的对比测试,比较 Entrpi 的 EXL3 方案与使用 DFlash2 草稿模型的 TensorFold 在文本、代码及预填充负载下的表现。
一位用户报告称,开源推理引擎 TensorFold 在 M5 Pro Mac mini 上运行 4-bit 的 Qwen3.8-27B,并配合 DFlash2 草稿模型,可达 40-60 tok/s,超越 MTPLX,性能媲美 RTX 3090 Ti。这凸显了 Apple Silicon 上本地 LLM 推理性能的快速提升。
Artificial Analysis 开源了 AA-AgentPerf-Local,这是一款推理基准测试工具,通过重放真实智能体轨迹来测量智能体式 AI 在笔记本和工作站上的运行速度,并给出了 NVIDIA DGX Spark、RTX 5090、AMD Ryzen AI Halo 和 MacBook Pro M5 Pro 的初步测试结果。
提出DSpine,一种通过网络深度注入相邻因果条件的并行推测解码drafter,在SGLang中实现高效并行执行,较DFlash在Qwen3-8B上平均接受长度提升27.8%、吞吐量提升23.3%。
ninfer-ext 是 NInfer 的扩展分支,新增了对更大 Qwen 模型的支持、更快的推测式解码、Agent 服务功能,以及针对 Qwen3.8-27B 在 NVIDIA RTX 5090 上的 EXL3 量化支持。
Ornith-1.5 模型集成了用于推测解码的 DFlash 草稿模型,已在 Hugging Face 上发布,提供 9B、397B 和 35B-A3B 尺寸。
本文介绍了mentored decoding,这是一种有损推测解码的正式方法,通过允许与目标模型的受控偏差来提高语言模型的推理速度,将其与提升理论联系起来,并证明了优化的关键性质。
本文详细介绍了 llama.cpp 中的性能优化,这些优化使得提示查询草稿生成速度最高提升 42 倍,并将内存使用减少 2.6 倍,基于 Daniel Lemire 和 Martin Ankerl 的技术。
WaveFront Decoding 引入了一个无需训练的自推测解码框架,针对循环语言模型,通过并发批量处理草拟和验证来减少延迟,在 Huginn-3.5B 上实现了高达 4.81 倍的加速。
BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。
今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。
DPara是一个并行推测解码框架,通过预计算草稿表示来消除概率性回退,在Qwen3模型上相比自回归解码实现了平均3.21倍到3.52倍的速度提升。
该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。
本文提出了TSS,一个针对特定领域大型语言模型推测解码的目标端稀疏化框架,通过跳过选定的目标层来提升推理效率和性能。
一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。
本文将混合专家模型中的推测解码问题表述为随机最短路径问题,并使用一个诊断Oracle来证明最优决策遵循平衡成本与进展的必要条件。
TreeSpark为语言模型的半自回归推测解码引入了校准式负载自适应草稿树,将草稿词元接受率提升了15-25%,解码速度加快了8-14%。