标签
一位用户报告称,开源推理引擎 TensorFold 在 M5 Pro Mac mini 上运行 4-bit 的 Qwen3.8-27B,并配合 DFlash2 草稿模型,可达 40-60 tok/s,超越 MTPLX,性能媲美 RTX 3090 Ti。这凸显了 Apple Silicon 上本地 LLM 推理性能的快速提升。
Artificial Analysis 开源了 AA-AgentPerf-Local,这是一款推理基准测试工具,通过重放真实智能体轨迹来测量智能体式 AI 在笔记本和工作站上的运行速度,并给出了 NVIDIA DGX Spark、RTX 5090、AMD Ryzen AI Halo 和 MacBook Pro M5 Pro 的初步测试结果。
提出DSpine,一种通过网络深度注入相邻因果条件的并行推测解码drafter,在SGLang中实现高效并行执行,较DFlash在Qwen3-8B上平均接受长度提升27.8%、吞吐量提升23.3%。
ninfer-ext 是 NInfer 的扩展分支,新增了对更大 Qwen 模型的支持、更快的推测式解码、Agent 服务功能,以及针对 Qwen3.8-27B 在 NVIDIA RTX 5090 上的 EXL3 量化支持。
Ornith-1.5 模型集成了用于推测解码的 DFlash 草稿模型,已在 Hugging Face 上发布,提供 9B、397B 和 35B-A3B 尺寸。
本文介绍了mentored decoding,这是一种有损推测解码的正式方法,通过允许与目标模型的受控偏差来提高语言模型的推理速度,将其与提升理论联系起来,并证明了优化的关键性质。
本文详细介绍了 llama.cpp 中的性能优化,这些优化使得提示查询草稿生成速度最高提升 42 倍,并将内存使用减少 2.6 倍,基于 Daniel Lemire 和 Martin Ankerl 的技术。
WaveFront Decoding 引入了一个无需训练的自推测解码框架,针对循环语言模型,通过并发批量处理草拟和验证来减少延迟,在 Huginn-3.5B 上实现了高达 4.81 倍的加速。
BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。
今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。
DPara是一个并行推测解码框架,通过预计算草稿表示来消除概率性回退,在Qwen3模型上相比自回归解码实现了平均3.21倍到3.52倍的速度提升。
该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。
本文提出了TSS,一个针对特定领域大型语言模型推测解码的目标端稀疏化框架,通过跳过选定的目标层来提升推理效率和性能。
一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。
本文将混合专家模型中的推测解码问题表述为随机最短路径问题,并使用一个诊断Oracle来证明最优决策遵循平衡成本与进展的必要条件。
TreeSpark为语言模型的半自回归推测解码引入了校准式负载自适应草稿树,将草稿词元接受率提升了15-25%,解码速度加快了8-14%。
扩展Splash引擎以在Apple Silicon上支持原生8位Qwen3.8-27B模型,实现37-55 tok/s速度且无量化质量损失,并支持最高256k上下文缩放。
SwitchSD 是一种用于 LLM 推测解码的自适应框架,利用内在模型信号在神经草稿与基于上下文的复制之间动态切换,与 EAGLE3 等基线相比,吞吐量最高可提升 15%。
Zarya 是一种混合语言模型,联合优化自回归和掩码扩散目标,实现灵活训练和双模推理,已公开发布0.6B、1.7B和4B大小的模型。
ByteShape 发布了完整的 ShapeLearn 量化版 Qwen 3.8 27B 模型,采用 GGUF 格式,基准测试显示质量-速度前沿有所改进,并支持投机解码。