标签
本文详细介绍了 llama.cpp 中的性能优化,这些优化使得提示查询草稿生成速度最高提升 42 倍,并将内存使用减少 2.6 倍,基于 Daniel Lemire 和 Martin Ankerl 的技术。
BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。
今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。
DPara是一个并行推测解码框架,通过预计算草稿表示来消除概率性回退,在Qwen3模型上相比自回归解码实现了平均3.21倍到3.52倍的速度提升。
该推文讨论了提供商如何在发布后根据使用模式和硬件调整量化和推测解码策略,并介绍了为NeurIPS教育轨道准备的交互式推测解码教程。
本文提出了TSS,一个针对特定领域大型语言模型推测解码的目标端稀疏化框架,通过跳过选定的目标层来提升推理效率和性能。
一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。
本文将混合专家模型中的推测解码问题表述为随机最短路径问题,并使用一个诊断Oracle来证明最优决策遵循平衡成本与进展的必要条件。
TreeSpark为语言模型的半自回归推测解码引入了校准式负载自适应草稿树,将草稿词元接受率提升了15-25%,解码速度加快了8-14%。
扩展Splash引擎以在Apple Silicon上支持原生8位Qwen3.8-27B模型,实现37-55 tok/s速度且无量化质量损失,并支持最高256k上下文缩放。
SwitchSD 是一种用于 LLM 推测解码的自适应框架,利用内在模型信号在神经草稿与基于上下文的复制之间动态切换,与 EAGLE3 等基线相比,吞吐量最高可提升 15%。
Zarya 是一种混合语言模型,联合优化自回归和掩码扩散目标,实现灵活训练和双模推理,已公开发布0.6B、1.7B和4B大小的模型。
ByteShape 发布了完整的 ShapeLearn 量化版 Qwen 3.8 27B 模型,采用 GGUF 格式,基准测试显示质量-速度前沿有所改进,并支持投机解码。
在 dotAI 大会上关于 llama.cpp 投机解码方法 (MTP, dflash, dspark) 的演讲回放即将发布。
Intel 发布 OpenVINO 2026.4,扩展了 AI 模型支持,性能提升如多令牌预测,以及针对 CPU、GPU 和 NPU 的分析和推理新功能。
本文构建了大语言模型推理优化的成本-质量-延迟帕累托图谱,使用校准的模拟器评估不同硬件和场景下的配置和组合。
FlexEE介绍了一种自推测和KV缓存兼容的早期退出框架,用于卸载部署中的高效LLM推理,在Llama模型上实现了显著加速,且精度损失最小化。
作者针对 Apple M3 Ultra 优化了 DeepSeek V4.1 Flash,使用 DSpark 推测解码实现了高达 40 t/s 的解码速度,同时保持了与上游模型字节级一致的准确性。
R9V 更新在双 AMD R9700 GPU 上运行 Qwen3.8 Flash Next 和 IQ4_XS 时,提供约 100 tok/s 的性能,新增支持 Q4_K_XL(50 tok/s),修复崩溃问题并增强诊断功能。
本文研究了Orthrus的无损性,Orthrus是一种用于推理加速的混合自回归-扩散模型,发现其需要高数值精度(FP32)来实现精确轨迹匹配,而BF16精度偏差并不影响下游性能。