标签
ByteShape 发布了完整的 ShapeLearn 量化版 Qwen 3.8 27B 模型,采用 GGUF 格式,基准测试显示质量-速度前沿有所改进,并支持投机解码。
在 dotAI 大会上关于 llama.cpp 投机解码方法 (MTP, dflash, dspark) 的演讲回放即将发布。
Intel 发布 OpenVINO 2026.4,扩展了 AI 模型支持,性能提升如多令牌预测,以及针对 CPU、GPU 和 NPU 的分析和推理新功能。
本文构建了大语言模型推理优化的成本-质量-延迟帕累托图谱,使用校准的模拟器评估不同硬件和场景下的配置和组合。
FlexEE介绍了一种自推测和KV缓存兼容的早期退出框架,用于卸载部署中的高效LLM推理,在Llama模型上实现了显著加速,且精度损失最小化。
作者针对 Apple M3 Ultra 优化了 DeepSeek V4.1 Flash,使用 DSpark 推测解码实现了高达 40 t/s 的解码速度,同时保持了与上游模型字节级一致的准确性。
R9V 更新在双 AMD R9700 GPU 上运行 Qwen3.8 Flash Next 和 IQ4_XS 时,提供约 100 tok/s 的性能,新增支持 Q4_K_XL(50 tok/s),修复崩溃问题并增强诊断功能。
本文研究了Orthrus的无损性,Orthrus是一种用于推理加速的混合自回归-扩散模型,发现其需要高数值精度(FP32)来实现精确轨迹匹配,而BF16精度偏差并不影响下游性能。
针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。
Qwen 3.8 Flash Next 模型在 CUDA.fast 基准测试中取得了100%的得分,在 DGX Spark 上实现了117.8%的综合速度提升,利用了推测性解码技术。
Osprey引入了一种针对推测解码中草稿模型的目标无关预训练方法,通过从现成模型中引导并适应最少的特定目标工作来提高效率,在多个大语言模型上实现了显著的接受率提升。
本文介绍了X-CoSD,一个通信高效的跨词汇协作推测解码框架,通过拆分残差重采样来优化分布式大语言模型推理,以减少开销,同时保持服务器端大语言模型的质量。
作者解释了投机解码如何影响编码代理的速度,样板代码上较高的接受率导致打字更快,并讨论了其他影响性能的因素,如缓存未命中。
在完整上下文下对SGLang、llama.cpp和FreeToken在Qwen3.8-Flash-Next上的基准测试显示,SGLang实现最快的首token时间为35.4秒,而llama.cpp基线耗时258.4秒,推测解码提供了性能提升。
对Ling-3.0-flash的基准测试显示,在多令牌预测中,更高的接受长度会降低文本吞吐量,其中n=1是所评估工作负载中最高效的设置。
本文提出了一种通过在线草稿协同训练加速大规模强化学习后训练中投机解码的系统,利用上下文并行注意力扩展和跨阶段特征传输。
Jina-OCR-v1 是一款高效的端到端文档解析模型,通过结合推测解码与密集可验证奖励技术,可在低预算 GPU 上实现高精度与高处理速度,在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4。
AdaptiveSpec是一种无训练的每步推测解码方法,它自适应调整令牌验证和草稿树形状以提升LLM推理吞吐量,在基准测试中提高性能高达56%的同时保持高准确性。
TorchSpec 是一个用于训练推测解码草稿模型的 PyTorch 原生框架,与 vllm 合作发布,并在 NVIDIA GB200 硬件上使用 Kimi K3 草稿模型进行了演示。
发布Uzu中的推测解码实现,初步支持Qwen3.6 27B,并即将支持Qwen3.8 27B和Muse Glimmer。