标签
发布Uzu中的推测解码实现,初步支持Qwen3.6 27B,并即将支持Qwen3.8 27B和Muse Glimmer。
用户 @ViC305 成功在单个 DGX Spark 上运行 DeepSeek-V4-Flash-Vision,结合 EXL3 MixedK 和 DSpark 推测解码,提升了性能并解决了多模态 AI 部署的技术问题。
该文章详细介绍了一款名为"Sunny Narrator"的开源工具,该工具利用基于Tesla P40 GPU的双模型AI流水线翻译小说,并通过优化的llama-server配置与MTP投机解码技术,实现了每秒40-70个token的生成速度。
本文提出GLANCE,一种用于视觉语言模型无损推测解码的单次传递块起草方法,可实现高达2.93倍的生成加速,同时保持输出不变。
本文是一篇实践指南,介绍如何为代理工作运行本地AI模型,重点讨论硬件权衡,并引入Magnitude,一个开源推理服务器,它简化配置以优化性能。
本文呈现了一项严格对照的审计,比较了用于高效LLM推理的周期步进层跳过方法,如ConfLayers和SWIFT,并分析了训练的路由替代方案,发现SWIFT在准确性和真实推理速度上更优。
验证感知训练(VAT)通过在训练中模拟顺序验证并自适应损失权重以匹配接受模式,改进投机解码的草稿模型,从而提升接受长度和推理加速。
在NVIDIA V100 GPU上实现Qwen3.8-27B模型每秒56个令牌的推理速度,展示了使用推测解码技术在旧硬件上进行经济高效的本地AI部署。
受 CS336 启发,一个用于 LLM 推理的静态性能模型提供了 VRAM、time-to-first-token 和吞吐量的分析界限,涵盖多种配置,并针对公开基准进行校准。
腾讯发布Hy4-preview,这是一款新的旗舰AI模型,采用混合专家架构,总参数为770B,每个token激活49B参数,具备如Gated DeepSeek Sparse Attention和identity Hyper-Connections等先进技术。
TreeGraft引入了一个用于树基推测解码的多草稿器框架,通过自适应调度优化草稿树质量,以实现比单草稿器方法显著的推理加速。
这个拉取请求为 ik_llama.cpp 引入了 Dflash 2 推测解码和其他性能改进,ik_llama.cpp 是 llama.cpp 的一个分支,专注于增强 LLM 的 CPU 推理和量化技术。
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
本文调查并实证诊断了多模态推测解码在基于扩散的并行草拟方法方面的就绪性,分析了各种多模态架构并提供了比较评估。
LiLiCorr是一种轻量似然模型,通过关联每个位置的边缘分布来提高推测解码的令牌连贯性,从而增加语言模型推理中的接受长度和吞吐量。
GRAFT 引入了一个用于基于扩散语言模型的推测解码的草稿树构建框架,通过优化边选择和预算分配,实现了相对于自回归解码 2.13 倍至 6.36 倍的加速,同时开销很低。
本文介绍了SSR,一种无需训练的自推测解码方法,利用思维链来加速大语言模型中的推理,在结构化生成任务上实现高达24.1%的延迟减少。
分布式LLM推理框架ShardFlow通过推测解码与CUDA图缓解WAN延迟,在云区域间对Qwen2.5-7B实现28 TPS。
在一个 llama.cpp 分支中实现了 DSpark PC Tree,根据基准测试结果,在 Qwen 3.0 模型上显示了推理速度最高提升29.5%的性能优势。
LFM2.5 DSpark by liquidai 已集成到 mlx-vlm v0.6.16 中,使 M5 Max 上的推测解码速度提升高达 3.7×,且输出零漂移,用于设备端视觉语言模型推理。