标签
一条推文串分享了一份精心挑选的 LLM 推理学习资源清单,涵盖分词、GPU 硬件、量化与推测解码等优化技术,以及 vLLM 和 SGLang 等推理引擎,并附有 NVIDIA 架构师演讲的总结。
本文提出了一种KV缓存逐出策略,通过反因果惊奇度对令牌进行评分,移除那些可以从未来上下文中很好预测的过去令牌。该方法无需训练、分布内,并通过快速的单层近似实现了具有竞争力的性能。
Prox是一个用于LLM中稀疏SwiGLU FFN的免训练框架,利用近似中间通道显著性来构建通道掩码,无需密集计算。在十个LLM上,Prox优于免训练基线,在70%稀疏度下实现了高达1.99倍的端到端解码加速。
本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。
本文提出功能重构方法,将MHA/GQA检查点转换为投机解码的MLA草稿模型,直接优化注意力模块以保留令牌接受率。报告在涉及Llama/Qwen模型和多种转换方法的192种配置中持续改进。
介绍Tritium,一个开源的Rust/CUDA引擎,用于在消费级GPU上对LLM进行三值(1.58位)量化、服务与训练。它声称在三值模型上推理速度比llama.cpp更快,并引入了一种名为SALT的新量化方法。
本文分析了推测解码中的有损验证方案,将其分为基于截断的验证和协作验证两类,并指出了保持生成质量的陷阱和原则。
DigitalOcean推出了LLM推理的提示缓存功能,自动缓存系统提示等重复上下文,无需更改代码即可将输入令牌成本降低多达80%,并附有关于盈亏平衡计算的详细教程。
Tokenless 是一家获得 YC 支持的初创公司,提供 LLM API 调用的即插即用替代方案,自动将请求路由到最具成本效益的模型,而不牺牲质量,有望将推理成本降低一半。
作者分享了在其组织中构建基础设施的经验基础上,用于在 Kubernetes 上部署内部 LLM 推理的运行手册。
这篇笔记解释了在 nano-vllm-v1 中分块预填充(chunked prefill)和混合批处理(mixed batching)的实现,并与前一版本进行了性能基准测试。
LMCache 是一个开源的 KV 缓存管理层,它将缓存 I/O 与计算分离,可插入 vLLM、SGLang 和 TensorRT-LLM,通过并行化缓存查找和共享 GPU 内存,实现高达 14 倍的首 token 延迟降低和 4 倍的解码加速。
RIS-Kernel 提出了一种模型无关的稀疏注意力架构(RIS),将长上下文 LLM 推理中的自注意力复杂度从 O(N^2) 降低到 O(N log N),使得无需 GPU 加速即可在普通 CPU 硬件上运行。
支持MSA的Minimax M3模型已合并至llama.cpp,从而可以使用MSA架构对Minimax M3模型进行推理。
BeeLlama.cpp v0.4.1引入了KVarN、KV精度尾部以及改进的KV缓存支持。基准测试表明,使用尾部1024可使kvarn5和q6_0达到与q8_0相当的精度,同时显存占用更低。
DKV是一个开源框架,用于在本地LLM推理过程中压缩KV-cache,提供CLI和技术报告。
Hetzner 推出了一项实验性的 LLM 推理 API 服务,提供与 OpenAI 兼容的端点,并搭载 Qwen3.6-35B-A3B-FP8 模型。该服务在实验期间免费,无 SLA,旨在收集用户反馈。
Pulsar Attention 用内容感知的摘要和注意力汇取代了Star Attention中的静态锚点,在长上下文基准测试中将FLOPs降低了3.3倍,同时超越了密集注意力。