llm-inference

标签

Cards List
#llm-inference

@divaagurlxw: 我花了几个月时间学习 LLM 推理。以下是我遇到过的最佳资源。1. 基础……

X AI KOLs Timeline · 2026-08-02 缓存

一条推文串分享了一份精心挑选的 LLM 推理学习资源清单,涵盖分词、GPU 硬件、量化与推测解码等优化技术,以及 vLLM 和 SGLang 等推理引擎,并附有 NVIDIA 架构师演讲的总结。

0 人收藏 0 人点赞
#llm-inference

面向突发性LLM推理的预测性投机KV复制

Hacker News Top · 2026-07-31

本文介绍了一种用于处理突发性LLM推理工作负载的预测性投机KV复制方法,代码可在GitHub上获取。

0 人收藏 0 人点赞
#llm-inference

来自未来的回望:基于反因果惊奇度的键值缓存管理

arXiv cs.LG · 2026-07-31 缓存

本文提出了一种KV缓存逐出策略,通过反因果惊奇度对令牌进行评分,移除那些可以从未来上下文中很好预测的过去令牌。该方法无需训练、分布内,并通过快速的单层近似实现了具有竞争力的性能。

0 人收藏 0 人点赞
#llm-inference

Prox:通过近似中间通道显著性在LLM中实现免训练FFN激活稀疏性

arXiv cs.LG · 2026-07-31 缓存

Prox是一个用于LLM中稀疏SwiGLU FFN的免训练框架,利用近似中间通道显著性来构建通道掩码,无需密集计算。在十个LLM上,Prox优于免训练基线,在70%稀疏度下实现了高达1.99倍的端到端解码加速。

0 人收藏 0 人点赞
#llm-inference

整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL · 2026-07-31 缓存

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。

0 人收藏 0 人点赞
#llm-inference

超越KV重建:投机解码中MLA草稿模型的功能重构

arXiv cs.LG · 2026-07-31 缓存

本文提出功能重构方法,将MHA/GQA检查点转换为投机解码的MLA草稿模型,直接优化注意力模块以保留令牌接受率。报告在涉及Llama/Qwen模型和多种转换方法的192种配置中持续改进。

0 人收藏 0 人点赞
#llm-inference

开源三值LLM引擎:基于Rust/CUDA,用于消费级GPU上的模型量化、服务与训练,名为Tritium(Apache 2.0)

Reddit r/LocalLLaMA · 2026-07-31

介绍Tritium,一个开源的Rust/CUDA引擎,用于在消费级GPU上对LLM进行三值(1.58位)量化、服务与训练。它声称在三值模型上推理速度比llama.cpp更快,并引入了一种名为SALT的新量化方法。

0 人收藏 0 人点赞
#llm-inference

重新审视推测解码中的有损验证:机制、权衡与失效模式

arXiv cs.CL · 2026-07-30 缓存

本文分析了推测解码中的有损验证方案,将其分为基于截断的验证和协作验证两类,并指出了保持生成质量的陷阱和原则。

0 人收藏 0 人点赞
#llm-inference

@digitalocean: 停止为每次LLM请求重复处理相同上下文付费。DigitalOcean AI-Native Cloud上的提示缓存自动…

X AI KOLs Timeline · 2026-07-29 缓存

DigitalOcean推出了LLM推理的提示缓存功能,自动缓存系统提示等重复上下文,无需更改代码即可将输入令牌成本降低多达80%,并附有关于盈亏平衡计算的详细教程。

0 人收藏 0 人点赞
#llm-inference

Launch HN: Tokenless (YC S26) – 自动切换模型以节省成本

Hacker News Top · 2026-07-29 缓存

Tokenless 是一家获得 YC 支持的初创公司,提供 LLM API 调用的即插即用替代方案,自动将请求路由到最具成本效益的模型,而不牺牲质量,有望将推理成本降低一半。

0 人收藏 0 人点赞
#llm-inference

内部部署 LLM 推理在 Kubernetes 上的生产运行手册

Reddit r/LocalLLaMA · 2026-07-29

作者分享了在其组织中构建基础设施的经验基础上,用于在 Kubernetes 上部署内部 LLM 推理的运行手册。

0 人收藏 0 人点赞
#llm-inference

@junupark_: 新笔记: 深入了解 nano-vllm-v1 这可以看作是我上一篇关于 nano-vllm 的笔记的第二部分。在这篇笔记中,我探讨了…

X AI KOLs Timeline · 2026-07-28 缓存

这篇笔记解释了在 nano-vllm-v1 中分块预填充(chunked prefill)和混合批处理(mixed batching)的实现,并与前一版本进行了性能基准测试。

0 人收藏 0 人点赞
#llm-inference

@akshay_pachaar:每个推理引擎都犯了同样的错误。像 vLLM 或 SGLang 这样的推理引擎,是位于你的请求与模型权重之间的软件……

X AI KOLs Following · 2026-07-27 缓存

LMCache 是一个开源的 KV 缓存管理层,它将缓存 I/O 与计算分离,可插入 vLLM、SGLang 和 TensorRT-LLM,通过并行化缓存查找和共享 GPU 内存,实现高达 14 倍的首 token 延迟降低和 4 倍的解码加速。

0 人收藏 0 人点赞
#llm-inference

Qwen3.6-27B 推测解码在更大量化下性能提升

Reddit r/LocalLLaMA · 2026-07-27

Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。

0 人收藏 0 人点赞
#llm-inference

RIS-Kernel:一种通过稀疏注意力实现长上下文LLM推理的模型无关架构

arXiv cs.LG · 2026-07-27 缓存

RIS-Kernel 提出了一种模型无关的稀疏注意力架构(RIS),将长上下文 LLM 推理中的自注意力复杂度从 O(N^2) 降低到 O(N log N),使得无需 GPU 加速即可在普通 CPU 硬件上运行。

0 人收藏 0 人点赞
#llm-inference

支持MSA的Minimax M3模型已合并至llama.cpp

Reddit r/LocalLLaMA · 2026-07-26 缓存

支持MSA的Minimax M3模型已合并至llama.cpp,从而可以使用MSA架构对Minimax M3模型进行推理。

0 人收藏 0 人点赞
#llm-inference

BeeLlama.cpp v0.4.1:KVarN、KV精度尾部、q2_0-q3_1 KV缓存,改进支持。KLD基准测试:尾部1024使kvarn5和q6_0匹配q8_0,且显存占用大幅降低

Reddit r/LocalLLaMA · 2026-07-26

BeeLlama.cpp v0.4.1引入了KVarN、KV精度尾部以及改进的KV缓存支持。基准测试表明,使用尾部1024可使kvarn5和q6_0达到与q8_0相当的精度,同时显存占用更低。

0 人收藏 0 人点赞
#llm-inference

DKV: 用于本地LLM推理的开源KV-cache压缩框架(CLI + 技术报告)

Reddit r/LocalLLaMA · 2026-07-25

DKV是一个开源框架,用于在本地LLM推理过程中压缩KV-cache,提供CLI和技术报告。

0 人收藏 0 人点赞
#llm-inference

Hetzner 正在开发 LLM 推理服务

Hacker News Top · 2026-07-24 缓存

Hetzner 推出了一项实验性的 LLM 推理 API 服务,提供与 OpenAI 兼容的端点,并搭载 Qwen3.6-35B-A3B-FP8 模型。该服务在实验期间免费,无 SLA,旨在收集用户反馈。

0 人收藏 0 人点赞
#llm-inference

摒弃锚点:基于Pulsar Attention的分布式系统统计上下文摘要

arXiv cs.CL · 2026-07-24 缓存

Pulsar Attention 用内容感知的摘要和注意力汇取代了Star Attention中的静态锚点,在长上下文基准测试中将FLOPs降低了3.3倍,同时超越了密集注意力。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈