kv-cache

标签

Cards List
#kv-cache

QV-PIC:面向高效RAG服务的查询感知视觉位置无关缓存

arXiv cs.CL · 18小时前 缓存

本文介绍了QV-PIC,一种查询感知的双分辨率位置无关缓存框架,用于高效的RAG服务,相比朴素渲染图像PIC,F1值提升21.6个点,同时相对于完整预填充将首令牌时间降低83.8%。

0 人收藏 0 人点赞
#kv-cache

LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

arXiv cs.AI · 18小时前 缓存

LinearKV is a training-free framework that enables position-independent caching for hybrid LLMs by using a single cached state to initialize linear layers, outperforming exact prefix-state composition and remaining compatible with existing PIC methods.

0 人收藏 0 人点赞
#kv-cache

视频世界模型中的记忆(6分钟阅读)

TLDR AI · 昨天 缓存

NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。

0 人收藏 0 人点赞
#kv-cache

SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding

arXiv cs.LG · 2天前 缓存

SPECTRA is a training-free codec that re-encodes LLM KV caches via spectral transform to concentrate bit budgets on important channels, achieving near-lossless 4x compression and usable compression up to 12x, surpassing the 2-bit quantization cliff.

0 人收藏 0 人点赞
#kv-cache

CommitKV:通过提交转换实现的多轮智能体生命周期感知KV缓存压缩

arXiv cs.LG · 2天前 缓存

CommitKV提出了一种面向多轮ReAct智能体的生命周期感知KV缓存压缩方法,通过提交转换区分休眠令牌与已完成令牌,以减少内存使用并加速推理。

0 人收藏 0 人点赞
#kv-cache

注意缓存读取成本

Lobsters Hottest · 3天前 缓存

一篇博客文章,解释了在代理型工作负载中,缓存读取成本主导了LLM推理开销,随着每轮重新读取上下文,累计成本呈二次方增长,并建议减少工具调用次数以降低成本。

0 人收藏 0 人点赞
#kv-cache

24 GB 显存跑 170 亿参数模型 + 1M 上下文:"第一次成功加载近 100 万 token 上下文,并提取出文本各处的 7 根针"

Reddit r/LocalLLaMA · 3天前

有用户报告称,在单个 RTX 3090 上,使用基于 Qwen 的 35B A3B 模型(占用 17 GB 显存),配合 BeeLlama.cpp 分支中的 KVarN 4-bit KV 缓存量化,成功运行了 100 万 token 的上下文,并从文本不同位置提取出 7 根针。

0 人收藏 0 人点赞
#kv-cache

CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG

arXiv cs.CL · 3天前 缓存

CoinRAG is a new method for long-context RAG that reuses fine-grained contextualized information nugget KV caches instead of full chunks, improving efficiency and answering quality. It achieves a new Pareto frontier with 5.3% relative F1 improvement on LongBench multi-hop QA tasks.

0 人收藏 0 人点赞
#kv-cache

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

arXiv cs.CL · 3天前 缓存

AoH is a data-free method that identifies retrieval and streaming heads from the spectral geometry of query-key projections, enabling sparse attention without runtime attention scores. At 50% sparsity it retains 96.5% of full-attention performance while reducing prefill/decode latency and KV-cache memory.

0 人收藏 0 人点赞
#kv-cache

@YRSM_Simon: 发现了 deepseek v4 flash vllm 本地部署的一个bug。 同一个 Session 秒回,切到另一个 Session 再切回来,直接重新 Prefill,kv cache 失效。 蹲了一整晚,100% 复现: A 第一次…

X AI KOLs Following · 3天前 缓存

发现 DeepSeek V4 flash 在 vLLM 本地部署中的 KV 缓存失效 Bug:切换 Session 后前缀缓存命中率为 0,导致重新 Prefill,耗时从约 1 秒暴涨到约 100 秒。根因疑为 vLLM 重用 free queue 块时调用 _maybe_evict_cached_block() 删除了缓存索引。

0 人收藏 0 人点赞
#kv-cache

@rohanpaul_ai:微软关于GitHub Copilot生产追踪的新论文表明,为什么编码代理不应像聊天请求那样提供服务……

X AI KOLs Following · 4天前 缓存

一篇分析1350万次GitHub Copilot会话的微软论文显示,编码代理的工作负载主要由自主LLM调用链主导,KV缓存和容器空闲时间强烈依赖于回合/会话结构,主张采用工作流级调度而非请求级策略。

0 人收藏 0 人点赞
#kv-cache

@shikhargupta02: 我一直在学习潜在注意力(来自 DeepSeek)。它不是为每个 token 存储完整的 K 和 V 向量,而是……

X AI KOLs Timeline · 5天前 缓存

作者分享了他用 DeepSeek 的潜在注意力训练一个小模型的见解,观察到潜在空间的使用因层而异,以及一个可以将 KV 缓存减少 4 倍且损失不变的测试时技巧。

0 人收藏 0 人点赞
#kv-cache

OasisKV:利用前瞻稀疏预取将解码中KV缓存扩展到HBM之外

Hugging Face Daily Papers · 5天前 缓存

OasisKV是一个以内存为中心的LLM推理系统,通过使用来自推测解码的前瞻令牌预取稀疏且重要的KV块,将完整KV缓存存储与HBM解耦,与密集vLLM相比实现了高达2.1倍的吞吐量提升,且精度损失极小。

0 人收藏 0 人点赞
#kv-cache

LFM2.5-2.6B 模型+KV缓存量化报告

Reddit r/LocalLLaMA · 6天前

关于使用多种 GGUF 和 KV 缓存量化方式对 LiquidAI 的 LFM2.5-2.6B 模型进行量化的详细报告,显示该模型可适配 8GB 树莓派且性能下降极小,但提醒不要使用 Q4_K_M。

0 人收藏 0 人点赞
#kv-cache

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

arXiv cs.LG · 6天前 缓存

This paper introduces QEvict, a KV-cache management scheme for LLMs that uses recoverable quantized eviction to handle attention drift during long-context decoding, improving memory efficiency while preserving important historical context.

0 人收藏 0 人点赞
#kv-cache

Echo Dot 2 能以不错的速度运行 28M 参数 LLM

Reddit r/LocalLLaMA · 6天前

一位开发者展示了如何使用 llama.cpp 在 Amazon Echo Dot 2 上本地运行 28M 参数 LLM,生成速度约 4 tokens/s,通过提示缓存实现约 2.3 秒延迟,从而支持简单的离线语音命令。

0 人收藏 0 人点赞
#kv-cache

2 x 5070ti Qwen 27B 完整配置/统计

Reddit r/LocalLLaMA · 2026-08-06

技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。

0 人收藏 0 人点赞
#kv-cache

基于二值主成分的无训练哈希注意力

arXiv cs.LG · 2026-08-06 缓存

介绍了BinaryPC,一种面向长上下文大语言模型的无训练哈希稀疏注意力方法,利用二值主成分构建哈希码,在保持准确率的同时,解码吞吐量较FlashAttention提升了3.56倍。

0 人收藏 0 人点赞
#kv-cache

在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化

arXiv cs.LG · 2026-08-06 缓存

本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。

0 人收藏 0 人点赞
#kv-cache

@seclink: 有几个显而易见的面试题是: 1. Transformer 能不能做大模型推理? 能做,那为啥不用,而是必须用 sglang 、 vllm ? - 其实本质上还是因为 Transformer 性能太拉垮 ,瓶颈在显存 (KV cache )…

X AI KOLs Timeline · 2026-08-05 缓存

讨论Transformer做大规模推理的瓶颈,并梳理2023到2026年间大模型推理优化技术的演进,包括KV cache量化、推测解码、架构创新和软硬件协同设计。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈