kv-cache

标签

Cards List
#kv-cache

TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning

arXiv cs.AI · 2026-08-05 缓存

TaskPress introduces a query-agnostic KV cache compression framework that uses a task guide as a meta-query and quantization scale factors to prune irrelevant tokens, enabling reusable caches across diverse queries with negligible overhead.

0 人收藏 0 人点赞
#kv-cache

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

arXiv cs.CL · 2026-08-04 缓存

This empirical study examines practical online KV cache compaction for LLM agents, comparing token eviction and attention matching methods under different proxy query sources. It finds that delaying compaction to use future agent queries recovers performance, and token eviction preserves accuracy while reducing KV cache by 80%.

0 人收藏 0 人点赞
#kv-cache

S$^4$R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching

arXiv cs.CL · 2026-08-04 缓存

This paper introduces S4R, a low-rank KV cache compression method that combines selective token sampling, subspace construction, and sparse reconstruction to achieve up to 5× compression with near full-cache accuracy on LongBench and RULER benchmarks.

0 人收藏 0 人点赞
#kv-cache

@NVIDIAAI: A long-context model's serving speed is largely decided before training starts. Attention used to be a small part of a …

X AI KOLs Timeline · 2026-08-03 缓存

NVIDIA explains how attention architecture choices (group size, head dimension, KV-cache size, parallelism) set the ceiling for long-context inference performance, with guidelines for co-designing models for faster serving.

0 人收藏 0 人点赞
#kv-cache

更小、更快、更安全:大规模运行Kimi和GLM

Hacker News Top · 2026-08-03 缓存

Cloudflare详细介绍了如何利用FP8 KV缓存量化和权重压缩,高效服务Kimi K2.6和GLM 5.2等大型开源MoE模型,在不损失准确性的情况下提升吞吐量并降低成本。

0 人收藏 0 人点赞
#kv-cache

@TeachTheMachine: 使用Transformer模型:从训练到推理

X AI KOLs Timeline · 2026-08-03 缓存

本教程介绍如何使用Transformer模型,从训练到推理,重点讲解自回归生成、prefill(预填充)与decode(解码)阶段,以及用于高效推理的键值缓存。

0 人收藏 0 人点赞
#kv-cache

ResKV:重构被省略的注意力贡献以实现固定预算的KV缓存压缩

arXiv cs.CL · 2026-08-03 缓存

ResKV提出了一种KV缓存压缩方法,将固定预算分为精确的主缓存和紧凑的残差缓存,以重构被省略的注意力贡献,从而在多个骨干网络上提升LongBench和RULER上的性能。

0 人收藏 0 人点赞
#kv-cache

更快但不同:加速多模态扩散语言模型中内容漂移的诊断与控制

arXiv cs.CL · 2026-08-03 缓存

本文研究了无训练加速如何静默改变基于扩散的多模态大语言模型生成的内容,并提出了成对诊断和一致性控制方法来缓解内容漂移。

0 人收藏 0 人点赞
#kv-cache

Mixture-of-Translators: 跨异构大语言模型的KV缓存翻译

arXiv cs.CL · 2026-08-03 缓存

本文介绍了Mixture-of-Translators(MoT),一个跨异构大语言模型翻译KV缓存的框架,使得不同架构之间能够复用缓存。实验表明,在Qwen2.5、GPT-2和OPT模型上,问答性能和长上下文质量得以保持。

0 人收藏 0 人点赞
#kv-cache

Topology-Aware Data Movement for Disaggregated GPU Inference

arXiv cs.LG · 2026-08-03 缓存

This paper presents a topology-aware data movement orchestrator for disaggregated LLM inference, which dynamically selects optimal transport based on interconnect hierarchy and overlaps KV cache transfer with computation, achieving 3-18x transfer latency reduction over uniform RDMA.

0 人收藏 0 人点赞
#kv-cache

切勿对 DeepSeek V4 Flash 的 KV 缓存进行量化

Reddit r/LocalLLaMA · 2026-08-02

一篇技术文章警告不要对 DeepSeek V4 Flash 的 KV 缓存进行量化,与 Qwen 397B 相比,其在困惑度、KL 散度和 token 概率方面表现出显著的质量下降。

0 人收藏 0 人点赞
#kv-cache

@beamnxw: 这篇论文简直太疯狂了 一篇计算机科学论文构建了一个基于图的工作流服务引擎,将智能体操作统一到全局 wGraph…

X AI KOLs Timeline · 2026-08-02 缓存

一篇计算机科学论文提出了一种基于图的工作流服务引擎,将智能体操作统一到全局 wGraph 中,利用动态图合成和差异 KV 缓存复用,将智能体准确率提升 4.95%,同时将 GPU 内存使用量降低 4 倍。

0 人收藏 0 人点赞
#kv-cache

RestoreKV:在激进的查询无关KV缓存驱逐下恢复全缓存行为

Hugging Face Daily Papers · 2026-08-02 缓存

RestoreKV 引入了一种学习式恢复机制,作为查询无关 KV 缓存驱逐的补充;它通过一次 LoRA 适配的遍历生成紧凑的上下文条件恢复缓存,从而在激进预算下恢复全缓存行为,并在四个长上下文基准上提升了性能。

0 人收藏 0 人点赞
#kv-cache

面向突发性LLM推理的预测性投机KV复制

Hacker News Top · 2026-07-31

本文介绍了一种用于处理突发性LLM推理工作负载的预测性投机KV复制方法,代码可在GitHub上获取。

0 人收藏 0 人点赞
#kv-cache

来自未来的回望:基于反因果惊奇度的键值缓存管理

arXiv cs.LG · 2026-07-31 缓存

本文提出了一种KV缓存逐出策略,通过反因果惊奇度对令牌进行评分,移除那些可以从未来上下文中很好预测的过去令牌。该方法无需训练、分布内,并通过快速的单层近似实现了具有竞争力的性能。

0 人收藏 0 人点赞
#kv-cache

整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL · 2026-07-31 缓存

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。

0 人收藏 0 人点赞
#kv-cache

先召回再排序:基于相似性引导的 Top-$K$ 复用于高效长上下文注意力

arXiv cs.CL · 2026-07-31 缓存

ReTopK 是一种无需训练的方法,通过复用历史查询-支持对来加速长上下文大语言模型中的动态 Top-K 稀疏注意力,从而避免全上下文评分和全局 Top-K 选择。在 128K 上下文下,相比精确 Top-K,它实现了最高 3.07 倍的加速,且困惑度仅增加 0.50%。

0 人收藏 0 人点赞
#kv-cache

超越KV重建:投机解码中MLA草稿模型的功能重构

arXiv cs.LG · 2026-07-31 缓存

本文提出功能重构方法,将MHA/GQA检查点转换为投机解码的MLA草稿模型,直接优化注意力模块以保留令牌接受率。报告在涉及Llama/Qwen模型和多种转换方法的192种配置中持续改进。

0 人收藏 0 人点赞
#kv-cache

@dair_ai: // 代理是其自身最佳的推测者 // 代理花费大量实际时间等待工具结果。推测…

X AI KOLs Following · 2026-07-30 缓存

加州大学圣巴巴拉分校和 LinkedIn 的新研究提出了一种自推测代理,将代理和推测者角色统一到一个模型中,通过联合代理-推测者强化学习提高了下一个工具调用预测准确率(Hit@1),同时保持了任务成功率。

0 人收藏 0 人点赞
#kv-cache

ReToken:一个Token提升视觉语言模型的视觉检索能力

Hugging Face Daily Papers · 2026-07-30 缓存

ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈