Key-Value Means
摘要
Key-Value Means (KVM) 是一种新颖的注意力机制,结合了 Transformer 和 RNN 的优势,具有可控的计算复杂度和内存使用。它支持固定大小或增长状态,提供次二次方预填充时间和次线性状态增长,并且无需自定义内核即可实现。
查看缓存全文
缓存时间: 2026/05/12 14:52
论文页面 - Key-Value Means
来源:https://huggingface.co/papers/2605.09877
摘要
Key-Value Means 引入了一种新颖的注意力机制,结合了 Transformer 与 RNN 的优势,并具备可控的计算复杂度和内存使用。
我们提出了 Key-Value Means(“KVM”),一种新颖的块级循环机制(https://huggingface.co/papers?q=block-recurrence),用于注意力机制(https://huggingface.co/papers?q=attention),可适配固定大小(https://huggingface.co/papers?q=fixed-size)或增长状态(https://huggingface.co/papers?q=growing%20state)。为强大的 Transformer(https://huggingface.co/papers?q=transformer)基线模型配备固定大小的 KVM 注意力层,可得到一种强大的 O(N)(https://huggingface.co/papers?q=O(N))分块 RNN(https://huggingface.co/papers?q=chunked%20RNN),同时仅增加极少量新参数。我们训练了一个带有可增长 KVM 缓存的 Transformer(https://huggingface.co/papers?q=transformer),并展示了它在长上下文测试中表现出色,仅需次二次预填充时间(https://huggingface.co/papers?q=subquadratic%20prefill%20time)和次线性状态增长(https://huggingface.co/papers?q=sublinear%20state%20growth)。KVM 可使用标准操作实现,无需自定义内核,并支持分块并行训练(https://huggingface.co/papers?q=chunk-wise%20parallelizable%20training)和预填充(https://huggingface.co/papers?q=prefill)。它在统一封装中提供了传统 Transformer(https://huggingface.co/papers?q=transformer)(可扩展上下文记忆、分块并行训练和预填充)以及线性 RNN 的诸多优势。它可用于每一层,节省 KV 缓存(https://huggingface.co/papers?q=KV-cache)内存,并允许在 O(N)(https://huggingface.co/papers?q=O(N))和 O(N²) 之间连续选择预填充时间复杂度。此外,它还可与 LRNN(https://huggingface.co/papers?q=LRNN)层协同实现混合方案(https://huggingface.co/papers?q=hybrid%20solution),替代传统注意力,以改进 LRNN 的次线性内存增长上下文长度使用和长上下文解码。我们在 https://github.com/recursal/KVM-paper 发布代码,并在 https://huggingface.co/collections/recursal/key-value-means 发布训练好的模型,采用 Apache 2.0 许可证。
查看 arXiv 页面(https://arxiv.org/abs/2605.09877)查看 PDF(https://arxiv.org/pdf/2605.09877)GitHub0(https://github.com/recursal/KVM-paper)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.09877)
在您的 Agent 中获取这篇论文:
hf papers read 2605.09877
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
无模型链接本论文
请在模型 README.md 中引用 arxiv.org/abs/2605.09877 以从本页面链接。
引用本论文的数据集0
无数据集链接本论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.09877 以从本页面链接。
引用本论文的 Space0
无 Space 链接本论文
请在 Space README.md 中引用 arxiv.org/abs/2605.09877 以从本页面链接。
包含本论文的收藏集0
无收藏集包含本论文
请将本论文添加至收藏集(https://huggingface.co/new-collection)以从本页面链接。
相似文章
RWKV是一种RNN,具有出色的LLM性能,并且像Transformer一样可并行化。
RWKV是一种新颖的语言模型架构,结合了RNN的高效性和Transformer的可并行化特性,以线性时间复杂度和恒定内存占用实现了强大的LLM性能。
kvcache-ai/ktransformers
KTransformers 是一个灵活的研究框架,专注于前沿的大语言模型推理与微调,利用CPU-GPU异构计算,并支持多种最新模型。
@jiqizhixin: 如果AI的记忆不必随着每多一句话而膨胀呢?牛津大学、Technion、AITHYRA 等…
介绍了KV-Compression Aware Training (KV-CAT) 方法,该方法鼓励Transformer在训练过程中学习可压缩的键值缓存,在不牺牲性能的情况下提高长上下文任务的记忆效率。
模型在预填充阶段做笔记:KV缓存可编辑且可组合
本文提出,Transformer中的KV缓存充当了记忆化结论的笔记本,使得无需完全重计算即可进行精确编辑和组合。该方法在保持跨模型规模决策等价性的同时,实现了显著的延迟降低。
@TheTuringPost: 为什么 KV cache 是 LLM 速度快的主要原因之一?KV cache 将注意力机制与生成阶段连接起来……
KV cache 在自回归生成过程中存储先前计算的键向量和值向量,使模型能够避免在每一步重新计算整个序列,从而显著加速推理,但代价是内存使用增加。