Key-Value Means

Hugging Face Daily Papers 论文

摘要

Key-Value Means (KVM) 是一种新颖的注意力机制,结合了 Transformer 和 RNN 的优势,具有可控的计算复杂度和内存使用。它支持固定大小或增长状态,提供次二次方预填充时间和次线性状态增长,并且无需自定义内核即可实现。

我们提出 Key-Value Means(“KVM”),一种新颖的用于注意力的块递归机制,可以支持固定大小或增长状态。将强大的 Transformer 基线配备固定大小的 KVM 注意力层,可以产生强大的 O(N) 分块 RNN,同时仅增加微不足道的新参数。我们训练了一个具有可增长 KVM 缓存的 Transformer,并展示了它在长上下文测试中具有竞争力,仅需次二次方预填充时间和次线性状态增长。KVM 可以仅使用标准操作实现,无需自定义内核,并支持分块并行的训练和预填充。它在一个统一框架中提供了传统 Transformer(可扩展的上下文内存、分块并行训练和预填充)和线性 RNN 的许多优点。它可以在每一层使用,节省 KV 缓存内存,并允许在 O(N) 到 O(N^2) 之间连续选择预填充时间复杂度。它还可以与 LRNN 层一起以混合解决方案实现,替代传统注意力,通过改进的次线性内存增长上下文长度使用和长上下文解码来补充 LRNN。我们在 https://github.com/recursal/KVM-paper 发布我们的代码,在 https://huggingface.co/collections/recursal/key-value-means 发布训练好的模型,采用 Apache 2.0 许可证。
查看原文
查看缓存全文

缓存时间: 2026/05/12 14:52

论文页面 - Key-Value Means

来源:https://huggingface.co/papers/2605.09877

摘要

Key-Value Means 引入了一种新颖的注意力机制,结合了 Transformer 与 RNN 的优势,并具备可控的计算复杂度和内存使用。

我们提出了 Key-Value Means(“KVM”),一种新颖的块级循环机制(https://huggingface.co/papers?q=block-recurrence),用于注意力机制(https://huggingface.co/papers?q=attention),可适配固定大小(https://huggingface.co/papers?q=fixed-size)或增长状态(https://huggingface.co/papers?q=growing%20state)。为强大的 Transformer(https://huggingface.co/papers?q=transformer)基线模型配备固定大小的 KVM 注意力层,可得到一种强大的 O(N)(https://huggingface.co/papers?q=O(N))分块 RNN(https://huggingface.co/papers?q=chunked%20RNN),同时仅增加极少量新参数。我们训练了一个带有可增长 KVM 缓存的 Transformer(https://huggingface.co/papers?q=transformer),并展示了它在长上下文测试中表现出色,仅需次二次预填充时间(https://huggingface.co/papers?q=subquadratic%20prefill%20time)和次线性状态增长(https://huggingface.co/papers?q=sublinear%20state%20growth)。KVM 可使用标准操作实现,无需自定义内核,并支持分块并行训练(https://huggingface.co/papers?q=chunk-wise%20parallelizable%20training)和预填充(https://huggingface.co/papers?q=prefill)。它在统一封装中提供了传统 Transformer(https://huggingface.co/papers?q=transformer)(可扩展上下文记忆、分块并行训练和预填充)以及线性 RNN 的诸多优势。它可用于每一层,节省 KV 缓存(https://huggingface.co/papers?q=KV-cache)内存,并允许在 O(N)(https://huggingface.co/papers?q=O(N))和 O(N²) 之间连续选择预填充时间复杂度。此外,它还可与 LRNN(https://huggingface.co/papers?q=LRNN)层协同实现混合方案(https://huggingface.co/papers?q=hybrid%20solution),替代传统注意力,以改进 LRNN 的次线性内存增长上下文长度使用和长上下文解码。我们在 https://github.com/recursal/KVM-paper 发布代码,并在 https://huggingface.co/collections/recursal/key-value-means 发布训练好的模型,采用 Apache 2.0 许可证。

查看 arXiv 页面(https://arxiv.org/abs/2605.09877)查看 PDF(https://arxiv.org/pdf/2605.09877)GitHub0(https://github.com/recursal/KVM-paper)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.09877)

在您的 Agent 中获取这篇论文:

hf papers read 2605.09877

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

无模型链接本论文

请在模型 README.md 中引用 arxiv.org/abs/2605.09877 以从本页面链接。

引用本论文的数据集0

无数据集链接本论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.09877 以从本页面链接。

引用本论文的 Space0

无 Space 链接本论文

请在 Space README.md 中引用 arxiv.org/abs/2605.09877 以从本页面链接。

包含本论文的收藏集0

无收藏集包含本论文

请将本论文添加至收藏集(https://huggingface.co/new-collection)以从本页面链接。

相似文章

kvcache-ai/ktransformers

GitHub Trending (daily)

KTransformers 是一个灵活的研究框架,专注于前沿的大语言模型推理与微调,利用CPU-GPU异构计算,并支持多种最新模型。