WorldKV:基于世界检索与压缩的高效世界记忆
摘要
WorldKV 是一个无需训练的框架,它检索并压缩键值缓存块,以在视频扩散世界生成中保持长期一致性,在匹配全记忆保真度的同时实现更高吞吐量。
查看缓存全文
缓存时间: 2026/05/22 02:24
论文页面 - WorldKV:结合世界检索与压缩的高效世界记忆
来源:https://huggingface.co/papers/2605.22718
摘要
WorldKV 通过检索并压缩键值缓存块,使视频扩散模型能够实现持久的世界生成,在保持一致性的同时提升吞吐量。
自回归视频扩散模型(https://huggingface.co/papers?q=Autoregressive%20video%20diffusion%20models)已实现了实时、动作条件化的世界生成。然而,维持一个持久的世界——即重新回到之前看到的视角时仍能呈现一致内容——仍然是一个未解决的问题。FullKV 缓存注意力(https://huggingface.co/papers?q=KV-cache%20attention)能保持这种一致性,但打破了实时约束:内存占用和注意力成本随展开长度线性增长。滑动窗口推理(https://huggingface.co/papers?q=Sliding%20window%20inference)恢复了吞吐量,但丢弃了长期一致性。我们提出 WorldKV,一个无需训练的框架,包含两个组件:世界检索(World Retrieval)(https://huggingface.co/papers?q=World%20Retrieval)和世界压缩(World Compression)(https://huggingface.co/papers?q=World%20Compression)。世界检索将驱逐的 KV 缓存块存储在 GPU/CPU 内存中,并通过相机/动作对应选择性检索与场景相关的块,将其重新插入到原生注意力窗口(https://huggingface.co/papers?q=attention%20window)中,无需重新编码。世界压缩通过锚帧的键-键相似度(https://huggingface.co/papers?q=key-key%20similarity)修剪每个块内的冗余令牌,将每块存储量减半,从而在固定预算下容纳多一倍的历史记录。在 Matrix-Game-2.0 和 LingBot-World-Fast 上,WorldKV 在约 2 倍吞吐量下达到或超过 FullKV 内存保真度,并且无需任何微调即可与经过内存训练的基线相媲美。项目页面:https://cvlab-kaist.github.io/WorldKV/
查看 arXiv 页面(https://arxiv.org/abs/2605.22718)查看 PDF(https://arxiv.org/pdf/2605.22718)项目页面(https://cvlab-kaist.github.io/WorldKV/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.22718)
在你的代理中获取这篇论文:
hf papers read 2605\.22718
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2605.22718 即可从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.22718 即可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2605.22718 即可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
添加这篇论文到收藏(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
Napster的主页现在完全是AI代理。这是训练数据过时速度的一个简洁测试案例。
Napster已转型为AI代理平台,说明AI训练数据如何迅速过时,导致模型在关于公司身份的信息上提供自信但不正确的答案。
@dejavucoder: 现在很多人在讨论提示缓存和推理优化。我曾经写过一篇很长的博客…
本文解释了提示缓存如何在LLM推理中使用分页注意力和前缀缓存工作,并提供了开发者优化性能的实用技巧。
相同检索,不同答案:500个LongMemEval结果中32个翻转
本文强调,即使检索结果不变,由于读取器或评判器阶段的差异,Engrava这一记忆层工具的基准分数也可能发生变化,并使用LongMemEval结果来说明这一问题。
学习如何遗忘:针对长上下文稀疏注意力的微调
本文提出了一种新方法,用于对具有稀疏注意力的transformer语言模型进行微调,以实现高效的长上下文推理,通常优于使用精确注意力训练的模型,并介绍了高效的实现和一个新的开源库。
ReCache:面向工具增强LLM代理的高效KV缓存重用与压缩
ReCache是一个用于工具增强LLM代理中高效KV缓存重用与压缩的框架,在保持性能的同时实现显著的加速和内存减少。