@rohanpaul_ai:模型的上下文窗口不必是代理的工作空间限制。KVMEM使百万级令牌代理内存成为现实……
摘要
KVMEM通过保留旧的KV缓存状态来增强AI代理内存,在长期运行的代理中,与压缩方法相比,提高了任务性能和效率。
查看缓存全文
缓存时间: 2026/09/23 10:01
模型的上下文窗口并不必然是智能体的工作区上限。
KVMEM通过分页管理旧的KV状态,使百万级令牌的智能体记忆成为可能。它降低了召回成本,并在任务成功率上优于传统压缩方案。
长期运行的智能体最终会填满上下文。目前,它们通常将旧历史压缩为摘要,或重新获取旧文本。摘要可能丢失细节,而重新获取文本则会导致模型重复处理相同历史。
KVMEM保留了模型已完成的工作。旧上下文作为可复用的KV缓存保留在GPU显存、内存或NVMe中,系统仅调取当前步骤所需片段。
在DeepSWE基准测试中使用Qwen3.8-27B时,Pass@1从压缩方案的43.8%提升至48.4%。在受控基准测试中,恢复速度比Compact+RAG快11.4至53.8倍。
在配备24GB RTX 5090显卡的笔记本电脑上,KVMEM支持百万级令牌工作区,速度约为50令牌/秒。
这并非百万令牌级的活跃提示。每个步骤仍只处理有限范围内的片段。
相似文章
@rohanpaul_ai: 更长的上下文窗口并不能解决AI工作中的真正记忆问题。Kocoro刚刚将AI记忆变成了Mac本地的功能…
Kocoro是一个开源的Mac AI代理框架,通过运行本地代理,将过去的会话、文件和活动压缩成知识图谱,从而解决AI记忆问题,实现无缝上下文恢复,无需手动重新粘贴。
@rohanpaul_ai: AI记忆存在测量问题。 "多少上下文?" 告诉我们越来越少的信息。 重要的是代理记住什么……
本文探讨了AI记忆的测量问题,并指出MemoraX AI在首个Agent Memory Leaderboard商业产品中排名第一,强调了代理记忆系统的进步。
@rohanpaul_ai:长期运行的智能体并不只是需要更大的上下文窗口。关键在于它们需要学会判断哪些信息值得保留在上下文中……
ContextPilot通过细粒度强化学习,教会AI代理主动管理上下文,通过专注于需要保留的信息,提升了长上下文基准测试的表现。
@omarsar0: 一篇不错的论文,旨在提高推理效率。效率方面的工作已经很久没有出色成果了。这就是为什么它...
KVMem 通过在 GPU 内存和存储之间分页 KV 状态,虚拟化长时代理工作区,从而在消费级硬件上提高推理效率和任务成功率,最高可达 1M 令牌。
@MSFTResearch: AI 智能体无法记住过去的对话。它们必须不断重新加载或检索上下文,随着任务变长和复杂,效率变得越来越低…
Memora 是一种为 AI 智能体设计的可扩展记忆系统,它将存储与检索分离,能够支持长周期任务,同时将上下文令牌减少多达 98%,并在基准测试上取得了新的最佳性能。该论文发表于 ICML 2026。