@rohanpaul_ai:模型的上下文窗口不必是代理的工作空间限制。KVMEM使百万级令牌代理内存成为现实……

X AI KOLs Following 新闻

摘要

KVMEM通过保留旧的KV缓存状态来增强AI代理内存,在长期运行的代理中,与压缩方法相比,提高了任务性能和效率。

模型的上下文窗口不必是代理的工作空间限制。 KVMEM通过分页旧的KV状态,使百万级令牌代理内存变得实用,降低了召回成本,同时在任务成功率上优于压缩方法。 长期运行的代理最终会填满其上下文。如今,它们通常将旧历史压缩为摘要或再次获取旧文本。摘要可能会遗漏细节。再次获取文本会使模型重新处理相同的历史。 KVMEM保留了模型已完成的工作。旧上下文作为可重用的KV缓存保留在GPU内存、RAM或NVMe中,系统仅拉回当前步骤所需的片段。 在DeepSWE上使用Qwen3.8-27B时,Pass@1从43.8%提升到48.4%,相比仅压缩方法。在受控基准测试中,恢复速度比Compact+RAG快11.4至53.8倍。 在配备24 GB RTX 5090 GPU的笔记本电脑上,KVMEM支持约50令牌/秒的1M令牌工作空间。 这不是一个1M令牌的活跃提示。每一步仍然只看到一个有界的切片。
查看原文
查看缓存全文

缓存时间: 2026/09/23 10:01

模型的上下文窗口并不必然是智能体的工作区上限。

KVMEM通过分页管理旧的KV状态,使百万级令牌的智能体记忆成为可能。它降低了召回成本,并在任务成功率上优于传统压缩方案。

长期运行的智能体最终会填满上下文。目前,它们通常将旧历史压缩为摘要,或重新获取旧文本。摘要可能丢失细节,而重新获取文本则会导致模型重复处理相同历史。

KVMEM保留了模型已完成的工作。旧上下文作为可复用的KV缓存保留在GPU显存、内存或NVMe中,系统仅调取当前步骤所需片段。

在DeepSWE基准测试中使用Qwen3.8-27B时,Pass@1从压缩方案的43.8%提升至48.4%。在受控基准测试中,恢复速度比Compact+RAG快11.4至53.8倍。

在配备24GB RTX 5090显卡的笔记本电脑上,KVMEM支持百万级令牌工作区,速度约为50令牌/秒。

这并非百万令牌级的活跃提示。每个步骤仍只处理有限范围内的片段。

相似文章