@rohanpaul_ai: 来自上海大学论文的一个宏大想法——赋予AI模型人类式记忆。想象一下阅读一本巨大的悬疑小说……
摘要
本文介绍了HOLA,一种为快速AI模型(如线性注意力和状态空间模型)提供额外记忆缓存以存储令人惊讶的事实的方法,在不牺牲速度的情况下提高了它们在长上下文任务中的回忆能力。
查看缓存全文
缓存时间: 2026/07/09 07:37
来自上海大学论文的一个宏大想法
赋予AI模型人类式记忆
想象一下读一本厚厚的悬疑小说,却只允许你保留一张便签纸。
每当新线索出现,就得重写这张便签,于是旧线索逐渐淡出或被挤掉。
这差不多就是快速AI模型(如线性注意力和状态空间模型)内部发生的情况——它们通过把所有读过的内容压缩到一个固定的内部状态来节省记忆。
问题在于这让它们变得非常健忘。在“大海捞针”测试中,模型需要回忆埋藏在大文档深处的某个特定事实,但往往失败,因为新细节会覆盖掉早先的信息。
HOLA 试图通过给这些模型提供一个存储细节的第二空间来修复这个问题。
常规状态仍然处理文本的宏观轮廓,比如语法、主题和重复模式。
新的记忆缓存则保存常规状态似乎容易遗忘的精确信息片段。
巧妙之处在于 HOLA 如何决定哪些内容值得放入缓存。
它并不是简单地保存最新的token,因为旧细节可能之后仍然重要。
相反,它保存那些在模型内部引起最大修正的token,这通常意味着模型难以将它们干净地压缩。
用直白的话说,HOLA 保留那些让模型感到意外的事实。
当模型之后需要答案时,这个缓存会被以更尖锐的方式读取,从而能拉回某个特定的已保存事实,而不是将许多记忆混合成一个模糊的猜测。
这很重要,因为快速模型通常用记忆换取速度,而全注意力Transformer能保持更强的回忆能力,但随文本变长而变得沉重。
在论文的3.4亿参数测试中,HOLA 将 Wikitext 困惑度从27.32降到22.92,超过了匹配的快速基线,甚至在该指标上超过了报告的全注意力Transformer++。
它还在长达32k token的“大海捞针”回忆测试中保持明显更好,尽管它只在2k token上下文中训练。
更大的启示是:一个快速的AI模型并不需要精确记住所有东西。
它需要知道自己的主记忆在哪些细节上表现差,然后在那些细节消失之前保护好它们。
– arxiv.org/abs/2607.02303
标题:“用于线性注意力的海马体:对循环状态遗忘的精确记忆”
相似文章
@dair_ai: // 记忆即模型 // 该论文为任何LLM增加一个单独训练的记忆模型,用于存储、检索和整合…
MeMo 引入了一种模块化记忆模型,可为任何 LLM 增强存储、检索和整合新知识的能力,无需重新训练或担心灾难性遗忘。它在 BrowseComp-Plus、NarrativeQA 和 MuSiQue 等基准测试上优于基于 RAG 的方法。
@Oliviacoder1: MIT刚刚让每家AI公司的数十亿美元赌注看起来尴尬不已。他们解决了AI记忆问题。不是通过构建更大的……
MIT CSAIL研究人员提出了一种新颖的AI记忆方法,通过将文档存储在外部,并让AI自行导航和查询,从而避免了上下文腐烂,以更低成本实现了1000万令牌的有效上下文。
@MSFTResearch: AI 智能体无法记住过去的对话。它们必须不断重新加载或检索上下文,随着任务变长和复杂,效率变得越来越低…
Memora 是一种为 AI 智能体设计的可扩展记忆系统,它将存储与检索分离,能够支持长周期任务,同时将上下文令牌减少多达 98%,并在基准测试上取得了新的最佳性能。该论文发表于 ICML 2026。
@simplifyinAI:腾讯刚刚开源了Hy-Memory。一个内存插件,通过6层框架赋予AI代理真正的长期记忆…
腾讯开源了Hy-Memory,这是一个为AI代理提供长期记忆的内存插件,采用6层双推理框架,将令牌使用量减少35%,内存膨胀减少70%。
@omarsar0:新论文值得一读。(收藏)基本思路是将压缩循环状态与一个小型精确记忆配…
HOLA(海马体线性注意力)受海马记忆启发,通过一个有界的精确KV缓存增强线性注意力,在不牺牲效率的情况下改善长程召回和困惑度。在340M参数规模下,它在Wikitext上优于全注意力Transformer,并在高达32k token的范围内实现稳健的针召回。