@rohanpaul_ai: 来自上海大学论文的一个宏大想法——赋予AI模型人类式记忆。想象一下阅读一本巨大的悬疑小说……

X AI KOLs Following 论文

摘要

本文介绍了HOLA,一种为快速AI模型(如线性注意力和状态空间模型)提供额外记忆缓存以存储令人惊讶的事实的方法,在不牺牲速度的情况下提高了它们在长上下文任务中的回忆能力。

来自上海大学论文的一个宏大想法 赋予AI模型人类式记忆 想象一下阅读一本巨大的悬疑小说,而你只能保留一张便签条。 每当出现一个新线索,便签条就必须重写,因此较早的线索逐渐淡出或被挤出。 这大致就是快速AI模型(如线性注意力和状态空间模型)内部发生的事情,它们通过将读取的所有内容压缩到一个固定的内部状态来节省内存。 问题在于,这让它们非常健忘。在“大海捞针”测试中,当需要回忆埋藏在大文档深处的某个特定事实时,它们会失败,因为新细节覆盖了之前的细节。 HOLA试图通过给这些模型提供第二个存储细节的位置来解决这个问题。 正常状态仍然处理文本的大致形状,比如语法、主题和重复模式。 新的记忆缓存存储的是正常状态似乎容易遗忘的确切信息片段。 巧妙之处在于HOLA如何决定哪些内容值得进入该缓存。 它并不是简单地保存最新的标记,因为旧的细节后来可能仍然重要。 相反,它保存那些在模型内部引起最大修正的标记,这通常意味着模型难以干净地压缩它们。 用简单的话说,HOLA保存了让模型感到惊讶的事实。 当模型稍后需要答案时,这个缓存会被以更清晰的方式读取,从而可以提取出特定保存的事实,而不是将许多记忆混合成一个模糊的猜测。 这很重要,因为快速模型通常以记忆换取速度,而全注意力Transformer保持更强的回忆能力,但随着文本变长而变得沉重。 在论文的3.4亿参数测试中,HOLA将Wikitext困惑度从27.32降低到22.92,超越了匹配的快速基线,甚至在该指标上优于报告的全注意力Transformer++。 它还在32k标记的范围内保持了更好的“大海捞针”回忆能力,尽管它是在2k标记的语境上训练的。 更大的教训是,快速AI模型不需要精确记住所有内容。 它需要知道其主要记忆难以保留哪些细节,然后在这些细节消失之前保护它们。 --- – arxiv. org/abs/2607.02303 标题: "A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets"
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:37

来自上海大学论文的一个宏大想法

赋予AI模型人类式记忆

想象一下读一本厚厚的悬疑小说,却只允许你保留一张便签纸。
每当新线索出现,就得重写这张便签,于是旧线索逐渐淡出或被挤掉。

这差不多就是快速AI模型(如线性注意力和状态空间模型)内部发生的情况——它们通过把所有读过的内容压缩到一个固定的内部状态来节省记忆。

问题在于这让它们变得非常健忘。在“大海捞针”测试中,模型需要回忆埋藏在大文档深处的某个特定事实,但往往失败,因为新细节会覆盖掉早先的信息。

HOLA 试图通过给这些模型提供一个存储细节的第二空间来修复这个问题。

常规状态仍然处理文本的宏观轮廓,比如语法、主题和重复模式。
新的记忆缓存则保存常规状态似乎容易遗忘的精确信息片段。

巧妙之处在于 HOLA 如何决定哪些内容值得放入缓存。
它并不是简单地保存最新的token,因为旧细节可能之后仍然重要。
相反,它保存那些在模型内部引起最大修正的token,这通常意味着模型难以将它们干净地压缩。

用直白的话说,HOLA 保留那些让模型感到意外的事实。

当模型之后需要答案时,这个缓存会被以更尖锐的方式读取,从而能拉回某个特定的已保存事实,而不是将许多记忆混合成一个模糊的猜测。

这很重要,因为快速模型通常用记忆换取速度,而全注意力Transformer能保持更强的回忆能力,但随文本变长而变得沉重。

在论文的3.4亿参数测试中,HOLA 将 Wikitext 困惑度从27.32降到22.92,超过了匹配的快速基线,甚至在该指标上超过了报告的全注意力Transformer++。
它还在长达32k token的“大海捞针”回忆测试中保持明显更好,尽管它只在2k token上下文中训练。

更大的启示是:一个快速的AI模型并不需要精确记住所有东西。
它需要知道自己的主记忆在哪些细节上表现差,然后在那些细节消失之前保护好它们。


– arxiv.org/abs/2607.02303

标题:“用于线性注意力的海马体:对循环状态遗忘的精确记忆”

相似文章