@ba_niu80557: https://x.com/ba_niu80557/status/2073362883728302125
摘要
斯坦福大学提出AutoMem方法,通过让模型学会管理记忆(选择性遗忘)而非扩大参数,使320亿参数小模型性能翻倍并追平顶级大模型,揭示了记忆管理比模型规模更重要。
查看缓存全文
缓存时间: 2026/07/04 12:46
一个小模型打平了顶级大模型:AI 变强的秘密,居然是“学会忘记“
我靠给企业搭 AI 的记忆系统吃饭,这些年调过的向量库和检索管道,自己都数不清了。所以这周有篇斯坦福的论文(《AutoMem: Automated Learning of Memory as a Cognitive Skill》,arXiv:2607.01224,7月1日提交、2日上线,作者含斯坦福的 Serena Yeung-Levy),让我盯着屏幕愣了很久。它做的事说穿了很简单,完全不动模型本身,不让它变得更聪明,权重、推理能力一个字都不改,只教它学会管理自己的记忆。结果,一个 320 亿参数的小模型,性能翻了两到四倍,不但打赢了同门 720 亿参数的大模型,还追平了 Claude Opus 4.5、Gemini 这一档最顶级的系统。同一个脑子,只是换了一套记忆的习惯,就连跳了两个重量级。这个结果,逼着我把一件我自以为早就想明白的事,从头再想了一遍。
这些年,“Agent 的记忆“在我们手里,一直是个工程问题。用哪个向量库,文本怎么切,检索算法用哪个,rerank 怎么调。我们把记忆当成一个外挂的数据库焊在模型旁边,然后一遍遍手工去拧检索的螺丝。为什么会这样?因为我们心里,不知不觉就把记忆当成了“存储”,当成了一个档案柜,而默认“智能“这件事是待在别处的,待在模型的推理里。数据库是那个笨仓库,模型是那个聪明的、时不时进来查档案的脑子。这个分工,当时看起来天经地义。可它是错的。
因为那篇论文的结果,翻译过来是这么个意思:如果你能拿一个固定的脑子,仅仅通过改善它的记忆习惯,就让它打赢一个大它一倍的脑子,那么我们这些年一直挂在嘴上的“智能“、一直在为之掏钱的“模型更大“,里头有很大一块,压根就不是什么原始的推理能力,而是那个又不起眼、又看不见的手艺,知道该把什么东西留在自己眼前。我们打了这么久的模型军备竞赛,把每一点进步都记在了“参数更多“的账上,可那道差距里有很大一部分,从头到尾都是记忆管理。论文说得很直白,管好记忆,比把模型做大,杠杆高得多。我们一直在衡量、也一直在购买的,是个错的东西。
而下面这一层,才是真正把整个框架掀翻的地方。我们张口闭口叫它“记忆“,脑子里想的都是“记住更多“。可你凑近看它到底要学的是什么。一个要跑成千上万步的任务,你在物理上就不可能把所有东西都塞在模型眼前,上下文是有限的。所以真正的手艺根本不是“存“,是“选“,什么写下来,什么压缩掉,什么直接扔了。这门要学的功夫里最难的那部分,是决定什么东西不要留。而这恰恰就是外挂数据库那套撞墙的原因,数据库的本能,就是把什么都存下来、再按相似度捞回去,它不会忘。所以在一个长任务里,它会用海量的日志把模型活埋,把那一条真正有用的信息,埋在一万条没用的下面。你没法靠加存储去解决一个忘不掉的病,加得越多,病得越重。我们越造越大的那样东西,那个过目不忘,本身就是病,不是药。智能,从来不是关于你能记住多少,而是关于你能多利落地放手。
这本不该让我们意外,因为这就是我们自己脑子的活法。人是很烂的硬盘,我们记得很少、记得很糊,而且每次回忆都会把记忆重写一遍。我们聪明,不是因为记得多,是因为在某个时刻,我们学会了该记住什么、什么事查一下就行、什么东西任它淡去。认知科学给这门元技能起过一个名字,叫元记忆,而那篇论文教给机器的,正是这个东西。有整整十年,我们拼命想造一个跟人脑相反的东西,无限的上下文,完美的记性,什么都不忘。结果它在长任务上反而更笨了。而解药,居然是让它变得更像人,让它学会主动地忘。那个“完美记忆机器“的梦,从一开始,可能就是个做错了的梦。
说到这,有句让我自己也不太舒服的话我得讲,毕竟这关系到我自己的饭碗。AI 这个行当里有条规律,一遍遍在重演,凡是人手工搭出来的外部脚手架,最后都会被“学习“吃掉、而且做得比人更好。手工设计的特征,被学出来的特征取代了;手工调的棋谱套路,被自我对弈取代了。而现在,那一整套精巧的记忆和检索栈,切分策略、向量库、rerank,那些我靠它领工资的东西,就是脚手架,而这篇论文,是模型即将学会自己整理自己的过去、并且比我们任何人手工去拧都拧得更好的第一个清晰信号。这不是坏事,这是方向。但它意味着,真正该练的本事,不是去搭一个更好的档案柜,而是去理解,记忆,是一门模型自己终将掌握的技能。
说到底,这些年我们一直在给 AI 盖一个越来越大的仓库,每加一排货架都挺自豪,而它就站在门口,被自己的库存淹着,找不到它真正需要的那一个箱子。而这篇论文,悄悄递给了它另一样礼物,不是更多的货架,是那种走进去、拿走那三样要紧的、然后把其余一把火烧掉的判断力。我们这整个时代,都在害怕 AI 会记住我们什么,害怕那个什么都不忘的监控机器。可也许更值得问的,是反过来那个问题,它会选择忘掉什么,又该由谁来教它怎么忘。因为一个智能体,被它放下的东西塑造,并不比被它抓住的东西塑造得更少。而此刻,我们正在替这些机器,决定“遗忘“该长什么样子。
引用:https://arxiv.org/pdf/2607.01224
相似文章
@omarsar0: // AutoMem // 我非常喜欢这个元记忆的概念。(标记一下) 这项来自斯坦福的新研究将智能体的记忆…
这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。
@vintcessun: 一块能跨模型插拔的“知识硬盘”——难点不在搬记忆表,而在为目标模型配好读头。 https://arxiv.org/abs/2608.17050 论文先用源模型训练 Engram 哈希记忆,再冻结记忆与目标骨干,仅训练 reader 完成寻…
该论文提出一种通过目标侧reader适配实现跨模型记忆迁移的方法,使用Engram哈希记忆和轻量级reader,在问答任务中实现38.8分,并适用于Agent记忆的更新和审计。局限是仅测试到9B模型,缩放规律未知。
@dair_ai: // 记忆即模型 // 该论文为任何LLM增加一个单独训练的记忆模型,用于存储、检索和整合…
MeMo 引入了一种模块化记忆模型,可为任何 LLM 增强存储、检索和整合新知识的能力,无需重新训练或担心灾难性遗忘。它在 BrowseComp-Plus、NarrativeQA 和 MuSiQue 等基准测试上优于基于 RAG 的方法。
@rohanpaul_ai:AI智能体应将记忆视为不断变化的有效连接网络,而非静态存储。大多数智能体记忆系统…
该论文提出 FluxMem,一种将智能体记忆视为不断演化的图结构,通过动态修复连接和提炼技能来提升记忆效果的系统。实验显示其在多个任务上优于现有方法,例如在 LoCoMo 上达到 95.06% 准确率,并在 GAIA 上相比 Kimi K2 提升 12.73 分。
@rohanpaul_ai: 来自上海大学论文的一个宏大想法——赋予AI模型人类式记忆。想象一下阅读一本巨大的悬疑小说……
本文介绍了HOLA,一种为快速AI模型(如线性注意力和状态空间模型)提供额外记忆缓存以存储令人惊讶的事实的方法,在不牺牲速度的情况下提高了它们在长上下文任务中的回忆能力。