测试离散拓扑是否比连续权重更持久的内存介质——可能不是……大概[R]
摘要
这篇文章比较了冻结语言模型的离散和连续内存适配器,发现像EPMem这样的二进制掩码方法与连续方法一样容易忘记事实,强调写入/分配规则而非离散性是防止忘记的关键。
我进行了一项受控比较,针对冻结语言模型的两种"原位写入"内存适配器:一种编辑连续权重,另一种(EPMem)保持权重冻结和随机,并通过直通估计仅编辑二进制边掩码。存储位和写入步骤在两者之间匹配。在持续事实写入基准(TinyStories-33M)上,EPMem能很好地写入事实,但忘记它们的速度与连续适配器一样快,整体表现较差,并且需要更多的写入步骤才能达到相同效果。从机制上看:每次写入的干扰与掩码翻转次数F的平方根成正比,并且保留率衰减速度快于随机碰撞的零假设——因此,掩码学习的梯度并非偶然碰撞,而是选择性地重新翻转已经在存储某些内容的边缘(反巩固,而非中性覆写)。在Pythia-410M上复现:相同模式,更明显——规模使写入更容易,但保留更差。结论:确实避免忘记的二进制掩码方法(SupSup、WSN等)之所以有效,是因为它们显式地强制写入之间的非重叠分配,而不是因为离散性本身能抵抗遗忘。基质不是杠杆——写入/分配规则才是。论文:https://zenodo.org/records/22071715 (DOI: 10.5281/zenodo.22071715) 真正感兴趣于反驳——特别是这是否在事实写入任务之外也成立,或者是否是直通估计特有的假象。
相似文章
选择性遗忘:一个基于图的长期LLM代理记忆框架
本文评估了一个面向长期LLM代理的基于图的记忆框架,发现该框架在召回指标上并不优于扁平向量检索,但选择性遗忘模块能以最小性能损失有效减少存储。
语言模型能否在其权重中持续学习事实?
本文研究了语言模型能否通过持续学习在其权重中学习新事实。通过使用虚构事实并顺序写入Qwen3模型,研究发现训练数据的广度决定了知识类型和保留程度:单纯陈述的事实会迅速被遗忘(20次写入后准确率仅1%),而从多样化复述中学习的事实保留了46%的准确率。被遗忘的事实并未被擦除,而是由于后续写入重定向了问题而变得行为上不可访问,上下文仍然是事实组合和存续的可靠渠道。
回收评估:有损记忆比空记忆更糟糕
本文表明,具有有损记忆的语言模型如果保留了错误结论而丢弃了证据,会产生自信的错误答案,而空记忆则会导致弃权。作者提出了一种源优先压缩策略,保留可重新计算的来源而非结论,以保持可纠正性,并在多个模型和对话系统中展示了这一机制。
不忘记的艺术:一种用于持续学习的局部学习架构
本文介绍了CMP(认知记忆原语),一种持续学习架构,它使用稀疏关系编码和局部学习来减少灾难性遗忘,在字节级语言建模协议上展示了比使用EWC的Transformer更好的反向迁移。
测试了小模型在对话中能记住一个事实多长时间。记忆失败模式对智能体来说是一个真正的问题,而且这并非我所预料的。
一位开发者测试了小型边缘模型(LFM2.5、Gemma 变体)在多个对话轮次中保持一个事实的能力,发现模型常常自信地否认知道仍在上下文中的信息,这给智能体架构带来了信任问题,并暗示了记忆与格式规范之间的权衡。