Engram在自回归图像生成中是否进行记忆检索?
摘要
本文研究Engram模块(一种关联记忆机制)在自回归图像生成中是提供内容可寻址检索,还是仅作为门控架构的侧通路。
论文:https://arxiv.org/abs/2605.13179 ### 摘要:>Engram模块——一种注入到Transformer层中的哈希键控O(1)关联记忆——最近被证明能够改善大语言模型的预训练,其解释颇具吸引力:它为反复出现的局部标记模式提供了一条内容寻址捷径。我们询问这种解释是否适用于自回归(AR)图像生成,或者(如果有的话)观察到的性能提升是否来自不同的机制。我们将Engram模块适配到视觉领域,采用2D空间n-gram哈希、门控融合和兼容KV缓存的增量推理,并将其注入到一个在ImageNet 256×256上训练的类条件AR生成器中。在主干网络与记忆预算比例ρ∈[0.17,0.90]的扫描中,每个增强Engram的变体在FID上均落后于纯AR基线,表明该模块节省了主干网络的FLOPs,但其本身并未提高样本质量。然后我们探究该模块的使用方式。门控固定扫描显示,完全禁用Engram通路是灾难性的,但一个极小的常数门控(g=0.10)就能匹配或超越学习到的门控——这与高度内容寻址的召回机制不一致。一个捐赠-探针实验表明,将哈希输入替换为匹配的、对抗的或随机的同类样本,会生成统计上无法区分的下一个标记分布,而折叠或随机化表格则会使它们退化两到三个数量级。最后,从头训练一个模型,将整个记忆表冻结为𝒩(0,1)噪声,仅花费ΔFID=0.10,并且实际上提高了Inception Score。综上所述,这些发现表明,自回归图像生成中的Engram并非作为内容寻址检索器,而是作为门控架构的侧通路:一个哈希键控残差流,其收益主要由通路本身主导,学习到的表格仅贡献微小的分布精炼。
相似文章
AI Engram:探寻人工智能中的记忆痕迹
提出一个几何框架来识别“AI engrams”——深度神经网络中的记忆痕迹——将神经科学标准形式化为一个闭式估计器,使得从MLP到LLM的模型能够进行精确的记忆操作。
User as Engram: 将每位用户的记忆内化为局部参数化编辑
提出了User as Engram方法,将每位用户的记忆存储为哈希键控记忆表中的稀疏局部参数化编辑,受海马体记忆印迹启发,与每位用户的LoRA相比,实现了更好的推理准确性和记忆效率。
TF-Engram:一种基于SSD存储的无训练记忆印记系统,用于大型语言模型
TF-Engram 引入了一种无训练系统,在 GPU-DRAM-SSD 层级上为 LLM 存储短语级语义记忆,利用预测预取来隐藏延迟,并在 Qwen3-0.6B 上展示了改进的下游性能。
为什么检索增强生成会失败:图视角
本文探讨了检索增强生成(RAG)系统即使在获取到正确证据的情况下仍然失败的原因。通过电路追踪和归因图,作者发现正确的预测展现出更深的推理路径和更分散的证据流,而失败则表现为浅层、碎片化的模式。他们提出了一个基于图的错误检测框架和有针对性的干预措施,以提高RAG的可靠性。
ARM:采用统一离散表示的自回归大型多模态模型
ARM提出了一种统一的基于离散语义标记化和强化学习优化的自回归框架,用于图像理解、生成与编辑,并展示了跨任务协同效果。