Engram在自回归图像生成中是否进行记忆检索?

Reddit r/LocalLLaMA 论文

摘要

本文研究Engram模块(一种关联记忆机制)在自回归图像生成中是提供内容可寻址检索,还是仅作为门控架构的侧通路。

论文:https://arxiv.org/abs/2605.13179 ### 摘要:>Engram模块——一种注入到Transformer层中的哈希键控O​(1)关联记忆——最近被证明能够改善大语言模型的预训练,其解释颇具吸引力:它为反复出现的局部标记模式提供了一条内容寻址捷径。我们询问这种解释是否适用于自回归(AR)图像生成,或者(如果有的话)观察到的性能提升是否来自不同的机制。我们将Engram模块适配到视觉领域,采用2D空间n-gram哈希、门控融合和兼容KV缓存的增量推理,并将其注入到一个在ImageNet 256×256上训练的类条件AR生成器中。在主干网络与记忆预算比例ρ∈[0.17,0.90]的扫描中,每个增强Engram的变体在FID上均落后于纯AR基线,表明该模块节省了主干网络的FLOPs,但其本身并未提高样本质量。然后我们探究该模块的使用方式。门控固定扫描显示,完全禁用Engram通路是灾难性的,但一个极小的常数门控(g=0.10)就能匹配或超越学习到的门控——这与高度内容寻址的召回机制不一致。一个捐赠-探针实验表明,将哈希输入替换为匹配的、对抗的或随机的同类样本,会生成统计上无法区分的下一个标记分布,而折叠或随机化表格则会使它们退化两到三个数量级。最后,从头训练一个模型,将整个记忆表冻结为𝒩​(0,1)噪声,仅花费Δ​FID=0.10,并且实际上提高了Inception Score。综上所述,这些发现表明,自回归图像生成中的Engram并非作为内容寻址检索器,而是作为门控架构的侧通路:一个哈希键控残差流,其收益主要由通路本身主导,学习到的表格仅贡献微小的分布精炼。
查看原文

相似文章

AI Engram:探寻人工智能中的记忆痕迹

arXiv cs.AI

提出一个几何框架来识别“AI engrams”——深度神经网络中的记忆痕迹——将神经科学标准形式化为一个闭式估计器,使得从MLP到LLM的模型能够进行精确的记忆操作。

为什么检索增强生成会失败:图视角

arXiv cs.CL

本文探讨了检索增强生成(RAG)系统即使在获取到正确证据的情况下仍然失败的原因。通过电路追踪和归因图,作者发现正确的预测展现出更深的推理路径和更分散的证据流,而失败则表现为浅层、碎片化的模式。他们提出了一个基于图的错误检测框架和有针对性的干预措施,以提高RAG的可靠性。