Engram在自回归图像生成中是否进行记忆检索?
摘要
本文研究Engram模块(一种关联记忆机制)在自回归图像生成中是提供内容可寻址检索,还是仅作为门控架构的侧通路。
论文:https://arxiv.org/abs/2605.13179 ### 摘要:>Engram模块——一种注入到Transformer层中的哈希键控O(1)关联记忆——最近被证明能够改善大语言模型的预训练,其解释颇具吸引力:它为反复出现的局部标记模式提供了一条内容寻址捷径。我们询问这种解释是否适用于自回归(AR)图像生成,或者(如果有的话)观察到的性能提升是否来自不同的机制。我们将Engram模块适配到视觉领域,采用2D空间n-gram哈希、门控融合和兼容KV缓存的增量推理,并将其注入到一个在ImageNet 256×256上训练的类条件AR生成器中。在主干网络与记忆预算比例ρ∈[0.17,0.90]的扫描中,每个增强Engram的变体在FID上均落后于纯AR基线,表明该模块节省了主干网络的FLOPs,但其本身并未提高样本质量。然后我们探究该模块的使用方式。门控固定扫描显示,完全禁用Engram通路是灾难性的,但一个极小的常数门控(g=0.10)就能匹配或超越学习到的门控——这与高度内容寻址的召回机制不一致。一个捐赠-探针实验表明,将哈希输入替换为匹配的、对抗的或随机的同类样本,会生成统计上无法区分的下一个标记分布,而折叠或随机化表格则会使它们退化两到三个数量级。最后,从头训练一个模型,将整个记忆表冻结为𝒩(0,1)噪声,仅花费ΔFID=0.10,并且实际上提高了Inception Score。综上所述,这些发现表明,自回归图像生成中的Engram并非作为内容寻址检索器,而是作为门控架构的侧通路:一个哈希键控残差流,其收益主要由通路本身主导,学习到的表格仅贡献微小的分布精炼。
相似文章
过去框架未来:自回归视频生成的记忆
本文全面回顾了自回归视频生成中的记忆机制,解决了在扩展序列中维护历史信息以确保时间持续性的挑战。
AI Engram:探寻人工智能中的记忆痕迹
提出一个几何框架来识别“AI engrams”——深度神经网络中的记忆痕迹——将神经科学标准形式化为一个闭式估计器,使得从MLP到LLM的模型能够进行精确的记忆操作。
User as Engram: 将每位用户的记忆内化为局部参数化编辑
提出了User as Engram方法,将每位用户的记忆存储为哈希键控记忆表中的稀疏局部参数化编辑,受海马体记忆印迹启发,与每位用户的LoRA相比,实现了更好的推理准确性和记忆效率。
FactorEngram:用于语言模型的因式分解N-gram记忆与基级别门控
FactorEngram提出了一种用于语言模型的因式分解N-gram记忆与基级别门控,通过使上下文能够调节各个记忆组件,改善语言建模和下游任务。
Engram:将破碎的AI幻觉转化为音乐的采样器
Engram是一款采样器和节奏盒,利用本地AI将音频通过幻觉转化为实验音乐,由Thoughtful Things在Kickstarter上发布。