Transformer 中的几何事实记忆
摘要
本文介绍了 Transformer 中几何事实记忆的理论框架,证明了嵌入可以通过线性叠加来编码关系结构,而 MLP 则充当选择器。文章提供了理论和实证证据,表明这种机制能够高效地记忆事实和进行多跳查询。
查看缓存全文
缓存时间: 2026/05/13 04:10
论文页面 - Transformer 中的几何事实回忆
来源:https://huggingface.co/papers/2605.12426
摘要
Transformer 语言模型使用几何记忆机制,其中嵌入编码属性的线性叠加,而 MLP 充当关系条件选择器,而非关联键值映射。
Transformer 语言模型(https://huggingface.co/papers?q=transformer%20language%20models)如何记忆事实关联?一种常见观点将内部权重矩阵(https://huggingface.co/papers?q=internal%20weight%20matrices)视为嵌入对上的关联记忆(https://huggingface.co/papers?q=associative%20memories),这需要参数数量随事实数量线性增长。我们提出了一种替代的记忆形式的理论和实证解释,即几何形式的记忆:学习到的嵌入直接编码关系结构,MLP(https://huggingface.co/papers?q=MLP)发挥定性不同的作用。在控制环境中,单层 Transformer 需要记忆从主体到共享属性集的随机双射,我们证明对数级嵌入维度(https://huggingface.co/papers?q=embedding%20dimension)即足够:主体嵌入编码其关联属性向量的线性叠加(https://huggingface.co/papers?q=linear%20superpositions),而小型 MLP(https://huggingface.co/papers?q=MLP)充当关系条件选择器,通过 ReLU 门控(https://huggingface.co/papers?q=ReLU%20gating)提取相关属性,而非作为关联键值映射。我们将这些结果扩展到多跳设置——关系查询链(https://huggingface.co/papers?q=relational%20queries),如“x 的妻子的母亲是谁?”——提供了有或无思维链(https://huggingface.co/papers?q=chain-of-thought)的构造,表现出可证明的容量-深度权衡,并辅以匹配的信息论下界(https://huggingface.co/papers?q=information-theoretic%20lower%20bound)。实证上,梯度下降(https://huggingface.co/papers?q=gradient%20descent)发现了具有精确预测结构的解。训练完成后,当主体嵌入适当重新初始化时,MLP(https://huggingface.co/papers?q=MLP)零样本迁移到全新的双射,揭示其学习了通用选择机制而非记忆特定事实集。
查看 arXiv 页面(https://arxiv.org/abs/2605.12426)查看 PDF(https://arxiv.org/pdf/2605.12426)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2605.12426)
在您的 agent 中获取此论文:
hf papers read 2605\.12426
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.12426 以从此页面链接。
引用此论文的数据集 0
暂无链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.12426 以从此页面链接。
引用此论文的应用空间 0
暂无链接此论文的应用空间
在应用空间 README.md 中引用 arxiv.org/abs/2605.12426 以从此页面链接。
包含此论文的收藏集 0
暂无包含此论文的收藏集
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
MLP是Hebbian的:为Transformer构建高效的事实存储MLP
本文从理论上阐述了Transformer中的MLP如何以信息论最优速率存储事实,并提供了一种闭式构造方法,该方法以远少于先前方法的参数实现最优存储容量,并支持模块化事实编辑。
Transformer 记忆的吸引子几何:从冲突仲裁到自信幻觉
本文提出了一个统一的几何框架,用于理解 Transformer 的内存故障,通过隐藏状态吸引子盆地(attractor basins)区分冲突仲裁与幻觉。研究表明,随着模型规模的扩大,几何边际(geometric margin)在检测这些故障方面优于输出熵。
我发现Transformer中一个预测几何稳定性的隐藏比率 [R]
本文通过Lyapunov谱分析发现,MLP和注意力谱范数之间的比率能够预测Transformer模型的几何稳定性,最优范围在0.5–2之间,可防止秩坍缩。
关系泛化与记忆平衡的数学理论
本文介绍了一项新任务——含例外的传递推理,并通过分析刻画了神经网络模型(核岭回归)如何平衡关系泛化与记忆。该理论在预训练语言模型中得到验证,显示了理论预见的系统性错误。
Transformer学习Mestre-Nagao启发式方法
本文训练了一个两层Transformer编码器,利用Frobenius迹将有理椭圆曲线按秩分类,准确率超过99%。机械可解释性揭示该模型学习了Mestre-Nagao启发式方法,并将注意力集中在素数位置上,表明Transformer能够学习数论算法。