Graph Machine: 通过边实现更优预训练
摘要
本文介绍了Graph Machine,一种通过动态指针将Transformer中的密集注意力层替换为稀疏层的方法,从而在预训练期间提高效率并保持或增强性能。
查看缓存全文
缓存时间: 2026/09/10 02:15
论文页面 - 图机器:通过边优化预训练
来源:https://huggingface.co/papers/2609.02881
作者在此!每个注意力头需要检索多少个token?在这些实验中,4,096个token中仅需检索2-4个即可满足需求。
图机器将Qwen3-0.6B中75%的密集注意力层替换为使用动态指针的稀疏层。注意力通过指针追踪检索内容;引用则通过梯度指针链式追踪传递地址。这种稀疏层具有线性计算复杂度。
我使用标准大语言模型训练方案,基于157亿FineWeb-Edu token进行了从零预训练。与密集基线模型相比,在每个KV头检索2个token的最佳模型中,验证损失仅上升0.014;而检索4个token的最佳模型则将验证损失降低了0.003。
代码(https://github.com/lintaihou/gm2)·检查点(https://huggingface.co/lintaihou/gm2)·训练曲线(https://api.wandb.ai/links/lintaihou/ccz3laev)
欢迎探讨相关架构与实验结果!
相似文章
Graph Machine: Exploring Edge Mechanisms as an Inductive Bias
This paper introduces Graph Machine, an architecture with explicit edge-based mechanisms (edge-augmented attention and edge-centric referral) to improve iterative relational reasoning. Experiments on Sudoku show it outperforms Transformer baselines, with ablations and mechanistic analysis attributing gains to the edge mechanisms.
面向边缘计算流量智能的时空图Transformer
本文提出了一种用于边缘计算中流量预测的时空图Transformer框架,结合图神经网络捕捉空间相关性,以及Transformer自注意力捕捉长程时间依赖。在真实蜂窝数据上的实验表明,它优于基于循环图的基线模型,如GCN-LSTM和GCN-GRU。
图注意力何时应稀疏?学习逐边的 Tsallis 指数
本文提出了 LTGA,一种图注意力层,学习逐边的 Tsallis 熵指数,以在重尾、softmax 和紧支撑注意力之间插值,提供可解释的稀疏注意力,并在图基准上取得有竞争力的性能。
面向目标任务的预训练数据选择:基于神经元激活图的方法
提出神经元激活图排序(Neuron-Activated Graph Ranking),一种无需训练的框架,利用稀疏高影响神经元集合为目标任务挑选预训练数据,平均基准性能提升 4.9%。
语法引导的稀疏注意力机制:实现高效可解释的Transformer
本文介绍了一种针对Transformer的语法引导稀疏注意力机制,旨在通过利用语言结构来提高效率和可解释性。