Graph Machine: 通过边实现更优预训练

Hugging Face Daily Papers 论文

摘要

本文介绍了Graph Machine,一种通过动态指针将Transformer中的密集注意力层替换为稀疏层的方法,从而在预训练期间提高效率并保持或增强性能。

我们引入了图机器(GM),一种保持O(n)大小的状态并通过稀疏、动态路由访问它的架构。与具有固定大小状态或稀疏但静态路由的方法不同,GM在稀疏层中保持O(n)复杂度,而不将潜在可访问的状态大小限制为O(1)。相反,GM使用边——类似指针的对象,通过类似于指针追逐的引用机制进行可微分更新。我们将Qwen3-0.6B中75%的密集Transformer层替换为GM稀疏层,并在15.7B个标记上从头开始预训练。在每个稀疏层中,每个KV头仅检索4,096个标记中的2个时,损失仅略有下降;当检索4个时,最佳模型的损失略有改善。
查看原文
查看缓存全文

缓存时间: 2026/09/10 02:15

论文页面 - 图机器:通过边优化预训练

来源:https://huggingface.co/papers/2609.02881

作者在此!每个注意力头需要检索多少个token?在这些实验中,4,096个token中仅需检索2-4个即可满足需求。

图机器将Qwen3-0.6B中75%的密集注意力层替换为使用动态指针的稀疏层。注意力通过指针追踪检索内容;引用则通过梯度指针链式追踪传递地址。这种稀疏层具有线性计算复杂度。

我使用标准大语言模型训练方案,基于157亿FineWeb-Edu token进行了从零预训练。与密集基线模型相比,在每个KV头检索2个token的最佳模型中,验证损失仅上升0.014;而检索4个token的最佳模型则将验证损失降低了0.003。

代码(https://github.com/lintaihou/gm2)·检查点(https://huggingface.co/lintaihou/gm2)·训练曲线(https://api.wandb.ai/links/lintaihou/ccz3laev)

欢迎探讨相关架构与实验结果!

相似文章

Graph Machine: Exploring Edge Mechanisms as an Inductive Bias

arXiv cs.LG

This paper introduces Graph Machine, an architecture with explicit edge-based mechanisms (edge-augmented attention and edge-centric referral) to improve iterative relational reasoning. Experiments on Sudoku show it outperforms Transformer baselines, with ablations and mechanistic analysis attributing gains to the edge mechanisms.

面向边缘计算流量智能的时空图Transformer

arXiv cs.LG

本文提出了一种用于边缘计算中流量预测的时空图Transformer框架,结合图神经网络捕捉空间相关性,以及Transformer自注意力捕捉长程时间依赖。在真实蜂窝数据上的实验表明,它优于基于循环图的基线模型,如GCN-LSTM和GCN-GRU。

图注意力何时应稀疏?学习逐边的 Tsallis 指数

arXiv cs.LG

本文提出了 LTGA,一种图注意力层,学习逐边的 Tsallis 熵指数,以在重尾、softmax 和紧支撑注意力之间插值,提供可解释的稀疏注意力,并在图基准上取得有竞争力的性能。