我构建了一个编译器,可将计算图转换为标准Transformer的权重——无需任何训练 [P]
摘要
一个编译器,能够将在Python中定义的计算图转换为标准Transformer架构(Phi-3)的权重,无需任何训练,且支持使用原生HuggingFace部署,无需自定义代码。
我一直在探索一个问题:Transformer真正能够表达的算法与它所能学习到的算法有何区别。因此,我构建了一个编译器:只需在普通Python中定义一个计算图,它就能生成执行该图的Transformer的权重。最终得到的检查点符合标准Phi-3架构,原生HuggingFace可直接加载,无需自定义代码也无需trust_remote_code。整个流程中零训练。详细说明(原理及构造方式):https://ood.dev/posts/torchwright-intro/ 代码仓库(含12个可运行示例):https://github.com/physicsrob/torchwright 手工构建Transformer权重并非新概念。RASP定义了一种语言,其基本原语映射到Transformer子层,而Tracr则将RASP程序编译为实际权重。我希望实现两个他们未涉及的目标:在普通Python中表达计算图,以及针对标准架构生成输出,使得输出可在原生HuggingFace中加载而无需自定义代码。
相似文章
我构建了一个将Python重写为面向模型表示的编译器
Vulpine是一个编译器,它将人类可读的Python代码转换为针对LLM优化的压缩宏表示,平均减少13.8%的token数,同时支持精确的结构重建。
@sairahul1:没人告诉你GPT或Claude内部到底是什么。他们说“transformer”然后就略过了。这个仓库从头构建了一个……
一个仓库,从头构建transformer,不用高级库,解释注意力机制和完整训练流程,在免费Colab上一天内可训练。
@s_scardapane:《Transformer Cookbook》,作者@pentagonalize、@davidweichiang 等人。对在Transformer权重中“硬编码”算法的优美介绍……
一条推文介绍了《Transformer Cookbook》这篇论文,该论文遵循RASP论文,对在transformer权重中硬编码算法(加法、查找、分支)提供了优美的介绍。
Transformer 数学探索器 [P]
这个交互式工具通过数据流图可视化 Transformer 模型的数学基础,涵盖了从 GPT-2 到 Qwen 3.6 的架构以及各种注意力机制。
@reach_vb: https://x.com/reach_vb/status/2057880274348695995
一名用户演示了使用OpenAI的Codex自动生成一个Colab笔记本,该笔记本在JAX/Flax/Optax中训练一个约1000万参数的transformer进行加法运算,在T4 GPU上经过4000步后达到了高准确率。