Transformer 以不擅长算术而闻名,所以我手动设置了它的权重(无需训练),它实现了 100% 准确的乘法 [P]
摘要
作者使用名为 Torchwright 的编译器手动编写 transformer 权重(无需训练)来实现精确乘法,在三位数运算上达到 100% 准确率,并发布了可处理最多 12 位数乘法的检查点。
显然,没有人需要一个擅长乘法的 transformer。我想知道的是,如果我直接选择权重,一个普通的 transformer 能否做精确算术。我把小学算法实现为计算图,并用我编写的编译器 Torchwright 将其编译成一个普通的 Phi-3 Hugging Face 检查点。无需训练。这个三位数计算器在所有 3,000,000 个受支持的表达式上都给出了正确结果。我已经在 Hugging Face 上发布了支持最多 12 位 × 12 位乘法的检查点。为了好玩,我还禁用了推理功能,测试了六款前沿模型。随着数字变长,准确率急剧下降;在七位数时,有五款模型得分 0/500。我的模型保持在 100%,尽管它有一个相当大的优势:我直接把乘法算法放进了它的权重里。我最终构建了四个版本:小学算法风格、硬件风格、草稿纸风格和暴力记忆风格。它们在层数、宽度、生成的 token 和参数上花费方式不同,但计算的是同一个函数。文章:https://ood.dev/posts/calculator/ 仓库:https://github.com/physicsrob/torchwright 检查点:https://huggingface.co/physicsrob/torchwright-calculator-simple-max-digits-3
相似文章
Transformer学习Mestre-Nagao启发式方法
本文训练了一个两层Transformer编码器,利用Frobenius迹将有理椭圆曲线按秩分类,准确率超过99%。机械可解释性揭示该模型学习了Mestre-Nagao启发式方法,并将注意力集中在素数位置上,表明Transformer能够学习数论算法。
我缩小了一个Transformer,直到每个数字都适配到屏幕上,并且让权重可编辑 [R]
一个交互式网页,可视化了一个小型可编辑权重的Transformer,让用户实时看到权重变化如何影响预测,旨在帮助开发者理解LLM的前向传播过程。
训练基于Transformer的国际象棋模型以模仿人类下棋(包括思考时间)[P]
训练了基于Transformer的国际象棋模型,覆盖从800到2500+的等级分区间,能预测着法、思考时间和结果。仅用9M参数即达到较高准确率,并包含一个新颖的思考时间预测组件。
训练Transformer:初始化时每层权重W = V·Uᵀ,揭示语料库确定的最优秩 — 寻找arXiv背书人 (cs.LG) [D]
本文为Transformer提出原生因子化权重(Native Factorized Weights),即每个线性层从初始化开始就训练为两个低秩矩阵的乘积。实验表明,存在一个由语料库决定的最优秩,可最小化验证损失,并形成一个泛化区间,以更少的参数超越密集基线模型。
Transformer 数学探索器 [P]
这个交互式工具通过数据流图可视化 Transformer 模型的数学基础,涵盖了从 GPT-2 到 Qwen 3.6 的架构以及各种注意力机制。