数字已经自带嵌入

arXiv cs.LG 论文

摘要

介绍了Adelic保运算嵌入(AOE),一种无需训练的表示方法,通过结合实数值与p-adic展开来编码数字,保留加法和乘法结构。在Weaving Pattern基准上实现了完美准确率。

arXiv:2606.14108v1 公告类型:新 摘要:我们介绍了Adelic保运算嵌入(AOE),一种无需训练的表示方法,可以同时捕获数字的实数值及其模(p-adic)签名。这种构造天然保留了加法和乘法结构,将数值输入转化为“用数学语言说话”的嵌入。与之前依赖任务特定重新训练的方法不同,AOE即插即用,能够无缝融入现有架构。在代数组合学基准测试中,它取得了持续的性能提升,包括在Weaving Pattern任务上首次实现完美准确率——同时为克服AI中长期存在的“数字问题”提出了一条有原则的前进道路。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:10

# 数字本身已携带嵌入
来源:https://arxiv.org/html/2606.14108
Suhyun Bae &Donghun Lee 数学系 高丽大学 \{baeshstar, holy\}@korea\.ac\.kr

###### 摘要

我们引入**Adelic 运算保持嵌入(AOE)**,这是一种无需训练的表示,能够同时捕捉数字的实数值与模 p 进(pp-adic)特征。该构造通过设计保留了加法和乘法结构,将数字输入转化为“用数学语言表达”的嵌入。与依赖特定任务重新训练的先前方法不同,AOE 即插即用,可无缝融入现有架构。在代数组合学基准测试上,它取得了持续提升——包括在编织图案任务上首次达到完美准确率——同时为克服人工智能中长期存在的“数字问题”指明了一条原则性路径。

## 1 引言

大型语言模型近期在数学推理方面取得了里程碑式的突破——例如,Gemini 2.5 Pro 在 2025 年国际数学奥林匹克竞赛中达到了金牌水平 [Huang and Yang (2025 (https://arxiv.org/html/2606.14108#bib.bib11))]。然而,一个悖论随之浮现:在某些核心任务上,更简单的基线模型(如原始 Transformer 甚至 MLP)可以胜过 Claude 3.5 Sonnet 和 GPT-4o 等最先进系统 [Chau et al. (2025 (https://arxiv.org/html/2606.14108#bib.bib1))]。这种惊人的反转凸显了规模本身并未解决人工智能中最古老的瓶颈之一:**数值表示**。

大多数 LLM 仍然将数字视为字符序列。从字节对编码 [Gage (1994 (https://arxiv.org/html/2606.14108#bib.bib12))] 到现代分词方案,数字被分割成任意的子词单元,剥离了定义数字本身的加法和乘法关系 [Wallace et al. (2019 (https://arxiv.org/html/2606.14108#bib.bib13)); Thawani et al. (2021 (https://arxiv.org/html/2606.14108#bib.bib15))]。其结果是推理脆弱、泛化不一致,并且在需要算术精度的任务中出现系统性错误。先前的努力探索了连续嵌入、逐位位置编码或符号预训练 [Golkar et al. (2024 (https://arxiv.org/html/2606.14108#bib.bib16)); Levy and Geva (2025 (https://arxiv.org/html/2606.14108#bib.bib18))]。虽然有价值,但这些方法依赖于模型在训练过程中**隐式**重新发现数学规则,而非直接嵌入这些规则。

我们主张一条不同的路径:数字本身已携带它们的嵌入。借鉴代数数论,我们引入了 Adelic 运算保持嵌入(AOE),这是一种无需训练的表示,通过将每个数字的实数值与模 p 进展开相结合进行编码。该构造通过设计保留了加法和乘法结构,为临时性的分词方案提供了一种原则性替代方案。

#### 贡献

我们的贡献如下:

1.  1. 我们提出了 AOE,一种无需训练、基于代数基础的表示,直接尊重数值结构。
2.  2. 我们将 AOE 定位为解决人工智能中长期困扰的“数字问题”的一步,提供一种适用于各种架构的即插即用补救方案。
3.  3. 在代数组合学基准测试上,配备 AOE 的 Transformer 在每项任务上都优于基线,特别是在编织图案基准测试上首次达到完美准确率。

## 2 方法

我们的目标是设计一种数值表示,保留数字中固有的代数结构。我们不将数字分割成子词标记,而是直接在一个**Adele 空间**中构造嵌入,该空间结合了一个实分量与多个 p 进分量。每个 p 进分量位于 Zp\\mathbb\{Z\}\_\{p\} 中,这是一个具有从 Z\\mathbb\{Z\} 继承的明确定义的加法与乘法的环。因此,这产生了一个沿坐标保持算术的乘积结构:对于有理数 q1,q2q\_\{1\},q\_\{2\},

A\(q1+q2\)=A\(q1\)⊕A\(q2\),A\(q1·q2\)=A\(q1\)⊗A\(q2\)\\mathbf\{A\}\(q\_\{1\}+q\_\{2\}\)=\\mathbf\{A\}\(q\_\{1\}\)\\oplus\\mathbf\{A\}\(q\_\{2\}\),\\quad\\mathbf\{A\}\(q\_\{1\}\\cdot q\_\{2\}\)=\\mathbf\{A\}\(q\_\{1\}\)\\otimes\\mathbf\{A\}\(q\_\{2\}\)其中 ⊕,⊗\\oplus,\\,\\otimes 表示在拼接的实坐标和 p 进坐标上的逐坐标运算,通过 N 位截断实现。

#### Adele 空间。

Adele 环是代数数论中的经典构造 [Lang (1994 (https://arxiv.org/html/2606.14108#bib.bib2))],它将实直线与有理数的所有 p 进完备化统一起来。直观上,每个数字在不同素数下携带独特的“签名”,AOE 在捕获其实数值的同时也捕获这些签名。例如,7/5\\nicefrac\{\{7\}\}\{\{5\}\} 不仅在 R\\mathbb\{R\} 中表示为 1.41.4,还通过 p 进展开来表示,例如在 2 进数中为 ...11011\\dots 11011,在 3 进数中为 ...01212\\dots 01212。这些互补的视角使得嵌入能够同时编码量级和模结构。

#### 嵌入构造。

为了构建有理数 qq 的嵌入,我们拼接:(i) 一个实值分量,以及 (ii) 一组有限个 p 进展开,截断至 N 位精度。得到的张量形状为 (np+1)×N(n\_\{p\}+1)\\times N,其中 npn\_\{p\} 是所选素数的个数。实现细节——如使用 Hensel 引理进行数字提升和精确的 p 进展开——见附录 A (https://arxiv.org/html/2606.14108#A1) 和附录 B (https://arxiv.org/html/2606.14108#A2)。

#### 即插即用集成。

AOE 无需训练且与架构无关。它可以直接替换 Transformer 或其他神经模型中的标准嵌入层,无需特定任务调优。在实践中,这意味着输入嵌入查找被替换为预计算的 Adelic 表示张量,这些张量被展平为 dmodeld\_\{\\text\{model\}\} 维向量。我们还添加了一个轻量级的 2D 位置编码,以同时合并序列位置和每个 Adelic 张量的内部结构。得到的处理流程与标准 Transformer 编码器无缝集成,如图 1 (https://arxiv.org/html/2606.14108#S2.F1) 所示。

参见图注图 1:总结实验所用配备 AOE 的 Transformer 模型工作流架构的示意图。

## 3 实验与结果

### 3.1 模型

为了隔离输入表示的影响,我们实现了两个 Transformer 编码器模型,它们在架构上相同但嵌入层不同。两个模型均使用 6 层 Transformer 编码器,8 个注意力头,隐藏维度 dmodel=128d\_\{\\text\{model\}\}=128,丢弃率为 0.1。对应于 [CLS] 标记的最终隐藏状态通过一个线性层进行分类。

**基线**模型使用标准的 nn.Embedding 查找整数标记,后接正弦位置编码。由于 nn.Embedding 是可训练的,该基线引入了额外的可学习参数。相比之下,**配备 AOE** 的模型将嵌入查找替换为预计算的 Adelic 表示张量,这些张量无需训练并被展平为 dmodeld\_\{\\text\{model\}\} 维向量。我们还添加了一个 2D 位置编码,联合编码序列索引、素数索引以及每个 p 进展开的数字索引,从而保留结构信息。

至关重要的是,这种设计确保任何性能差异完全来自表示,而非模型容量:基线实际上拥有更多的可学习参数,这使得 AOE 的改进更加显著。

### 3.2 数据集

我们在**代数组合学数据集(ACD)**[Chau et al. (2025 (https://arxiv.org/html/2606.14108#bib.bib1))] 上评估我们的方法,该基准旨在支持数学研究中的猜想阶段。与 `GSM8K` [Cobbe et al. (2021 (https://arxiv.org/html/2606.14108#bib.bib21))] 或其他算术文字问题数据集(主要关注初中或小学水平的数学)不同,ACD 包含了与代数组合学中未解决问题相关的任务。因此,它是一个特别具有挑战性的测试平台:它不仅表现出规模和不平衡性(多达 10710^7 个实例,具有重尾分布),还要求模型能够对超越死记硬算的代数结构进行推理。

从数据集中提供的九个任务中,我们聚焦于六个分类问题,涵盖排列、Tableau、格路、箭图和不变量多项式。这一选择既提供了组合对象的广度,也提供了输入类型(字符串、矩阵、图)的多样性。详细的任务描述和数学背景见附录 C (https://arxiv.org/html/2606.14108#A3)。

### 3.3 结果

两个模型均从头开始使用 Adam 优化器和交叉熵损失进行训练。为了解决 ACD 任务中的类别不平衡问题,我们使用 `WeightedRandomSampler` 来平衡训练批次。额外的超参数、学习率计划和每个任务的设置见附录 D (https://arxiv.org/html/2606.14108#A4)。

在所有六个任务中,AOE 始终优于基线。这支持了我们的核心主张:**显式编码代数结构能够比基于文本的嵌入实现更强的泛化能力**。

改进幅度从适度但持续的增益(例如,格路分类)到显著跳跃(例如,Schubert 多项式和箭图突变类)。最引人注目的是,我们的模型在编织图案基准测试上首次达到完美准确率,该任务甚至难倒了大规模语言模型。

这些发现表明,基于代数的表示可以缩小数值推理中长期存在的差距。将数字嵌入数学上忠实的空间,而不是依赖规模或隐式学习,为神经模型实现更可靠的符号推理提供了一条原则性路径。

表 1 (https://arxiv.org/html/2606.14108#S3.T1) 和表 3 (https://arxiv.org/html/2606.14108#A5.T3) 提供了详细的准确率和损失值。

表 1:代数组合学基准测试上的最终测试准确率(%)比较。越高越好。

## 4 讨论

我们当前的框架仅限于有理数,因为 Adele 环是在 Q\\mathbb\{Q\} 上定义的。将构造扩展到无理数、复数或超越常数需要新的理论工具。

另一个限制涉及素数和数字精度的手动选择。在本研究中,我们根据启发式方法固定这些超参数。更合理或自适应的策略可能会提高效率和表达能力。

最后,虽然 AOE 无需训练,但其使用引入了计算开销:预计算和 2D 位置编码使得训练比标准嵌入慢大约 4-5 倍。

我们将这些挑战视为未来工作的机遇,旨在将 AOE 拓展到更通用和可扩展的设置。

## 5 结论

这项工作从一个简单的观察开始:数字已经包含了表示它们所需的结构。通过 AOE 使这一结构显式化,我们展示了神经模型在符号数学任务上达到了连最大型 LLM 都无法企及的可靠性水平。

更广泛的信息是概念性的。如果数字不仅仅是标记,那么人工智能推理的未来取决于嵌入**对象的数学结构**,而不仅仅是描述它们的语言。AOE 展示了代数数论的思想如何作为即插即用组件在神经架构中运作,为将符号严谨性与神经可扩展性结合起来指明了一条道路。

## 致谢与资助披露

这项工作得到了韩国国家研究基金会(NRF)资助,由韩国政府(MSIT)提供(RS-2025-24873052)。

## 参考文献

- [1] H. Chau, H. Jenne, D. Brown, J. He, M. Raugas, S. C. Billey, and H. Kvinge (2025) Machine learning meets algebraic combinatorics: a suite of datasets capturing research-level conjecturing ability in pure mathematics. 在 *第四十二届国际机器学习大会*,外部链接:链接 (https://openreview.net/forum?id=tlniJJFUW2) 被引于:附录 C (https://arxiv.org/html/2606.14108#A3.p1.1), §1 (https://arxiv.org/html/2606.14108#S1.p1.1), §3.2 (https://arxiv.org/html/2606.14108#S3.SS2.p1.1)。
- [2] K. Cobbe, V. Kosaraju, M. Bavarian, M. Chen, H. Jun, L. Kaiser, M. Plappert, J. Tworek, J. Hilton, R. Nakano, C. Hesse, and J. Schulman (2021) Training verifiers to solve math word problems. 外部链接:2110.14168, 链接 (https://arxiv.org/abs/2110.14168) 被引于:§3.2 (https://arxiv.org/html/2606.14108#S3.SS2.p1.1)。
- [3] P. Gage (1994-02) A new algorithm for data compression. *C Users J.* 12(2), pp. 23–38. 外部链接:ISSN 0898–9788 被引于:§1 (https://arxiv.org/html/2606.14108#S1.p2.1)。
- [4] S. Golkar, M. Pettee, M. Eickenberg, A. Bietti, M. Cranmer, G. Krawezik, F. Lanusse, M. McCabe, R. Ohana, L. Parker, B. R. Blancard, T. Tesileanu, K. Cho, and S. Ho (2024) XVal: a continuous numerical tokenization for scientific language models. 外部链接:2310.02989, 链接 (https://arxiv.org/abs/2310.02989) 被引于:§1 (https://arxiv.org/html/2606.14108#S1.p2.1)。
- [5] K. Hensel (1908) *Theorie der algebraischen zahlen*. B. G. Teubner, 莱比锡。外部链接:链接 (https://archive.org/details/in.ernet.dli.2015.493154) 被引于:第2项 (https://arxiv.org/html/2606.14108#A1.I1.i2.I1.i2.p1.2)。
- [6] Y. Huang and L. F. Yang (2025) Gemini 2.5 pro capable of winning gold at imo 2025. 外部链接:2507.15855, 链接 (https://arxiv.org/abs/2507.15855) 被引于:§1 (https://arxiv.org/html/2606.14108#S1.p1.1)。
- [7] S. Lang (1994) Ideles and adeles. 载于 *代数数论*,pp. 137–154。外部链接:ISBN 978-1-4612-0853-2, 文献 (https://dx.doi.org/10.1007/978-1-4612-0853-2%5F7), 链接 (https://doi.org/10.1007/978-1-4612-0853-2_7) 被引于:§2 (https://arxiv.org/html/2606.14108#S2.SS0.SSS0.Px1.p1.7)。
- [8] A. A. Levy and M. Geva (2025) Language models encode numbers using digit representations in base 10. 外部链接:2410.11781, 链接 (https://arxiv.org/abs/2410.11781) 被引于:§1 (https://arxiv.org/html/2606.14108#S1.p2.1)。
- [9] A. Ostrowski (1916) Über einige lösungen der funktionalgleichung φ(x)·φ(y)=φ(xy). *Acta Mathematica* 41(1), pp. 271–284. 外部链接:文献 (https://dx.doi.org/10.1007/BF02422947), ISSN 0001–5962 被引于:§A.1 (https://arxiv.org/html/2606.14108#A1.SS1.p1.5)。
- [10] A. Thawani, J. Pujara, P. A. Szekely, and F. Ilievski (2021) Representing numbers in nlp: a survey and a vision. 外部链接:2103.13136, 链接 (https://arxiv.org/abs/2103.13136) 被引于:§1 (https://arxiv.org/html/2606.14108#S1.p2.1)。
- [11] E. Wallace, Y. Wang, S. Li, S. Singh, and M. Gardner (2019-11) Do NLP models know numbers? probing numeracy in embeddings. 在 *2019年自然语言处理实证方法会议暨第九届自然语言处理国际联合会议(EMNLP-IJCNLP)论文集*,K. Inui, J. Jiang, V. Ng, 和 X. Wan (编),香港,中国,pp. 5307–5315。外部链接:链接 (https://aclanthology.org/D19-1534/), 文献 (https://dx.doi.org/10.18653/v1/D19-1534) 被引于:§1 (https://arxiv.org/html/2606.14108#S1.p2.1)。

## 附录 A Adelic 运算保持嵌入的形式化

### A.1 Adele 环

###### 定义 1(Adele 环)。

设 KK 是一个全局域,而 AK\\mathbb\{A\}\_\{K\} 是一个“Adele 环”,如果

AK=∏v(Kv,Ov)\\mathbb\{A\}\_\{K\}=\\p

相似文章

数值感知嵌入

Reddit r/LocalLLaMA

一种通过重写分词器和MLM微调来使嵌入模型感知数字顺序的技术,在数字排序基准上达到59%的准确率。

介绍文本和代码嵌入

OpenAI Blog

OpenAI 推出了新的嵌入 API 端点,可以将文本和代码转换为数值向量表示,用于语义搜索、聚类和分类任务。这些模型在标准基准测试上取得了最先进的效果,包括代码搜索性能相比之下提升了 20%。

全新改进的嵌入模型

OpenAI Blog

OpenAI 发布了 text-embedding-ada-002,这是一个统一的嵌入模型,将之前的五个模型整合为一个,具有更出色的性能、4 倍更长的上下文窗口(8192 个令牌)、更小的维度(1536)以及比之前的 Davinci 嵌入模型低 99.8% 的定价。