从压缩向量表示中精确读出语义
摘要
本文开发了一种用于形式语义的向量逻辑,描述了压缩向量表示何时允许对真值条件进行精确线性或仿射读出,并在GloVe和word2vec嵌入上进行了实验。
arXiv:2609.18047v1 公告类型:新
摘要:我们描述了压缩向量表示何时允许对有限词汇的真值条件进行精确线性或仿射读出:每个谓词有一个固定的映射,将每个实体向量发送到相应的真值向量。一个必要且充分的行空间条件决定了存在性;增强的真值矩阵具有秩r,在线性情况下给出最小维度r,在仿射情况下为r-1。精确读出在共享的真值基上返回值,布尔连接词在其上作用不变;仅可分性需要一个中间阈值。对于二元关系,精确双线性读出恒等或严格全序要求实体向量线性无关。在GloVe和word2vec上的实验区分了精确仿射恢复、线性可分性和留出预测:大多数谓词是严格可分的,但没有一个从预训练嵌入中允许精确仿射读出。监督转导训练在每个测试的满足界限的维度上实现了数值精度的精确仿射恢复。在嵌入的原始维度上,约束于精确线性恢复的几何形状在特征范数上保留了98-99%的预训练方差,在WordNet词汇上保留了80-83%。
查看缓存全文
缓存时间: 2026/09/17 09:05
# 从压缩向量表示中精确读取语义
来源:https://arxiv.org/html/2609.18047
## 从压缩向量表示中精确读取语义
致谢:本系列第三篇论文,为形式语义学开发向量逻辑[25 (https://arxiv.org/html/2609.18047#bib.bib1), 26 (https://arxiv.org/html/2609.18047#bib.bib2)]。
Daniel Quigley (https://orcid.org/0009-0004-7957-1806)
所属机构:Center for Possible Minds
所属机构:Indiana University Bloomington
所属机构:Bloomington, IN 47408
邮箱:[dgquigle@iu\.edu](mailto:)
###### 摘要
我们描述了何时压缩向量表示允许对有限词库的真值条件进行精确的线性或仿射读取:为每个谓词使用一个固定映射,将每个实体向量映射到相应的真值向量。存在性的充要条件由行空间条件确定;增广真值矩阵的秩为 \(r\),在线性情况下给出最小维度 \(r\),在仿射情况下给出 \(r-1\)。精确读取在共享的真值基上返回数值,布尔连接词在其上作用不变;仅可分性需要一个介于两者之间的阈值。对于二元关系,对恒等式或严格全序进行精确双线性读取要求实体向量线性无关。使用 GloVe 和 word2vec 进行的实验区分了精确仿射恢复、线性可分性和留出预测:大多数谓词是严格可分的,但没有一个谓词能从预训练嵌入中进行精确仿射读取。有监督的归纳训练在满足该界限的每个测试维度上都能达到数值精度的精确仿射恢复。在嵌入的原始维度上,受限于精确线性恢复的几何结构在特征规范上保留了98-99%的预训练方差,在 WordNet 词库上保留了80-83%。
*关键词* 形式语义学⋅\\cdot向量逻辑⋅\\cdot语义空间⋅\\cdot编码⋅\\cdot嵌入⋅\\cdot数理语言学
## 1 引言
蒙塔古语义学在类型域中表示实体和谓词,其组合由模型的函数控制[20 (https://arxiv.org/html/2609.18047#bib.bib6), 9 (https://arxiv.org/html/2609.18047#bib.bib7)]。分布式嵌入将词汇项表示为向量,其几何结构反映了使用模式[4 (https://arxiv.org/html/2609.18047#bib.bib8)]。当这些向量表示有限语义模型的实体时,哪些谓词可以通过线性读取恢复,而压缩又会阻止什么?用于形式语义学的向量逻辑[25 (https://arxiv.org/html/2609.18047#bib.bib1), 26 (https://arxiv.org/html/2609.18047#bib.bib2)]提供了一个精确的构造:每个原始域元素获得自己的基向量,语义函数从自由载体线性扩展,在原始中间类型上保持组合。线性无关性使这些提升成为可能。学习到的嵌入维度通常少于实体数量,因此引入了可能阻碍提升的线性依赖关系。嵌入查找层 \(\mathbf{E} \in \mathbb{R}^{V \times d}\) 在独热输入上等同于一个无偏线性层[27 (https://arxiv.org/html/2609.18047#bib.bib3)]。因此,它可以因子化通过自由实体载体,即 \(\mathbf{E}^\top: \mathbb{R}^V \to \mathbb{R}^d\)。这区分了两种机制:*自由*几何结构拥有线性无关的实体向量,并允许所有语义提升;*压缩*几何结构拥有相关向量,只允许那些与其依赖性兼容的提升。压缩不一定消除实体身份:不同的列仍然允许对有限域上的任意谓词进行查找;因此,我们感兴趣的是哪些谓词仍然是线性可恢复的。对于具有真值矩阵 \(\mathbf{T}\) 的一元词库,我们证明了精确读取到共享真值基的存在性,当且仅当几何结构的行空间包含 \(\operatorname{row}[\mathbf{T}; \mathbf{1}]\)。这个增广真值矩阵的秩给出了最小维度,而其核指定了实体向量之间允许的依赖关系。因此,一个受限的词库可以允许精确压缩,尽管要求每个谓词则强制要求自由机制。一旦原子读取返回真值基,布尔连接词的作用保持不变。精确读取强于线性可分性:一个分数可能区分真实例和假实例,而本身并不返回其真值。这一区别将线性探测[3 (https://arxiv.org/html/2609.18047#bib.bib17)]与向量逻辑联系起来。这样的读取是否存在,以及是否可以从实体子集中学习到,是两个独立的问题。我们在分布式嵌入上测试精确恢复、可分性和留出预测,然后考察预训练方差中有多少能在监督训练到精确恢复的过程中存活。图1 (https://arxiv.org/html/2609.18047#S1.F1)总结了该计划以及这些问题之间的依赖关系。
自由载体
嵌入
\(H = \mathbf{E}^\top\)
精确读取
\(\operatorname{row}[\mathbf{T}; \mathbf{1}] \subseteq \operatorname{row}(H)\)
语义计算
压缩界限
缺陷与可分性
监督几何
预训练几何
图 1:形式结果与实证分析之间的依赖关系。
## 2 向量逻辑
我们回顾文献[25 (https://arxiv.org/html/2609.18047#bib.bib1)]中的定义和同态定理,以及文献[26 (https://arxiv.org/html/2609.18047#bib.bib2)]中的索引-排序内容。我们不重新证明相关内容;请参考各自论文中的适当内容。
### 2\.1 外延模型与自由载体
类型由 \(e\) 和 \(t\) 通过 \(\langle \sigma, \tau \rangle\) 生成。一个类型化的外延模型 \(\mathcal{M}_{ext} = \langle (\mathcal{D}_\tau)_\tau, \mathcal{I} \rangle\) 拥有实体域 \(\mathcal{D}_e\),真值域 \(\mathcal{D}_t = \{1, 0\}\),函数域 \(\mathcal{D}_{\langle \sigma, \tau \rangle} = \mathcal{D}_\tau^{\mathcal{D}_\sigma}\),以及一个解释 \(\mathcal{I}\);指称 \(\llbracket \cdot \rrbracket\) 遵循文献[9 (https://arxiv.org/html/2609.18047#bib.bib7)]的递归。全文中,令 \(\mathcal{D}_e\) 为有限集[1],其中 \(|\mathcal{D}_e| = V\),元素为 \(d_1, \dots, d_V\)。
[^1]: 有限性限制使得下面的秩陈述有意义;外延定理本身对任何基数的域都成立。
向量空间模型 \(\mathcal{M}_{\mathcal{S}}\) 为每个域分配一个实向量空间 \(\mathcal{S}_{\mathcal{D}_\tau}\) 和一个单射 \(h_\tau: \mathcal{D}_\tau \to \mathcal{S}_{\mathcal{D}_\tau}\)。该构造采用以下形式:
\(h_e(d_i) = \mathbf{e}_i \in \mathbb{R}^V, \qquad h_t(1) = \mathbf{b}_1 = \begin{bmatrix} 1 \\ 0 \end{bmatrix}, \qquad h_t(0) = \mathbf{b}_0 = \begin{bmatrix} 0 \\ 1 \end{bmatrix}\),
其中 \(\mathbf{e}_i\) 是第 \(i\) 个标准基向量,对于函数类型,将 \(f \in \mathcal{D}_{\langle \sigma, \tau \rangle}\) 发送到线性映射 \(L_f\),它在 \(\sigma\) 的自由载体的基 \(\{\mathbf{e}_a\}_{a \in \mathcal{D}_\sigma}\) 上由 \(L_f \mathbf{e}_a = h_\tau(f(a))\) 决定;线性映射由其在基上的值决定,因此这唯一地确定了 \(L_f\)。注意,文献[25 (https://arxiv.org/html/2609.18047#bib.bib1)]通过基向量嵌入每个域(包括函数类型域),并通过左逆 \(h_\sigma^{-1}\) 在 \(h_\sigma\) 的像上逐点定义提升 \(h_f\);文献[26 (https://arxiv.org/html/2609.18047#bib.bib2)]为每个类型附加了一个自由载体 \(\mathcal{F}_\tau\),其基由 \(\mathcal{D}_\tau\) 索引,以及一个算子载体 \(\mathcal{S}_\tau\),其中 \(\mathcal{S}_{\langle \sigma, \tau \rangle} = \operatorname{Hom}(\mathcal{F}_\sigma, \mathcal{S}_\tau)\),使得自由载体位于参数位置,并且两个载体在原始类型上重合。我们采用第二个约定,因为下面的结果涉及实体空间上的线性读取,其类型是原始的,我们称族 \(\{\mathcal{F}_\tau\}\) 为自由载体:原始域的元素映射到基向量,原始空间在其域上是自由的。特别地,一个一元谓词 \(P \in \mathcal{D}_{\langle e, t \rangle}\) 成为 \(2 \times V\) 矩阵 \(\mathbf{M}_P = [\, h_t(P(d_1)) \;\; \cdots \;\; h_t(P(d_V)) \,]\),其第 \(i\) 列是 \(P\) 赋予 \(d_i\) 的真值向量,并且 \(\mathbf{M}_P \mathbf{e}_i = h_t(P(d_i))\) 是函数应用。真值函子连接词在真值空间的张量幂上成为固定矩阵,一个 \(n\) 元连接词 \(c\) 作为 \(2 \times 2^n\) 矩阵 \(\mathbf{M}_c\) 作用于 \(\bigotimes_i h_t(t_i)\);例如 \(\mathbf{M}_{\neg} = \begin{bmatrix} 0 & 1 \\ 1 & 0 \end{bmatrix}, \mathbf{M}_{\wedge} = \begin{bmatrix} 1 & 0 & 0 & 0 \\ 0 & 1 & 1 & 1 \end{bmatrix}\),在张量基的排序 \(\mathbf{b}_1 \otimes \mathbf{b}_1, \mathbf{b}_1 \otimes \mathbf{b}_0, \mathbf{b}_0 \otimes \mathbf{b}_1, \mathbf{b}_0 \otimes \mathbf{b}_0\) 下,参考文献[19 (https://arxiv.org/html/2609.18047#bib.bib10), 31 (https://arxiv.org/html/2609.18047#bib.bib11)]。
### 2\.2 同态定理
###### 定理 2\.1
对于每个外延模型 \(\mathcal{M}_{ext}\),存在单射族 \(\{h_\tau\}\) 进入向量空间族 \(\{\mathcal{S}_{\mathcal{D}_\tau}\}\),使得每个语义函数 \(f: \mathcal{D}_\sigma \to \mathcal{D}_\tau\) 都有一个唯一的线性提升 \(L_f: \mathcal{F}_\sigma \to \mathcal{S}_{\mathcal{D}_\tau}\)(从 \(\sigma\) 的自由载体),满足对于每个 \(a \in \mathcal{D}_\sigma\),\(L_f(\mathbf{b}_a) = h_\tau(f(a))\),其中 \(\mathbf{b}_a\) 是 \(a\) 的自由编码,当 \(\sigma\) 是原始类型时与 \(h_\sigma(a)\) 一致;\(n\) 元函数提升为自由载体上的多重线性映射,语义函数的组合对应于沿原始中间类型的提升组合。
\[
\begin{CD}
\mathcal{D}_\sigma @>{f}>> \mathcal{D}_\tau \\
@V{h_\sigma}VV @VV{h_\tau}V \\
\mathcal{S}_{\mathcal{D}_\sigma} @>>{L_f}> \mathcal{S}_{\mathcal{D}_\tau}
\end{CD}
\]
对于每个具有原始参数类型的 \(f\) 都交换,这涵盖了下面的所有函数,因此一旦参数以自由编码携带,\(\mathcal{M}_{ext}\) 中任何表达式的递归求值在 \(\mathcal{M}_{\mathcal{S}}\) 中都有逐步的对应物。这些单射按设计是非满射的:\(\operatorname{im}(h_t) = \{\mathbf{b}_1, \mathbf{b}_0\}\) 是 \(\mathbb{R}^2\) 的真子集,并且指称被限制在像中。定理2\.1 (https://arxiv.org/html/2609.18047#S2.Thmtheorem1) 是存在性的:自由载体是允许提升存在的一族单射,而其他族是第4节 (https://arxiv.org/html/2609.18047#S4) 的主题。单个函数的交换图来自文献[25 (https://arxiv.org/html/2609.18047#bib.bib1)],其中提升仅定义在像上;在原始参数类型的张成空间上的线性性、\(n\) 元函数的多重线性提升以及函数类型的算子载体来自文献[26 (https://arxiv.org/html/2609.18047#bib.bib2)],其下降定理决定了函数域上的泛函何时也在线性作用于算子编码上:在幂集上,恰好是常数、超滤指示器及其补集,在有限域上就是常数、蒙塔古的个体 \(\lambda P.\, P(d)\) 及其否定。
### 2\.3 索引类型
内涵层附加了索引类型(世界和时间等),收集在复合索引空间 \(S = \prod_\sigma \mathcal{D}_\sigma\) 中,拥有其自身的自由载体 \(h_S(s) = \mathbf{e}_s\),复合索引类型 \(s\) 的载体 \(\mathcal{F}_s\)。一个内涵 \(g: S \to \mathcal{D}_\tau\) 成为线性算子 \(\mathcal{S}_S \to \mathcal{S}_{\mathcal{D}_\tau}\),满足 \(\mathbf{e}_s \mapsto h_\tau(g(s))\);一个命题 \(\varphi\) 成为 \(\mathbf{P}_\varphi \in \mathbb{R}^{2 \times |S|}\),其真值剖面 \(\mathbf{v}(\varphi) \in \{0, 1\}^{|S|}\) 是其顶行。在一个离散的世界类型 \(W = \{w_1, \dots, w_n\}\) 上,具有可达性矩阵 \(\mathbf{A} \in \{0, 1\}^{n \times n}\),文献[26 (https://arxiv.org/html/2609.18047#bib.bib2)]中的模态算子读作 \((\Box\varphi)(w_i) = 1 \iff (\mathbf{A}\,(\mathbf{1} - \mathbf{v}(\varphi)))_i = 0,\) \((\Diamond\varphi)(w_i) = 1 \iff (\mathbf{A}\,\mathbf{v}(\varphi))_i > 0,\) (1)
一个线性累积后跟一个决策;当出度 \(\operatorname{deg}_{\mathbf{A}}(w_i) = \sum_j \mathbf{A}_{ij}\) 有限时(如此处),第一个条件等价于 \((\mathbf{A}\,\mathbf{v}(\varphi))_i = \operatorname{deg}_{\mathbf{A}}(w_i)\)。此外,算子在测度框架上定义,其中离散情况的计数测度只是其他选择之一;有限几何矩阵承载了具有有限多个索引的离散情况,这是我们第7节 (https://arxiv.org/html/2609.18047#S7) 中限制的情况。
## 3 自由载体上的嵌入查找
嵌入层在独热输入上是线性层的观察归功于文献[27 (https://arxiv.org/html/2609.18047#bib.bib3), 28 (https://arxiv.org/html/2609.18047#bib.bib4)],他们也解释了为什么框架引入转置以及为什么实现使用查找形式。我们在这里详细阐述它,并将其应用于我们的向量逻辑。
### 3\.1 设置
令 \(V \geq 1\) 为词汇表大小,\(d \geq 1\) 为嵌入维度。嵌入矩阵是任意 \(\mathbf{E} \in \mathbb{R}^{V \times d}\),其行 \(\mathbf{E}_i \in \mathbb{R}^{1 \times d}\),条目 \(E_{ij}\)。查找是 \(l_{\mathbf{E}}(i) = \mathbf{E}_i\),对于 \(i \in \{1, \dots, V\}\),而具有权重 \(\mathbf{E}\) 的无偏线性层是 \(L_{\mathbf{E}}(x) = x^\top \mathbf{E}\),对于 \(x \in \mathbb{R}^V\)。输出是行向量,因此批次垂直堆叠。在将词汇表视为实体域的解读下,\(\mathbf{e}_i = h_e(d_i)\) 且 \(L_{\mathbf{E}}(\mathbf{e}_i) = (\mathbf{E}^\top \mathbf{e}_i)^\top\);复合 \(\mathbf{E}^\top \circ h_e\) 是第二个相似文章
向量并非中性:从导出的大语言模型表征中推断敏感信息——以摘要生成为例
本文探讨了在临床摘要生成中从导出的大语言模型表征推断敏感信息的风险,表明减少一个向量工件的泄露并不能保证其他工件的隐私。提出了SurfaceLoRA,一种微调方法,可在保持效用的同时减少从目标向量中恢复种族信息的能力。
我们尝试了向量、抽象语法树(AST)以及粗暴地堆砌上下文以进行代码检索。带有大语言模型(LLM)生成语义的图结构效果最佳。以下是我们的经验总结。
作者们详细描述了他们在构建代码索引系统的经验,最终得出结论:使用大语言模型(LLM)生成语义的图检索方式在性能上优于向量嵌入和纯抽象语法树(AST)解析。他们将该系统开源,命名为 Bytebell,它利用 Neo4j 存储语义上下文,以实现高效且精确的代码检索。
上下文压缩并非单一方法:匹配预算下可读符号重表达与连贯摘要的对比
本文提出Telegraph English,一种可读的符号格式用于上下文压缩,在多跳问答数据集上优于匹配预算的基线方法,更密集地保留了实体内容。
@_reachsumit: Latent Terms: 密集检索器包含可轻松提取的BM25就绪齐普夫词汇表 @bclavie 等人提取中…
该论文提出 Latent Terms 方法,使用稀疏自编码器从冻结的密集检索器中提取BM25就绪的稀疏特征,无需检索特定训练即可实现有竞争力的性能。
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。