简单变换在文本嵌入模型间的迁移能力有多强?

arXiv cs.LG 论文

摘要

这篇arXiv论文研究了简单的线性变换是否能在九个异构文本嵌入模型之间转换表示,发现共享结构和可迁移性共同取决于架构、训练目标、池化方法和数据分布,对普遍潜在兼容性的观念提出了挑战。

arXiv:2608.05980v1 公告类型:新 摘要:我们研究简单变换是否能在异构文本嵌入模型之间转换表示。理解独立训练的模型如何组织语义信息,是在无需解码为人类可读文本的情况下实现AI到AI潜在通信的推动力。我们专注于线性映射等轻量级转换器,在现实文本环境中检验了文献中关于潜在普遍性的假设,而不仅仅是简化基准测试。在九个在架构、池化策略和训练目标上有所不同的嵌入模型中,我们使用CKA、下游迁移、保真度和检索来评估兼容性。简单转换器能恢复有意义的共享结构,并支持某些兼容配对之间的迁移,但在其他配对中则明显失败。兼容性共同取决于架构、训练目标、池化方法和数据分布。总体而言,结果表明异构嵌入空间并非如某些文献中常建议的那样通过简单映射普遍关联。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:53

# 简单变换在文本嵌入模型之间的迁移效果如何?

来源:https://arxiv.org/html/2608.05980
Sid Ali Hamideche Orange sidali\.hamideche@orange\.com&Louis Adrien Dufrene Orange louisadrien\.dufrene@orange\.com&Quentin Lampin Orange quentin\.lampin@orange\.com&Guillaume Larue Orange guillaume\.larue@orange\.com

###### 摘要

我们研究了简单变换是否能在异构文本嵌入模型之间迁移表示。理解独立训练的模型如何组织语义信息,是实现不经过人类可读文本解码的 AI 到 AI 潜在空间通信的关键。我们聚焦于线性映射等轻量级变换,在现实文本场景中检验潜在空间通用性的文献假设,而不是局限于简化基准。我们选取了九个在架构、池化策略和训练目标上各不相同的嵌入模型,使用 CKA、下游迁移、保真度和检索来评估兼容性。简单变换能够恢复有意义的共享结构,并支持某些兼容模型对的迁移,但在其他模型对上严重失效。兼容性同时取决于架构、训练目标、池化方式和数据分布。总体而言,结果表明异构嵌入空间并非像部分文献中经常暗示的那样,可以由简单映射普遍关联。

## 1 引言

文本嵌入模型正越来越多地被用作检索、分类和多模态系统的可互换基础设施。这一趋势引出一个根本性问题:当两个模型处理相同的文本时,它们的表示有多相似?能否用简单变换(如线性映射)将它们关联起来?

这个问题之所以重要,有以下几个原因。两个模型表示之间的简单变换,可以使预训练组件更容易地与其他模型复用,催生一个更具模块化的基于嵌入的工具和流水线生态系统,并支持拼接场景,即在一个模型上训练的分类头可以复用另一个模型翻译后的特征[2 (https://arxiv.org/html/2608.05980#bib.bib2),4 (https://arxiv.org/html/2608.05980#bib.bib4)]。它还探究了独立训练的系统是否共享几何组织[10 (https://arxiv.org/html/2608.05980#bib.bib9),11 (https://arxiv.org/html/2608.05980#bib.bib11)],并使人们更容易解释模型如何表示概念和关系。此外,我们的目标应用之一是超越自然语言的智能体间通信,因此理解变换的边界对于长期方向至关重要:AI 智能体通过潜在空间而不是解码文本来交流,以避免将连续状态投影为离散标记造成的信息损失[25 (https://arxiv.org/html/2608.05980#bib.bib25),6 (https://arxiv.org/html/2608.05980#bib.bib6),24 (https://arxiv.org/html/2608.05980#bib.bib24)]。本研究旨在刻画简单变换在哪些情况下有效、在哪些情况下失效,从而挑战文献中经常宣称的潜在空间通用兼容性这一观点[9 (https://arxiv.org/html/2608.05980#bib.bib10),14 (https://arxiv.org/html/2608.05980#bib.bib14),5 (https://arxiv.org/html/2608.05980#bib.bib5),22 (https://arxiv.org/html/2608.05980#bib.bib22),19 (https://arxiv.org/html/2608.05980#bib.bib19),12 (https://arxiv.org/html/2608.05980#bib.bib12),16 (https://arxiv.org/html/2608.05980#bib.bib15),8 (https://arxiv.org/html/2608.05980#bib.bib8)]。

在本工作中,我们首先评估一个受限框架,该框架具有闭式解和强可解释性:基于小型锚点集的直接线性映射[16 (https://arxiv.org/html/2608.05980#bib.bib15)]、相对表示[19 (https://arxiv.org/html/2608.05980#bib.bib19)]和逆相对投影[15 (https://arxiv.org/html/2608.05980#bib.bib16)]。这些方法不仅声称存在某种共享结构,还声称基于锚点的简单对齐就足以恢复这种结构。随后,我们在更大的配对语料上训练一个更灵活的线性映射,将其作为在有更多监督条件下线性变换所能达到的经验近似上界[12 (https://arxiv.org/html/2608.05980#bib.bib12)]。

我们的研究在多个方面推进了以往工作:评估了一个在维度、分词器、池化方式、归一化、架构和训练目标上各不相同的异构模型集合;并结合了互补的诊断指标——CKA、下游迁移、保真度和检索,而不是依赖单一指标。

#### 贡献。

- • 对不同文本嵌入模型上的简单变换方法进行了系统性实证研究。
- • 涵盖几何相似性、检索和下游迁移的多诊断评估,超越了 MNIST 或 CIFAR 等简单基准上的分类模型。
- • 证据表明,简单变换是有用的,但高度依赖模型对,并且兼容性模式可以从架构和训练角度得到解释。

## 2 相关工作与变换方法

我们围绕所评估的两类简单变换来组织相关文献,并在提出这些方法的原始工作背景下定义每种方法。下文中,\(X\in\mathbb{R}^{d_{A}\times m}\) 和 \(Y\in\mathbb{R}^{d_{B}\times m}\) 表示列向量为 \(m\) 个输入在模型 \(A\) 和 \(B\) 中配对嵌入的矩阵。

#### 直接线性映射。

一系列长期研究已经表明,独立训练模型的表示可以在相当大的程度上通过无约束线性映射相互关联。Lenc 和 Vedaldi[14 (https://arxiv.org/html/2608.05980#bib.bib14)] 首先在图像模型中证明了这一点;Bansal 等人[2 (https://arxiv.org/html/2608.05980#bib.bib2)] 以模型拼接的形式重新审视了这一思想,将线性映射本身作为相似性探针。最近,Lähner 和 Moeller[12 (https://arxiv.org/html/2608.05980#bib.bib12)] 报告说,无约束线性变换优于等距变换;Gorbett 和 Jana[8 (https://arxiv.org/html/2608.05980#bib.bib8)] 以及 Chen 等人[4 (https://arxiv.org/html/2608.05980#bib.bib4)] 表明,仿射映射在很大程度上保留了大语言模型表示的下游性能。具体而言,给定配对嵌入,我们寻求 \(T\in\mathbb{R}^{d_{B}\times d_{A}}\) 以最小化 \(\|Y-TX\|_{F}^{2}\)。闭式最小二乘解

\(T^{*}=YX^{+}\),

我们称之为 *Linear (pinv)*,它只需要一组较小的配对锚点,并且是 Maiorca 等人[16 (https://arxiv.org/html/2608.05980#bib.bib15)] 形式化方法的基础。当有更多配对数据时,同样的目标可以通过在配对小批量上进行随机梯度下降来优化,我们称之为 *Linear (SGD)*[12 (https://arxiv.org/html/2608.05980#bib.bib12)],并将其作为无约束线性变换器所能达到的经验上界。

#### 基于锚点和相对表示的方法。

另一条互补的研究路线是,通过每个嵌入与共享锚点集的关系来重新表达嵌入。Moschella 等人[19 (https://arxiv.org/html/2608.05980#bib.bib19)] 引入了*相对表示*(RR),它将嵌入 \(x\) 替换为与同一模型中 \(m\) 个锚点 \(\{a_{1},\dots,a_{m}\}\) 的余弦相似度向量:

\(r(x)=\big[\,\cos(x,a_{1}),\;\cos(x,a_{2}),\;\dots,\;\cos(x,a_{m})\,\big]^{\top}\in\mathbb{R}^{m}\)。

这产生了一个坐标系统,其各个维度具有直接的语义含义(每个条目衡量与一个命名锚点概念的相似度),并且对潜在等距变换近似不变。这种不变性使得零样本拼接成为可能,但它要求下游头在相对表示上而不是在原生嵌入空间上训练,这缩小了该方法的适用范围。逆相对投影(IRP)[15 (https://arxiv.org/html/2608.05980#bib.bib16)] 通过学习从相对空间回到目标模型可用嵌入空间的映射,解除了这一限制;Cannistraci 等人[3 (https://arxiv.org/html/2608.05980#bib.bib3)] 进一步引入了乘积不变性以增强潜在通信。第4节 (https://arxiv.org/html/2608.05980#S4) 精确说明了 RR、IRP 和 *Linear (pinv)* 在何种意义上是同一基于锚点模板的变体。

#### 表示相似性与潜在通信。

除了变换器本身,另一支平行文献在不显式对齐的情况下量化两个表示空间有多相似。CKA[11 (https://arxiv.org/html/2608.05980#bib.bib11)] 及相关度量[5 (https://arxiv.org/html/2608.05980#bib.bib5)] 衡量模型间的几何对齐程度;柏拉图式表示假说[10 (https://arxiv.org/html/2608.05980#bib.bib9)] 推测这种相似性会随着模型规模增大而增强。近期关于潜在智能体通信的工作[25 (https://arxiv.org/html/2608.05980#bib.bib25),6 (https://arxiv.org/html/2608.05980#bib.bib6),24 (https://arxiv.org/html/2608.05980#bib.bib24)] 将跨模型变换视为实现高效 AI 到 AI 接口的基础,这也是本研究的长期应用背景。

## 3 实验设置

我们评估了九个文本嵌入模型,涵盖纯编码器、T5 风格编码器以及一个因果主干模型(表1 (https://arxiv.org/html/2608.05980#S3.T1)),在维度、分词器、池化方式、归一化和训练目标上刻意保持多样性。

表 1:研究中包含的嵌入模型。
| 模型名称 | 维度 | 分词器 | 架构 | 池化方式 | 默认归一化 | 最大长度 |
|---|---|---|---|---|---|---|
| Qwen3-Embedding-4B | 2560 | Qwen2TokenizerFast | Qwen3ForCausalLM | 最后一个 token | 是 | 40960 |
| e5-large-v2 | 1024 | BertTokenizerFast | BertModel | 平均 token | 是 | 512 |
| mxbai-embed-large-v1 | 1024 | BertTokenizerFast | BertModel | cls token | 否 | 512 |
| all-roberta-large-v1 | 1024 | RobertaTokenizerFast | RobertaForMaskedLM | 平均 token | 是 | 256 |
| bge-m3 | 1024 | XLMRobertaTokenizerFast | XLMRobertaModel | cls token | 是 | 8192 |
| gtr-t5-large | 768 | T5TokenizerFast | T5EncoderModel | 平均 token | 是 | 512 |
| instructor-xl | 768 | T5TokenizerFast | T5EncoderModel | 平均 token | 是 | 512 |
| all-mpnet-base-v2 | 768 | MPNetTokenizerFast | MPNetForMaskedLM | 平均 token | 是 | 384 |
| nomic-embed-text-v1.5 | 768 | BertTokenizerFast | NomicBertModel | 平均 token | 否 | 8192 |

在数据方面,对于基于锚点的方法,我们使用 Basic English 850 词表,它紧凑、可人工检查且语义覆盖面广,这也体现了利用人类专业知识选择锚点的动机。我们还使用了来自 Wikitext-103 的 850 个句子,这些句子是通过计算与其他句子(按所有模型的平均余弦相似度衡量)距离最远的句子来选取的。我们发现两者在性能上没有一致的差异,更精细的锚点选择也没有带来显著增益,因此我们保持流程简单。不过,我们承认可能没有像原始论文作者[19 (https://arxiv.org/html/2608.05980#bib.bib19),16 (https://arxiv.org/html/2608.05980#bib.bib15),15 (https://arxiv.org/html/2608.05980#bib.bib16)]那样把这个环节做到极致。但本研究的重点不是锚点选择,而是展示任意一对模型的嵌入之间是否存在通用变换。对于 *Linear (SGD)*,我们使用 Wikitext-103 句子对为每个模型对训练线性映射。这可以看作线性映射能够达到的经验近似上界,并弥补了基于锚点方法在锚点选择环节上未做进一步优化的不足。

评估使用四种诊断方式:(1) CKA 用于几何相似性,(2) 下游分类迁移,(3) 表示保真度(保留词上的余弦相似度和归一化误差范数),(4) \(k\)-NN 检索。下游基准包括 SST-2、AG News、emotion、CoLA、DBpedia、IMDB、MRPC 和 QQP[20 (https://arxiv.org/html/2608.05980#bib.bib20),7 (https://arxiv.org/html/2608.05980#bib.bib7)],使用固定 RBF 核 SVM 进行评估。超参数调优和以最大化每任务性能为目标的模型选择不是本工作的重点,因此保持在最低限度。我们是在受控接口下比较变换器,而不是追求每个模型的最高分数。

## 4 局部语义线性结构

在评估跨模型迁移之前,有必要回顾一下为什么线性变换器是一个合理的出发点。人们早就观察到,词嵌入将某些语义关系编码为近似线性的方向:Mikolov 等人[17 (https://arxiv.org/html/2608.05980#bib.bib18),18 (https://arxiv.org/html/2608.05980#bib.bib17)] 的经典 king–queen–man–woman 平行四边形、Lample 等人[13 (https://arxiv.org/html/2608.05980#bib.bib13)] 的双语词典归纳,以及 Allen 和 Hospedales[1 (https://arxiv.org/html/2608.05980#bib.bib1)] 的正式阐释,都基于同一个前提:意义在局部上是由少量参考点的线性组合构成的。我们在九个异构文本编码器上复现了它们那种类比式重构,观察到这一性质确实成立:即使精确系数取决于每个模型的归一化和尺度,分解的符号模式和粗略权重在不同架构间仍然保持稳定。我们将实证分析推迟到附录A (https://arxiv.org/html/2608.05980#A1),在本节其余部分则明确说明为什么这一性质正是使基于锚点的线性变换得以良好定义的几何前提。

设 \(X\in\mathbb{R}^{d_{A}\times m}\) 和 \(Y\in\mathbb{R}^{d_{B}\times m}\) 分别收集 \(m\) 个共享锚点在模型 \(A\) 和 \(B\) 中的嵌入。将源向量 \(x\in\mathbb{R}^{d_{A}}\) 重建为源侧锚点的最小二乘组合,得到系数

\(c^{*}(x)=\arg\min_{c\in\mathbb{R}^{m}}\;\|x-Xc\|_{2}^{2}=X^{+}x\),

这不过是上述类比系数的多锚点推广:king \(\approx\alpha\) queen \(+\beta\) man \(+\gamma\) woman 就是用三个锚点代替 \(m\) 个锚点写出的同一方程。在假设局部线性几何得以保留的前提下,将这些系数迁移到目标侧,得到

\(\hat{y}=Y\,c^{*}(x)=YX^{+}x=T_{A\rightarrow B}\,x,\qquad T_{A\rightarrow B}=YX^{+}\),

这正是 Maiorca 等人[16 (https://arxiv.org/html/2608.05980#bib.bib15)] 的闭式 *Linear (pinv)* 估计器。因此,通过共享锚点进行的基于系数的变换与直接伪逆对齐并不是两种不同的算法,而是同一操作的两种读法:一种将源点表示为锚点基,另一种在目标侧应用相同的表示。

由此产生两个推论。第一,*Linear (pinv)* 只有在锚点基分解 \(c^{*}(x)\) 从 \(A\) 跨到 \(B\) 时近似保持时才可能成功,这正是类比实验所检验的性质,也是当基增大或两个模型在归一化上存在差异时越来越脆弱的那种性质(附录A (https://arxiv.org/html/2608.05980#A1))。第二,我们评估的其他基于锚点的方法都是同一主题的变体。相对表示[19 (https://arxiv.org/html/2608.05980#bib.bib19)] 将仿射系数 \(X^{+}x\) 替换为与锚点的余弦相似度向量,用对潜在等距变换的不变性换取重建保真度;逆相对投影[15 (https://arxiv.org/html/2608.05980#bib.bib16)] 则学习与之相应的映射,从而回到目标嵌入空间。

相似文章

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

我的嵌入表示是否反映了 $A = B$?评估嵌入模型中的数学等价性

arXiv cs.CL

本文介绍了MELD数据集,用于评估文本嵌入模型是否能够捕捉不同术语之间的数学等价性,并发现当前模型无法做到。本文提出了一种对比学习方法,用于对齐非正式和正式的数学表述,从而在非正式-正式检索任务以及自然语言任务上均取得改进。

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。