跨语言事实一致性的潜在空间干预:一致性提升而无精度下降
摘要
本文提出了一种潜在空间干预方法,用于改善大型语言模型中的跨语言事实一致性,在不损失事实精度的情况下实现更好的对齐。
arXiv:2608.28860v1 Announce Type: new
摘要: 大型语言模型(LLMs)在不同语言中对同一事实问题的回答往往不一致。我们研究跨语言潜在空间干预是否可以减少这种不一致性。我们在平行多语言表示上训练特定层的自编码器,并对事实问答提示应用推理时校正。我们发现潜在干预改善了语言间的几何对齐,且这一改进转化为在开放性和多项选择问答格式中与英语跨语言一致性的持续提升,同时不降低事实精度。在开放式问答中,英语与非英语语言间的斯皮尔曼等级相关显著提高,英语-阿拉伯语对提升0.16,英语-俄语对提升0.20。在多项选择问答中,与英语的答案一致性在KLAR和mParaRel上均持续改善。消融研究表明,AE重建以零精度代价带来一致增益,PCA投影贡献有限,而均值偏移在开放式问答中以部分精度为代价产生显著更大的一致性增益。
查看缓存全文
缓存时间: 2026/09/01 12:07
# 面向跨语言事实一致性的潜在空间干预:无精度损失的一致性提升 来源:https://arxiv.org/html/2608.28860 Faeze Ghorbanpour 所属机构:慕尼黑工业大学计算、信息与技术学院 所属机构:慕尼黑机器学习中心(MCML) [email protected], [email protected] Alexander Fraser 所属机构:慕尼黑工业大学计算、信息与技术学院 所属机构:慕尼黑机器学习中心(MCML) [email protected], [email protected] Anders Søgaard 所属机构:哥本哈根大学计算机科学系 ###### 摘要 大型语言模型(LLMs)在回答同一事实性问题时,常在不同语言间给出不同答案。我们研究跨语言潜在空间干预能否减少这种不一致性。我们在平行的多语言表示上训练特定层的自编码器,并对事实性问答提示应用推理时校正。研究发现,潜在干预改善了语言间的几何对齐,且这种改善转化为在开放式与多项选择问答格式中,相对于英语的跨语言一致性持续提升,且不损害事实准确性。在开放式问答中,英语与非英语语言间的斯皮尔曼等级相关性显著提升,英语-阿拉伯语对提升0.16,英语-俄语对提升0.20。在多项选择问答中,与英语的答案一致性在KLAR和mParaRel数据集上均持续改善。消融研究表明,自编码器重构能带来无精度成本的稳定增益,主成分分析投影贡献较小,而均值偏移在开放式问答中能带来大幅一致性增益,但会损失部分精度。111 代码已发布于 github.com/LatentInterventionCrosslingualFactuality (https://github.com/FaezeGhorbanpour/LatentInterventionCrosslingualFactuality)。 ## 1 引言 多语言语言模型(MLMs)在许多跨语言任务上表现出色(Zhu et al., 2024 (https://arxiv.org/html/2608.28860#bib.bib36)),但事实知识检索在不同语言间仍不均衡(Jiang et al., 2020 (https://arxiv.org/html/2608.28860#bib.bib17); Qi et al., 2023 (https://arxiv.org/html/2608.28860#bib.bib25); Xing et al., 2024 (https://arxiv.org/html/2608.28860#bib.bib31))。与许多句法或语义任务不同,事实回忆与预训练数据中事实的分布密切相关(Liu et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib22)):频繁出现的事实更可能被直接回忆,而低频事实则常依赖跨语言迁移(Chang et al., 2024 (https://arxiv.org/html/2608.28860#bib.bib4))。由于预训练语料在各语言间高度不平衡,同一事实可能在一种语言中充分呈现,而在另一种语言中罕见或缺失(Xu et al., 2023 (https://arxiv.org/html/2608.28860#bib.bib32))。因此,事实知识在不同语言间的可及性可能不均(Aggarwal et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib1); Goldman et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib12))。这导致了跨语言事实不一致:模型可能在一种语言中正确回答事实查询,却在另一种语言中失败或给出不同答案(Qi et al., 2023 (https://arxiv.org/html/2608.28860#bib.bib25); Lu et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib23); Fierro et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib9))。 越来越多的研究表明,部分困难源于表示层面(Ifergan et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib16); Lim et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib21); Wang et al., 2025a (https://arxiv.org/html/2608.28860#bib.bib28))。MLMs将事实查询编码在可能将事实内容与语言特定表层形式纠缠的表示中。当这些因素未被清晰分离时,同一底层事实可能根据查询语言的不同,占据模型隐藏空间的不同区域(Libovický et al., 2020 (https://arxiv.org/html/2608.28860#bib.bib20); Zhao et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib35))。近期的机制分析支持这一观点:事实知识似乎表现在相对语言无关的中间层空间,而失败可能发生在向后期语言特定表示过渡时(Wang et al., 2025a (https://arxiv.org/html/2608.28860#bib.bib28))。其他工作进一步表明,跨语言的语义等价事实可以激活重叠的语言无关事实神经元集合,尽管对这些共享机制的访问在不同语言间并不均匀(Cao et al., 2026 (https://arxiv.org/html/2608.28860#bib.bib3); Zhang et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib34))。 这引发了一个自然的问题:我们能否构建一个事实内容在不同语言间更具可比性的表示空间,并利用它来检验更强的对齐是否能改善事实一致性?这样的空间将有两个目的。首先,它将提供事实表示的诊断视图,减少语言特定的变异。其次,它将提供一个干预点,用于应用轻量级推理时校正,无需重新训练模型或依赖语言特定的事实监督。 我们提出,一个基于平行多语言文本训练的跨语言自编码器潜在空间正好提供了这一空间。通过将LLM表示映射到一个紧凑的共享潜在空间,在该空间中不同语言的相同内容被对齐,我们获得了模型内部表示的语言无关视角(Peng et al., 2025 (https://arxiv.org/html/2608.28860#bib.bib24))。在此空间内,我们识别出一个事实不一致子空间,它代表相同事实跨语言最大分歧的方向,并通过前向钩子应用轻量级推理时校正,而不修改模型权重。换句话说,我们通过主成分分析投影去除跨语言的潜在不一致子空间。我们在KLAR(Wang et al., 2025a (https://arxiv.org/html/2608.28860#bib.bib28))和mParaRel(Fierro and Søgaard, 2022 (https://arxiv.org/html/2608.28860#bib.bib10))数据集上,评估了类型学多样化的语言在多项选择和开放式事实问答格式中的表现。我们的研究结果表明,潜在空间干预提升了跨语言表示对齐和答案一致性,且没有带来性能损失。 贡献:(1) 我们展示了基于自编码器的潜在空间干预能持续改善跨语言表示对齐,在类型学距离较远的语言和中后期层中增益更大。(2) 我们展示了这种对齐改善转化为更高的语义一致性,当投影去除语义不一致发生的维度时。问答准确性在很大程度上不受此干预的影响。 ## 2 相关工作 多项工作在不重新训练的情况下纠正跨语言差距。Wang et al. (2025b) (https://arxiv.org/html/2608.28860#bib.bib29)学习语言表示间的对齐矩阵,Kirtane and Huang (2026) (https://arxiv.org/html/2608.28860#bib.bib19)通过前向钩子应用转向向量用于多语言上下文学习。大量研究表明共享潜在空间能改善跨语言迁移(Conneau et al., 2020 (https://arxiv.org/html/2608.28860#bib.bib6); Chi et al., 2021 (https://arxiv.org/html/2608.28860#bib.bib5))。更直接地,Xu et al. (2023) (https://arxiv.org/html/2608.28860#bib.bib32)提出了无参数投影模块,将非英语表示转换为类英语等价物以改进事实知识检索,但假设英语为固定枢轴。我们的方法无需权重修改,也无需枢轴语言假设。 由于预训练数据不平衡,MLMs中的事实知识在不同语言间分布不均(Jiang et al., 2020 (https://arxiv.org/html/2608.28860#bib.bib17); Kassner et al., 2021 (https://arxiv.org/html/2608.28860#bib.bib18)),即使对于同一事实的转述,模型在不同语言间仍保持不一致(Fierro and Søgaard, 2022 (https://arxiv.org/html/2608.28860#bib.bib10))。Wang et al. (2025a) (https://arxiv.org/html/2608.28860#bib.bib28)提供了一个机制性解释:MLMs在大多数层中通过语言无关的概念空间编码事实,但在向语言特定表示的最终过渡时失败,导致不一致的预测。Lim et al. (2025) (https://arxiv.org/html/2608.28860#bib.bib21)和Tezuka and Inoue (2025) (https://arxiv.org/html/2608.28860#bib.bib27)通过激活和潜在过程分析进一步证实了这一点。这些工作是诊断性的;我们基于它们的基准和指标来评估一种缓解方法。 ## 3 我们的方法 给定一个多语言语言模型M\mathcal{M}和一组事实关系R\mathcal{R},我们考虑一组事实F=\{(s,r,o)\}\mathcal{F}=\{(s,r,o)\},其中s是主体,r∈Rr\in\mathcal{R}是关系,o是正确客体。每条事实以提示形式在一组语言L=\{l1,...,ln\}\mathcal{L}=\{l_{1},\ldots,l_{n}\}中表达,产生语言特定提示\{xl\}l∈L\{x^{l}\}_{l\in\mathcal{L}},它们在不同语言中询问相同的事实问题。我们定义M\mathcal{M}在事实(s,r,o)上**跨语言不一致**,如果它对于同一事实在不同语言间预测出不同的答案选择,即对于某些li,lj∈Ll_{i},l_{j}\in\mathcal{L},有y^li≠y^lj\hat{y}^{l_{i}}\neq\hat{y}^{l_{j}},其中y^l\hat{y}^{l}表示模型对语言l中提示的预测选择。我们的目标是构建一个跨语言潜在空间,在该空间中可以在不修改模型权重的情况下,在推理时测量和缓解不一致性。 ### 跨语言潜在空间 一个关键挑战是LLM表示将事实内容与语言特定表面信号混合在一起。因此,在LLM的原生空间中直接比较或操纵不同语言的表示是嘈杂的。遵循Peng et al. (2025) (https://arxiv.org/html/2608.28860#bib.bib24),我们通过将LLM表示映射到一个紧凑的跨语言潜在空间来解决这个问题,在该空间中不同语言的相同内容被更紧密地对齐。 具体来说,我们分两个阶段训练自编码器(AE)。首先,我们联合优化共享的编码器和解码器。给定语言l1l_{1}和l2l_{2}中语义等价句子的LLM隐藏状态的平行对(hl1,hl2)(h^{l_{1}},h^{l_{2}}),其潜在表示zli=enc(hli)z^{l_{i}}=\text{enc}(h^{l_{i}})和重构h^li=dec(zli)\hat{h}^{l_{i}}=\text{dec}(z^{l_{i}}),训练目标为: L=ζLself+βLalign+ηLvar+ρLcov\mathcal{L}=\zeta\,\mathcal{L}_{\text{self}}+\beta\,\mathcal{L}_{\text{align}}+\eta\,\mathcal{L}_{\text{var}}+\rho\,\mathcal{L}_{\text{cov}} (1) 其中自重构损失 Lself=l(h^l1,hl1)+l(h^l2,hl2)\mathcal{L}_{\text{self}}=\ell(\hat{h}^{l_{1}},h^{l_{1}})+\ell(\hat{h}^{l_{2}},h^{l_{2}}) (2) 鼓励每种语言内的忠实重构。对齐损失 Lalign=MSE(z~l1,z~l2),z~li=zli‖zli‖\mathcal{L}_{\text{align}}=\text{MSE}(\tilde{z}^{l_{1}},\tilde{z}^{l_{2}}),\quad \tilde{z}^{l_{i}}=\frac{z^{l_{i}}}{\|z^{l_{i}}\|} (3) 直接最小化平行对潜在表示间的归一化距离。方差损失 Lvar=∑jReLU(γ−Stdj(Z))\mathcal{L}_{\text{var}}=\sum_{j}\text{ReLU}\!\left(\gamma-\text{Std}_{j}(Z)\right) (4) 通过惩罚标准差低于阈值γ\gamma的维度来防止维度坍缩。协方差损失 Lcov=1k∑i≠j[Cov(Z)]ij2\mathcal{L}_{\text{cov}}=\frac{1}{k}\sum_{i\neq j}\left[\text{Cov}(Z)\right]^{2}_{ij} (5) 通过惩罚潜在协方差矩阵的非对角线元素来减少冗余。我们使用Huber损失(Huber, 1992 (https://arxiv.org/html/2608.28860#bib.bib15))作为l\ell。消融自重构和对齐项证实了每一项的必要性:移除自重构会导致潜在空间坍缩,而移除对齐则显著削弱跨语言检索(附录G (https://arxiv.org/html/2608.28860#A7))。 在第二阶段,我们冻结共享编码器,并独立训练每种语言的特定解码器{decl}l∈L\{\text{dec}_{l}\}_{l\in\mathcal{L}},为每种语言l最小化l(decl(zl),hl)\ell(\text{dec}_{l}(z^{l}),h^{l})。这允许每个解码器专注于从共享的语言无关潜在空间重构其目标语言的表示,同时保留第一阶段学习到的跨语言对齐。联合训练编码器和特定语言解码器会降低每个干预层的一致性和准确性,证实了两阶段划分的必要性(附录I (https://arxiv.org/html/2608.28860#A9))。 ### 推理时校正 在推理时,我们在选定的Transformer层上注册一个前向钩子。当模型处理提示时,钩子拦截隐藏状态X∈RB×T×d\mathbf{X}\in\mathbb{R}^{B\times T\times d},计算均值池化的句子表示h=1T∑t=1Txt∈Rd\mathbf{h}=\frac{1}{T}\sum_{t=1}^{T}\mathbf{x}_{t}\in\mathbb{R}^{d},并通过AE编码器将其映射到潜在空间:z=enc(h)\mathbf{z}=\text{enc}(\mathbf{h})。我们在潜在空间中探索三种校正策略。 **AE**变体不进行校正;它只是编码和解码表示而不做修改,作为基线,用于区分AE瓶颈本身的影响与任何显式校正:z~=z\tilde{\mathbf{z}}=\mathbf{z}。**投影**变体通过对跨语言差异向量进行主成分分析(PCA)识别一个不一致子空间,并将其投影去除: z~l=zl−∑j=1m(zl⋅dj)dj\tilde{\mathbf{z}}^{l}=\mathbf{z}^{l}-\sum_{j=1}^{m}(\mathbf{z}^{l}\cdot\mathbf{d}_{j})\,\mathbf{d}_{j} (6) 其中d1,...,dm\mathbf{d}_{1},\ldots,\mathbf{d}_{m}是不一致子空间的前m个主成分。 **均值偏移**变体将每种语言的表示拉向跨语言均值,不假设任何枢轴语言: z~l=zl+λ(z ̄−z ̄l)\tilde{\mathbf{z}}^{l}=\mathbf{z}^{l}+\lambda\left(\bar{\mathbf{z}}-\bar{\mathbf{z}}^{l}\right) (7) 其中z ̄l=1N∑i=1Nzil\bar{\mathbf{z}}^{l}=\frac{1}{N}\sum_{i=1}^{N}\mathbf{z}^{l}_{i}是语言l在所有评估集中的N个事实上的平均表示,z ̄=1|L|∑l∈Lz ̄l\bar{\mathbf{z}}=\frac{1}{|\mathcal{L}|}\sum_{l\in\mathcal{L}}\bar{\mathbf{z}}^{l}是所有语言的平均值。 在所有三种情况下,校正后的潜在向量z~\tilde{\mathbf{z}}通过特定语言解码器dec_l(z~)\text{dec}_{l}(\tilde{\mathbf{z}})解码回LLM表示空间,并将解码表示与原始均值池化隐藏状态的差值作为残差添加到所有token位置: xt′=xt+(dec_l(z~)−h),∀t∈{1,...,T}\mathbf{x}'_{t} = \mathbf{x}_{t} + \left( \text{dec}_{l}(\tilde{\mathbf{z}}) - \mathbf{h} \right), \quad \forall t \in \{1,\dots,T\} (8)
相似文章
通过一致性驱动的强化学习提升跨语言事实召回
本文介绍了PolyFact,一个大规模多语言事实问答数据集,并展示了通过GRPO的强化学习相比监督微调能显著提升LLM的跨语言事实一致性,通过重组多语言表示。
跨语言共识:通过多语言自一致性对齐多语言文化知识
本文提出一个自监督框架,利用多语言自一致性和自我批评机制在不同语言间迁移文化知识,通过从本地语言表征中揭示潜在文化知识,在BLEnD基准测试的英语查询中平均提升5.03%。
中间语假设:LLMs 通过潜在与任务无关的特征空间进行翻译
该论文提出了中间语假设,认为大型语言模型通过将源文本编码到一个潜在与任务无关的特征空间中并从该空间解码来执行翻译,有经验证据支持其在方差、因果影响和单语微调方面的表现。
跨语言探索参数化知识
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。
推理大语言模型中的隐藏语言一致性现象
本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。