跨语言引导的比喻语言生成
摘要
本文探讨了多语言大语言模型中内部表示的跨语言迁移,用于比喻语言生成,表明在一种语言中学习到的激活方向可以有效引导其他语言的生成。
arXiv:2605.30443v1 Announce Type: new
摘要:多语言大语言模型能够生成比喻语言,但驱动这一行为的内部信号是语言特定的还是跨语言可重用的尚不清楚。使用激活引导作为探针,我们从一种语言的比喻-字面激活差异中估计比喻类别的方向,并在生成过程中应用。在五个比喻类别、六种语言和四个多语言大语言模型中,这些方向在其语言内可靠地引导,对于隐喻和明喻最为稳健。更重要的是,它们跨语言迁移:在一种语言中学习到的方向在应用于另一种语言时增加了目标行为,其中德语是最易接受的目标之一。进一步地,从其他语言组合的方向可以匹配甚至超越目标语言自身的原生方向,而移除这一共享组件会削弱原生引导。这些结果共同提供了可重用但依赖于目标的跨语言信号用于比喻生成的直接证据。
查看缓存全文
缓存时间: 2026/06/01 09:23
# 面向修辞性语言生成的跨语言引导
来源: https://arxiv.org/html/2605.30443
林峰刘¹
蒂芙尼詹²
刘鸿耀³
萨普塔希高希¹
田宇江¹
¹辛辛那提大学计算机科学系
²卡内基梅隆大学计算机科学学院
³独立研究者
{liu2lf,ghosh2si}@mail.uc.edu, [email protected], [email protected], [email protected]
###### 摘要
多语言大语言模型能够生成修辞性语言,但驱动这一行为的内部信号是语言特有的还是可跨语言复用的,目前尚不清楚。我们使用激活引导作为一种探测方法,从一种语言中修辞-字面激活差异中估计某个修辞类别的方向,并在生成过程中应用它。在五种修辞类别、六种语言和四种多语言大语言模型中,这些方向在其自身语言内能够可靠地引导,其中在隐喻和明喻上效果最为稳健。更重要的是,它们能够跨语言迁移:在一种语言中学习到的方向应用到另一种语言时,能够增加目标行为,其中德语是最容易接受的目标语言之一。更进一步,由其他语言组合而成的方向可以匹配甚至超越目标语言自身的本地方向,而移除此共享成分则会削弱本地引导。这些结果共同提供了直接证据,表明存在一种可复用但依赖于目标的跨语言信号,用于修辞性生成。
跨语言修辞性语言引导
林峰刘¹
蒂芙尼詹²
刘鸿耀³
萨普塔希高希¹
田宇江¹
¹辛辛那提大学计算机科学系
²卡内基梅隆大学计算机科学学院
³独立研究者
{liu2lf,ghosh2si}@mail.uc.edu, [email protected], [email protected], [email protected]
## 1 引言
图1: 跨语言引导测试概览。从中文修辞-字面示例构建的隐喻方向,在处理英文字面提示时被应用。该干预测试源语言引导信号是否能够增加不同目标语言中的隐喻生成。
多语言大语言模型能够用多种语言产生修辞性表达。然而,目前仍不清楚支持这种生成的内部信号主要是语言特有的,还是存在一些行为上有用的成分可以在语言间复用。这种区分对于理解多语言生成除了表面词汇和句法之外还共享什么至关重要。修辞性语言提供了一个特别有信息量的测试案例。某些类别,如隐喻和明喻,通常依赖于可能在语言间合理重复出现的语义关系。其他类别,如习语、反讽和讽刺,则更多地依赖于文化情境语用或话语上下文。因此,引导效果上的跨语言差异不仅可以揭示可复用信号是否存在,还可以揭示哪些类型的修辞行为在语言间最具可移植性。
虽然先前的工作已经探索了多语言任务中的跨语言对齐(Zhang等人,2025;Wang等人,2025),但用于细粒度修辞性生成的内部方向是否能够在语言间转移,仍然未得到充分探索。我们使用激活引导(Turner等人,2024;Rimsky等人,2024)作为一种基于干预的探测方法来研究这一问题。如图1所示,我们从一个源语言(例如中文)的修辞-字面激活差异中估计一个引导方向,并在模型处理相同语言或不同目标语言(例如英文)的字面提示时应用它,无需重新训练或源-目标特定调优。如果在一种语言中估计的方向能够增加另一种语言中目标类别的生成,这便提供了行为证据,表明源语言对比中包含的信号可以超越其原始语言使用。
我们跨五种修辞类别(习语、隐喻、明喻、反讽和讽刺)、六种语言(英语、中文、孟加拉语、西班牙语、意大利语和德语)以及四种多语言大语言模型来评估这个问题。我们的分析分三个阶段进行,以评估修辞性语言表征的跨语言可移植性。首先,在单语言引导中,我们测试激活差异是否能在其所源自的语言内产生有效的引导方向。其次,在零样本跨语言迁移中,我们将源语言引导向量应用于目标语言提示,以确定修辞性表征是否在语言间共享。最后,通过几何干预,我们组合和消融来自多种语言的向量,以刻画其可迁移性背后的结构。通过这些分析,我们做出三项主要贡献:
- **有效的单语言引导。** 在单语言实验中,引导向量持续增加目标修辞行为,在96个设置中的74个中显著优于随机向量控制和未引导基线。
- **零样本跨语言可移植性。** 源语言向量成功引导了416个零样本设置中的369个的目标语言生成,并且在多个案例中匹配或超越了直接源自目标语言的向量。
- **共享的迁移几何基础。** 多语言聚合向量系统地与本地语言引导相抗衡,而消融共享子空间则急剧减少修辞生成,表明可迁移引导依赖于一个共同的表征成分。
综合来看,这些发现表明,修辞性生成在很大程度上受可复用的跨语言激活结构支配,这些结构可以通过表征引导来识别和操纵。¹¹¹我们的代码将在论文被接收后公开。
## 2 相关工作
**激活引导与表征工程。** 基于激活的干预在推理时操纵模型内部表征,而无需更新模型参数(Turner等人,2024;Zou等人,2025)。对比激活加法从正-负激活差异中构建引导方向,并在生成过程中应用(Rimsky等人,2024)。相关的推理时干预也被用于通过沿与真实相关的方向移动激活来改善真实性(Li等人,2023)。实证工作进一步研究了针对风格和行为属性的引导(Konen等人,2024;Sharma和Trivedi,2026),而综述文章系统化了表征工程方法及其安全相关应用(Bartoszcze等人,2025)。我们将这一工作线扩展,研究细粒度的修辞性语言生成及其跨语言迁移。
**多语言对齐与迁移。** 跨语言对齐长期以来一直被研究作为多语言表征中迁移的基础(Ruder等人,2019;Hämmerl等人,2024)。具体针对多语言大语言模型,Wang等人(2024)探究了对齐在预训练期间如何出现,并将跨语言神经元重叠与零样本迁移性能联系起来。跨语言上下文学习也已被行为性地研究过(Tanwar等人,2023),而多语言基准则评估生成模型在不同语言和任务上的能力(Ahuja等人,2023)。与我们干预设置更直接相关的是,Maraia等人(2026)测试了用于三段论推理的跨语言激活引导,Gurgurov等人(2026)引入了一个多语言语言引导基准。Bandarkar等人(2026)的补充工作使用跨语言不一致性用于混合专家模型中的因果知识定位,而非用于引导向量迁移。
表1: 用于生成的句子续写指令。在每个模板中,`{sent}`被替换为同一语言的输入句子。
**NLP中的修辞性语言。** 先前工作包括修辞性语言生成的综述(Lai和Nissim,2024)、讽刺检测(Chen等人,2024),以及基于NLI的修辞性解释评估(Stowe等人,2022)。FLUTE提供了一个基于解释的修辞性语言理解基准(Chakrabarty等人,2022),而FLUID QA评估多语言修辞性语言的使用(Park等人,2025)。已有的模型分析和识别方法研究了修辞性语言分类和明喻识别(Liu等人,2018;Jang等人,2023)。我们的工作研究的是从内部表征估计的修辞性生成方向是否能够跨语言迁移。
## 3 实验设置与方法论
我们的实验测试了一种语言中估计的类别相关方向是否能够在相同或不同语言中引导修辞性生成。
**模型、语言和类别。** 我们使用四种多语言模型(Qwen3-8B、Qwen3-32B(Yang等人,2025)、Llama-3.1-8B-Instruct(Grattafiori等人,2024)和Ministral-3-8B-Instruct(Liu等人,2026))进行实验,涵盖五种修辞类别(习语、隐喻、明喻、反讽和讽刺)和六种语言(英语、中文、孟加拉语、西班牙语、意大利语和德语)。评估的语言-类别设置由公开数据可用性决定;例如,明喻仅在英语和中文中评估。
**数据划分与任务公式。** 我们将用于向量构建、层验证和最终测试的数据分开(详见附录A)。向量构建依赖于每种设置下平衡的集合,最多包含500个修辞示例和500个单语言字面句子(例如,COCO标题(Lin等人,2014))。对于生成,我们使用目标语言中的句子续写指令(表1)。关键在于,提示从未要求使用修辞手法;因此,目标类别率的任何增加完全由我们的干预引起。最终的行为评估在一组每个目标语言有500个字面提示的保留集上进行。
**引导向量提取与应用。** 我们使用对比激活加法来估计引导方向(Rimsky等人,2024)。对于给定语言g和类别c,令D⁺_{g,c}包含修辞示例,D⁻_{g}包含字面标题。在选定层l上,均值差方向为:
v̂^{(l)}_{g,c} = (μ^{(l)}(D⁺_{g,c}) - μ^{(l)}(D⁻_{g})) / ||μ^{(l)}(D⁺_{g,c}) - μ^{(l)}(D⁻_{g})||₂ (1)
其中μ^{(l)}对每个集合在最后一个输入token位置的隐藏状态激活取平均值。在生成预填充阶段,我们在选定层l上对每个提示token位置t干预残差流:
h_t^{(l)'} = h_t^{(l)} + α v̂^{(l)}_{g,c} (2)
干预层l通过在一个独立的字面提示验证集上验证引导向量来确定(附录B.4),确保最终测试数据完全未见。对于所有单语言、跨语言、随机向量和几何向量实验,我们固定干预强度为α=1.0。我们将学习到的方向与在相同层、位置和幅度下应用的匹配随机向量控制进行比较(附录B.5)。
表2: DeepSeek-v4-flash在标注的修辞与字面示例上的分类性能。值为F1分数(百分比)。这些分数展示了LLM-as-judge在修辞语言识别上的能力。
**评估与统计分析。** 我们使用DeepSeek-v4-flash作为LLM-as-judge评估生成的续写(DeepSeek-AI,2026)。(法官在修辞语言识别能力上的验证F1分数见表2;相关提示见附录B.3)。我们报告两个主要指标:
1. **目标类别率(TCR):** 生成的续写中展现出目标修辞现象的比例。这是我们衡量行为变化的主要指标。
2. **连贯性:** 一个0–4的评分,评估生成续写的上下文相关性和逻辑一致性。
表3: 按输入语言汇总的单语言引导。值取可用类别平均值,以百分比形式呈现。阴影强度表示单语言引导与未引导配对检验的统计显著性(调整后q值):浅色q≥0.05,中色q<0.05,深色q<0.01,最深q<0.001。胜场数为单语言引导超过未引导基线的类别数。
我们将标准干预与未引导生成进行比较,并将几何干预与本地单语言引导进行比较。我们报告配对百分比差异,提供95% bootstrap置信区间和适用的调整后McNemar q值(附录B.2)。
## 4 单语言引导
为了确认我们干预的行为有效性,我们对每种语言的500个示例测试集进行单语言引导。这一步确保导出的向量编码了稳健、可操作的信号。表3报告了这些单语言干预的目标类别率(TCR)。在总共96个设置中,单语言引导在74个案例中显著提高了TCR超过未引导基线。全部细节见附录C。
**干预信号。** 单语言引导持续将TCR提升至超过未引导基线,但绝对性能揭示了高资源和低资源设置之间的差异。相似文章
跨语言探索参数化知识
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。
语言模型中跨语言泛化的体外研究
本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。
方言能否像语言一样被引导?阿拉伯语大语言模型中的稀疏神经元与分布式方向
本文研究了通过识别稀疏神经元群体和提取方言激活方向来引导阿拉伯语大语言模型生成特定方言的方法,从而在不进行微调的情况下实现推理时的方言控制。
多语言设计导向的调控:多语言稀疏自编码器与原则性层选择
本文介绍了一种基于原则的多语言语言调控方法,该方法使用在多语言数据上训练的稀疏自编码器(SAEs)以及一种基于多语言对齐与语言可分性交集的新型层选择规则,并在LLaMA-3.1-8B和Gemma-2-9B上针对机器翻译和跨语言摘要进行了评估。