想要更好的合成数据?引导它:用于低资源语言生成的激活引导
摘要
本文研究了激活引导作为替代少样本提示的方法,用于生成低资源语言的合成数据。作者提出了LanguageSteering和QualitySteering策略,表明在早期层进行引导可以提高数据多样性并改善下游模型性能。
查看缓存全文
缓存时间: 2026/06/18 05:44
# 想要更好的合成数据?引导它:面向低资源语言生成的激活引导技术
来源:https://arxiv.org/html/2606.18389
Jan Cegin♠, Daniil Gurgurov†, Yusser Al Ghussin†, Simon Ostermann†
♠Kempelen Institute of Intelligent Technologies, Bratislava, Slovakia jan\.cegin@kinit\.sk
†German Research Institute for Artificial Intelligence \(DFKI\), Saarbrücken, Germany \{daniil\.gurgurov, yusser\.al\_ghussin, simon\.ostermann\}@dfki\.de
###### 摘要
大型语言模型(LLM)已成为合成数据生成的有效工具,尤其是对于低资源语言,生成的数据能够提升下游任务性能。当前表现最佳的方法通常依赖于使用目标语言示例的少样本提示,这会增加推理成本,并可能因词汇锚定而降低多样性。在本工作中,我们研究将激活引导作为低资源合成数据生成的替代方案。我们探索两种引导策略:**LanguageSteering**(语言引导),针对语言的语言学身份;**QualitySteering**(质量引导),通过对比人工撰写文本与反向翻译文本的表征来捕捉文本的规范性。我们在四个开源LLM、多个层以及11种类型多样的语言上评估这些方法,生成情感分类和主题分类数据,并微调较小的分类器。引导在零样本和少样本提示设置中均被应用,并与非引导对照组进行比较。我们的结果表明,在早期层进行引导能够持续提升生成数据的多样性,同时往往带来更强的下游模型性能,尤其是针对低资源语言。
# 想要更好的合成数据?引导它:面向低资源语言生成的激活引导技术
Jan Cegin♠, Daniil Gurgurov†, Yusser Al Ghussin†, Simon Ostermann†
♠Kempelen Institute of Intelligent Technologies, Bratislava, Slovakiajan\.cegin@kinit\.sk
†German Research Institute for Artificial Intelligence \(DFKI\), Saarbrücken, Germany\{daniil\.gurgurov, yusser\.al\_ghussin, simon\.ostermann\}@dfki\.de
## 1 引言
随着LLM的出现,多项研究证明它们能够生成符合标签且形式规范的文本(Cegin等,2023(https://arxiv.org/html/2606.18389#bib.bib75);Ubani等,2023(https://arxiv.org/html/2606.18389#bib.bib47))。这两种能力使LLM成为数据增强和合成数据生成的理想工具,在情感分析(Onan,2023(https://arxiv.org/html/2606.18389#bib.bib60))、意图识别(Cegin等,2024a(https://arxiv.org/html/2606.18389#bib.bib49))和主题分类(Piedboeuf and Langlais,2023(https://arxiv.org/html/2606.18389#bib.bib61))等领域均有应用。对于合成数据生成,通常的工作流程是:提示LLM以特定语言生成一定数量的带有给定标签的样本。这些样本随后常被用于微调下游编码器模型。近期研究将这些方法扩展到低资源语言,通常能提升下游模型性能(Anikina等,2025(https://arxiv.org/html/2606.18389#bib.bib82);Pranida等,2025(https://arxiv.org/html/2606.18389#bib.bib68);Cegin等,2026(https://arxiv.org/html/2606.18389#bib.bib84)),而低资源语言中数据稀缺问题尤为突出(Joshi等,2020(https://arxiv.org/html/2606.18389#bib.bib23))。目前最强的结果通常来自使用目标语言示例的少样本提示(Anikina等,2025(https://arxiv.org/html/2606.18389#bib.bib82))。然而,这增加了推理成本,并可能因词汇锚定而降低多样性。
与此同时,关于表征工程或激活引导的研究表明,修改模型内部激活可以引导LLM行为朝向期望的语义或风格属性(Zou等,2023(https://arxiv.org/html/2606.18389#bib.bib19);Turner等,2024(https://arxiv.org/html/2606.18389#bib.bib20))。通过将引导向量注入隐藏状态,先前工作已经控制了真实性(Li等,2024(https://arxiv.org/html/2606.18389#bib.bib21))、情感(Rimsky等,2024(https://arxiv.org/html/2606.18389#bib.bib3))和毒性(Turner等,2024(https://arxiv.org/html/2606.18389#bib.bib20))等属性,而无需额外微调。与少样本提示相比,激活引导提供了一种高效的替代方案,可能更好地捕捉各种抽象属性(Ostermann等,2026(https://arxiv.org/html/2606.18389#bib.bib24))。此外,它可以与任何类型的提示(零样本或少样本)组合使用(Radevski等,2026(https://arxiv.org/html/2606.18389#bib.bib25))。

在本文中,我们研究用于低资源合成数据生成的激活引导。我们为11种类型多样的语言生成情感分类和主题分类任务的合成数据集,并通过下游微调性能进行评估。我们探索两种引导策略:**LanguageSteering**(语言引导),根据先前研究针对语言的语言学身份(Gurgurov等,2026(https://arxiv.org/html/2606.18389#bib.bib26),2025b(https://arxiv.org/html/2606.18389#bib.bib5);Ghussin等,2026a(https://arxiv.org/html/2606.18389#bib.bib7),b(https://arxiv.org/html/2606.18389#bib.bib6));**QualitySteering**(质量引导),通过对比人工撰写文本与反向翻译文本的表示来捕捉文本规范性。据我们所知,这是首个推导并使用Quality引导向量的工作。在四个开源LLM和多个层上,我们将这些引导向量应用于零样本和少样本提示(Anikina等,2025(https://arxiv.org/html/2606.18389#bib.bib82)),并分析生成数据在多样性和表征属性方面与无引导基线的差异。代码可在https://github.com/kinit-sk/steering-synth-gen获取。
我们的主要贡献如下:
- •首次将Language引导向量应用于合成数据生成,并引入并利用Quality引导向量——通过对比人工创作文本与反向翻译文本来获得。
- •我们分析了Quality和Language引导向量之间的余弦相似度,表明它们的对齐高度依赖于LLM,且在较早层中极性最强。关键的是,大多数评估语言表现出强烈的负相似度,这意味着总体而言,Quality引导向量并不与特定语言绑定。
- •我们证明,在早期层应用Quality和Language引导能够提升LLM生成合成数据的性能(以下游性能衡量),同时增加生成数据的多样性(无论是零样本还是少样本提示)。
## 2 相关工作
#### 合成数据。
LLM越来越多地被用于创建符合给定标签的语义新颖样本(Ubani等,2023(https://arxiv.org/html/2606.18389#bib.bib47);Cegin等,2024b(https://arxiv.org/html/2606.18389#bib.bib46))。基于LLM的增强和数据生成已用于多种任务,如自动评分(Fang等,2023(https://arxiv.org/html/2606.18389#bib.bib65))、低资源语言生成(Ghosh等,2023(https://arxiv.org/html/2606.18389#bib.bib66))、意图分类(Sahu等,2022(https://arxiv.org/html/2606.18389#bib.bib64))、情感分析(Piedboeuf and Langlais,2023(https://arxiv.org/html/2606.18389#bib.bib61); Onan,2023(https://arxiv.org/html/2606.18389#bib.bib60))、内容推荐(Liu等,2024(https://arxiv.org/html/2606.18389#bib.bib62))和健康症状分类(Dai等,2023(https://arxiv.org/html/2606.18389#bib.bib50))。由于LLM在低资源语言中作为数据生成器优于分类器(Pecher等,2026(https://arxiv.org/html/2606.18389#bib.bib83)),近期研究专注于在多种低资源语言中生成此类符合标签的数据,如越南语(Feng等,2021(https://arxiv.org/html/2606.18389#bib.bib52))、马拉地语(Tran等,2026(https://arxiv.org/html/2606.18389#bib.bib85))或各种非洲语言(Belay等,2026(https://arxiv.org/html/2606.18389#bib.bib86)),并用于各种任务和领域,如问答(Namboori等,2023(https://arxiv.org/html/2606.18389#bib.bib56))、事实核查(Chung等,2025(https://arxiv.org/html/2606.18389#bib.bib57))、命名实体识别(Liu等,2021(https://arxiv.org/html/2606.18389#bib.bib58))或文本分类(Glenn等,2023(https://arxiv.org/html/2606.18389#bib.bib59))。其他研究聚焦于寻找在低资源语言中生成数据的最佳方法,例如增强生成器选择(Cegin等,2026(https://arxiv.org/html/2606.18389#bib.bib84))或寻找最佳提示技术(Anikina等,2025(https://arxiv.org/html/2606.18389#bib.bib82))。因此,当前最先进的技术(Anikina等,2025(https://arxiv.org/html/2606.18389#bib.bib82))在提示中使用少样本示例,从而在额外推理成本下获得性能提升。
Gemma 2模型结果。
Llama 3.1模型结果。
图2:按语言聚合的人工撰写 vs. 反向翻译文本对的线性探针结果。
#### 激活引导。
另一条研究路线探索了激活引导,即通过在前向传播过程中直接干预中间表示来修改模型行为,而非通过提示或微调(Zou等,2023(https://arxiv.org/html/2606.18389#bib.bib19);Turner等,2024(https://arxiv.org/html/2606.18389#bib.bib20);Ostermann等,2026(https://arxiv.org/html/2606.18389#bib.bib24))。最广泛使用的方法族是基于差异的引导,它从对比示例中推导引导向量(Turner等,2023(https://arxiv.org/html/2606.18389#bib.bib2);Rimsky等,2024(https://arxiv.org/html/2606.18389#bib.bib3);Marks and Tegmark,2023(https://arxiv.org/html/2606.18389#bib.bib18))。除此之外,基于优化的方法如ReFT(Wu等,2024(https://arxiv.org/html/2606.18389#bib.bib17))及其秩1变体(Wu等,2025(https://arxiv.org/html/2606.18389#bib.bib16))学习隐藏状态上的低秩干预,而字典学习方法使用稀疏自编码器将激活分解为可解释、可单独引导的特征(Gao等,2024(https://arxiv.org/html/2606.18389#bib.bib15);Cunningham等,2024(https://arxiv.org/html/2606.18389#bib.bib14))。这些技术已被证明能够可靠地控制广泛的行为,如情感、主题和风格(Turner等,2023(https://arxiv.org/html/2606.18389#bib.bib2);Konen等,2024(https://arxiv.org/html/2606.18389#bib.bib13))、真实性和谄媚(Li等,2023(https://arxiv.org/html/2606.18389#bib.bib12);Panickssery等,2023(https://arxiv.org/html/2606.18389#bib.bib11))以及拒绝回答(Arditi等,2024(https://arxiv.org/html/2606.18389#bib.bib10))。与我们设置特别相关的是,引导也被应用于多语言控制:先前工作已识别出语言特定的神经元(Zhao等,2024(https://arxiv.org/html/2606.18389#bib.bib9);Tang等,2024(https://arxiv.org/html/2606.18389#bib.bib4);Gurgurov等,2025b(https://arxiv.org/html/2606.18389#bib.bib5))、SAE特征(Chou等,2025(https://arxiv.org/html/2606.18389#bib.bib8);Deng等,2025(https://arxiv.org/html/2606.18389#bib.bib22))和语言向量(Wong等,2026(https://arxiv.org/html/2606.18389#bib.bib27);Gurgurov等,2026(https://arxiv.org/html/2606.18389#bib.bib26);Ghussin等,2026a(https://arxiv.org/html/2606.18389#bib.bib7)),这些可以被激活或消融以改变输出语言同时保留语义质量。近期工作进一步表明,语言向量引导可用于具备文化意识的多语言推理:Ghussin等(2026b(https://arxiv.org/html/2606.18389#bib.bib6))报告了在文化知识检索方面的改进。虽然这些研究确立了语言身份在激活空间中被编码为一个可引导的方向,但它们专注于语言控制或下游文化基准的提升,而非所产生文本的生成质量。我们的工作通过同时使用语言和质量引导向量来为低资源语言生成更好的合成数据,填补了这一空白。
## 3 方法与实验
我们的方法包括一个简单的流程:(1) 从给定层的残差流中收集激活,并根据收集的激活创建引导向量;(2) 将引导向量应用于LLM;(3) 以给定语言生成带有标签的数据;(4) 微调下游模型并在人工测试数据上进行评估。这在11种不同语言上完成。我们研究中的这11种语言经过挑选,以涵盖多样的类型学属性,并确保与评估数据集重叠。它们覆盖印欧语系(日耳曼语支:丹麦语、德语;斯拉夫语支:捷克语、斯洛伐克语、斯洛文尼亚语)、亚非语系(闪米特语支:阿姆哈拉语、希伯来语、马耳他语)和南岛语系(印度尼西亚语、爪哇语、巽他语)语系(Nordhoff and Hammarström,2011(https://arxiv.org/html/2606.18389#bib.bib72))。这种设计使我们能够测试引导在多种形态系统(从黏着语到屈折语)以及不同书写系统(吉兹字母、希伯来字母、拉丁字母)上的鲁棒性。这种多样性有助于评估学到的引导流形是否超越了正字法形式。
### 3.1 计算引导向量
#### 语言向量。
我们使用FLORESNLLB团队等(2024(https://arxiv.org/html/2606.18389#bib.bib87))和BOUQUET(Andrews等,2025(https://arxiv.org/html/2606.18389#bib.bib88))数据集,两者都包含人工创作的多语言文本。FLORES提供专业翻译的平行句子,涵盖附录E(https://arxiv.org/html/2606.18389#A5)中列出的所有11种目标语言,能够在控制语义内容的同时隔离语言身份(Ghussin等,2026b(https://arxiv.org/html/2606.18389#bib.bib6))。加入BOUQUET是为了增加词汇多样性并包含更自然的语言。合并两个数据集也确保足够的token覆盖以获得稳定的平均激活。为了构建Language引导向量,我们采用一对多的对比方法,基于所有Transformer块的残差流激活(Ghussin等,2026b(https://arxiv.org/html/2606.18389#bib.bib6))。对于11种目标语言中的每一种,我们通过平均所有非填充token的激活来计算数据集上的平均激活向量,从而在模型的潜在空间中获得每个层的语言特定平均表示。然后,引导向量定义为目标语言平均表示与所有其他语言平均表示之差,随后进行归一化。
表1:按任务聚合的语言、模型、引导方法和层之间的平均F1差异,与无引导的零样本提示相比,显示正差异和负差异。
#### 质量向量。
我们遵循Rimsky等(2024(https://arxiv.org/html/2606.18389#bib.bib3))的对比激活提取方法,该方法需要表示对立属性的配对示例(在我们的案例中:人工样本 vs. 生成样本)。相似文章
基于稀疏查询特征梯度优化的导向生成
本文介绍了Prototype-Based Sparse Steering方法,该方法将稀疏自编码器应用于大语言模型的注意力查询激活,然后在推理过程中使用梯度优化来引导生成朝向目标行为。该方法在一个逻辑规划任务和一个风格化教育领域中得到了验证,展示了可解释且解耦的控制能力。
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。
Deployable Per-Instance Multi-Layer Activation Steering for Large Language Models
This paper introduces a deployable per-instance, multi-layer activation steering technique for large language models, showing that optimal layer selection varies per input and can be predicted from the prompt embedding without gold labels at inference.
转向信号的来源:激活转向中的激活源选择
本文研究了源激活的选择如何影响语言模型中的激活转向,发现执行边界状态(模型即将产生目标行为的状态)能产生更强的信号,并引入了尾部减法来提高转向稳定性。
提示-激活对偶性:通过注意力层干预改进激活引导
本文识别出KV缓存污染是对话中激活引导的一种失败模式,并提出了GCAD方法,该方法从提示贡献中提取引导信号,并应用词元级门控来改进长程连贯性,在多轮基准上取得了显著提升。