任务级自然语言先验作为低资源LLM训练的学习信号
摘要
本文提出了Prior-Guided Tuning (PGT)和Contrastive Prior Steering (CPS),利用自然语言先验作为辅助学习信号,提升低资源LLM在AmbiMath、Jigsaw和MNLI/HANS等任务上的训练性能。
arXiv:2609.02244v1 公告类型:新
摘要:大型语言模型 (LLMs) 在低资源训练数据模糊或不完整时经常面临困难。在这种情况下,任务级自然语言先验可以提供有用的指导,但现有方法通常将这些先验视为输入上下文,而不是训练过程中的学习信号。我们提出了Prior-Guided Tuning (PGT),一种将自然语言先验作为辅助学习信号融入低资源LLM训练的训练视角。在此视角下,我们引入了Contrastive Prior Steering (CPS),它保持原始监督目标不变,同时添加正向和负向先验条件辅助损失,以鼓励任务一致性学习并排除看似合理但误导性的替代方案。在AmbiMath、Jigsaw和MNLI/HANS上的实验表明,CPS始终优于普通和提示微调。在AmbiMath上,CPS达到97.6%的平均精确匹配准确率。在Jigsaw上,CPS将平均Macro F1提高了9.5个百分点,相比标准微调,并且使用1/10的实验训练数据略超过全数据普通微调。在HANS上,CPS分别将LLaMA 3.1 8B和Qwen 2.5 7B的非蕴含准确率提高了8.3和5.2个百分点,同时保持了相当的领域内MNLI准确率。这些结果支持我们的核心主张:任务级自然语言先验可以作为辅助学习信号为低资源LLM训练提供有用的指导。我们的代码和数据将公开发布。
查看缓存全文
缓存时间: 2026/09/03 06:03
# 任务级自然语言先验作为低资源大语言模型训练的引导信号
来源:https://arxiv.org/html/2609.02244
###### 摘要
大型语言模型(LLMs)在面对低资源训练数据时,若数据存在歧义或不完整,其性能往往会受到影响。任务级自然语言先验在这些场景中能够提供有用的指导,但现有方法通常将这些先验视为输入上下文,而非训练过程中的学习信号。我们提出了先验引导调优(Prior-Guided Tuning, PGT),一种将自然语言先验作为低资源LLM训练辅助学习信号的训练范式。在此视角下,我们引入对比先验引导(Contrastive Prior Steering, CPS),该方法在保持原始监督目标不变的基础上,增加正向和负向先验条件下的辅助损失,以鼓励任务一致性学习并抑制合理但具有误导性的替代方案。在AmbiMath、Jigsaw以及MNLI/HANS数据集上的实验表明,CPS持续优于常规微调和提示微调。在AmbiMath上,CPS平均精确匹配准确率达到97.6%。在Jigsaw上,CPS将平均宏观F1分数提升了9.5个百分点,且在仅使用1/10实验训练数据的情况下,其表现略微超过使用全部数据的常规微调。在HANS上,CPS分别将LLaMA 3.1 8B和Qwen 2.5 7B模型的非蕴含准确率提高了8.3和5.2个百分点,同时保持了可比的领域内MNLI准确率。这些结果支持了我们的核心论点:任务级自然语言先验可以作为低资源LLM训练的辅助学习信号,提供有用的指导。我们的代码和数据将公开发布。
## 1引言
机器学习模型,特别是大型语言模型(LLMs),主要通过拟合数据分布中的模式来获取知识。然而,在实际场景中,训练数据很少是全面的,这常常导致模型在数据稀缺和模糊的情况下容易受到数据中虚假关联或表面线索的影响(Gururangan et al., 2020 (https://arxiv.org/html/2609.02244#bib.bib10); Jeong, 2024 (https://arxiv.org/html/2609.02244#bib.bib9))。在低资源数据的场景下,仅靠训练数据可能无法揭示任务应如何解决。任务级自然语言先验,例如领域知识或规则描述,可以提供缺失于经验训练分布中的关键任务相关指导。
将先验注入LLMs的一种流行方法是训练时提示,它在训练样本后附加手工设计的指令(Wei et al., 2022 (https://arxiv.org/html/2609.02244#bib.bib5))。然而,这种方法将自然语言视为上下文输入,而非训练目标的组成部分,当先验需要消解任务应如何解决的歧义时,这可能不够充分。当微调样本同时与预期规则和虚假规则兼容时,监督梯度可能会强化错误的规则。仅仅将先验作为输入附加并不能显式控制此更新过程,因为先验仍被视为要建模的上下文,而非定义学习目标的信号。推理时提示可以在测试时让模型接触到先验,但它并未解决在模糊的低资源数据下,监督微调如何更新参数的问题。一旦微调强化了非预期规则,仅在测试时添加先验可能为时已晚,无法改变已学到的行为。因此,我们的关注点不同于一般的提示或指令调优:我们研究的是,当训练数据本身不足时,用自然语言编写的任务级先验是否能为低资源监督训练提供有用的指导。
这一差距促使了对自然语言先验的不同使用方式:任务级自然语言先验可以作为低资源LLM训练的辅助学习信号,提供有用的指导。我们将此想法形式化为先验引导调优(Prior-Guided Tuning, PGT),一种将自然语言先验作为辅助信号以引导训练过程的训练范式。在PGT框架内,我们引入了对比先验引导(Contrastive Prior Steering, CPS),这是一种具体的实现方式,它将标准的监督损失与对比性的正向和负向先验条件目标相结合。CPS鼓励任务一致性学习,同时抑制合理但具有误导性的替代方案,使得自然语言先验能够在训练过程中补充稀疏的监督信号。我们的主要贡献如下:
- • 我们开发了先验引导调优(Prior-Guided Tuning, PGT),一种将自然语言先验视为显式学习信号而非上下文输入的训练范式。PGT允许模型在低资源数据本身不足时使用任务级指导。
- • 我们引入了对比先验引导(Contrastive Prior Steering, CPS),这是PGT的一种具体实现,它从正向和负向先验构建对比性辅助信号,以鼓励任务一致性学习并抑制误导性替代方案,同时保留原始的数据驱动学习信号。
- • 我们在AmbiMath、Jigsaw毒性分类(Jigsaw, 2019 (https://arxiv.org/html/2609.02244#bib.bib12))以及MNLI/HANS自然语言推理(Williams et al., 2018 (https://arxiv.org/html/2609.02244#bib.bib2); McCoy et al., 2019 (https://arxiv.org/html/2609.02244#bib.bib3))上进行了广泛实验。CPS在AmbiMath各类先验上达到97.6%的平均精确匹配准确率,将Jigsaw的平均宏观F1提升了9.5个百分点,并在保持MNLI准确率可比的同时提高了HANS的非蕴含鲁棒性。对Jigsaw的扩展分析进一步表明,CPS在使用1/10实验训练数据的情况下,其表现略微超过使用全部数据的常规微调。额外的早期训练诊断表明,CPS在初始训练阶段能更好地将优化与预期任务规则对齐。
## 2相关工作
### 2.1指令调优与提示
指令调优和提示是向LLMs提供任务信息的标准方法。上下文提示将指令或示例作为输入的一部分(Brown et al., 2020 (https://arxiv.org/html/2609.02244#bib.bib8)),而提示调优则学习用于下游任务的连续提示(Lester et al., 2021 (https://arxiv.org/html/2609.02244#bib.bib7))。指令调优进一步在指令格式的任务上训练模型,如T0和FLAN(Sanh et al., 2022 (https://arxiv.org/html/2609.02244#bib.bib4); Wei et al., 2022 (https://arxiv.org/html/2609.02244#bib.bib5)),而大型指令集合如Super-NaturalInstructions将这一理念扩展到广泛的任务泛化(Wang et al., 2022 (https://arxiv.org/html/2609.02244#bib.bib6))。这些方法通常将指令、示例或提示插入到训练或推理输入中,因此自然语言指导被视为*上下文*。这对于指定模型应执行*什么*任务或期望的输出格式是有效的。相比之下,我们的场景假设任务已经指定,而稀缺的数据可能无法揭示任务应*如何*解决。因此,PGT在训练过程中使用任务级自然语言先验作为辅助学习信号,而不仅仅是作为上下文输入。
### 2.2用于对齐的偏好优化
RLHF风格的方法从人类反馈中学习,使模型输出与人类偏好或排名信号对齐(Kaufmann et al., 2025 (https://arxiv.org/html/2609.02244#bib.bib19))。直接偏好优化(DPO)优化被偏好响应而非被拒绝响应,无需显式拟合奖励模型(Rafailov et al., 2023 (https://arxiv.org/html/2609.02244#bib.bib18))。我们的方法也使用正向和负向信号,但监督的作用不同。偏好优化通常是*实例级*的:每个输入与被偏好和被拒绝的输出配对,目标是学习响应上的偏好关系。相比之下,CPS使用*任务级*的正向和负向先验,这些先验在同一任务的多个样本间共享。目标不是建模人类偏好,而是在可用数据与误导性关联兼容时,引导低资源监督训练朝向预期的任务原则。因此,DPO风格的训练是一个有信息量的经验对比,但不是主要的概念基线。
### 2.3知识感知学习
知识感知学习将外部知识融入语言模型训练或推理中。ERNIE和K-BERT将实体或三元组等结构化知识注入语言表示或输入序列(Sun et al., 2019 (https://arxiv.org/html/2609.02244#bib.bib13); Liu et al., 2020 (https://arxiv.org/html/2609.02244#bib.bib14))。KPT使用外部知识扩展文本分类的提示词表(prompt verbalizers),而KaFT则根据知识冲突调整微调样本(Hu et al., 2022 (https://arxiv.org/html/2609.02244#bib.bib16); Zhong et al., 2025 (https://arxiv.org/html/2609.02244#bib.bib15))。这些方法相关,因为它们也融合了任务标签之外的外部知识以改善模型行为。我们的场景在知识的形式和粒度上有所不同:PGT使用跨样本共享的任务级自然语言先验作为训练信号,而非结构化知识源、指令改写或实例级的额外配对标注。这针对的是低资源场景,其中有用的任务知识可以用自然语言表述,无需进行三元组抽取、知识库构建或额外的实例级标注。
## 3动机:数据的模糊性
### 3.1问题设定
标准LLM训练在最大似然估计(Maximum Likelihood Estimation, MLE)框架下运行,优化参数θ以在训练数据集𝒟上最大化P(Y|X;θ)。成功的泛化取决于数据分布P(𝒟)是否包含足够的信息以唯一确定真实的潜在任务函数f。然而,低资源数据集特别容易出现规范模糊性(D'Amour et al., 2022 (https://arxiv.org/html/2609.02244#bib.bib17))。一个小的训练集可能缺乏能够区分预期规则与合理替代方案的反例。因此,多个假设{h₁,...,hₖ}在训练分布上可以获得几乎无法区分的经验损失,但在分布外样本上会发散。
考虑这样一个场景:一个虚假特征x_spurious在𝒟内与标签y强相关,甚至完全相关。优化目标变得不适定,因为不同的参数设置可以获得相同的经验损失:
ℒ_𝒟(θ_true) ≈ ℒ_𝒟(θ_spurious), (1)
其中θ_true和θ_spurious分别表示遵循预期规则和误导性规则的模型。在这种情况下,仅靠统计模式可能无法打破这种函数等价性。因此,模型受益于外部学习信号,例如来自自然语言先验的指导,它倾向于任务一致的解决方案,而非像虚假关联这样的误导性替代方案。
### 3.2AmbiMath:一个受控的合成基准
在真实数据集中,数据分布和自然语言先验指导对模型性能的贡献常常深度交织,难以分离和量化先验的具体影响。为了更好地分离先验指导与数据驱动学习的作用,我们使用了一个高度受控的环境。如图1(https://arxiv.org/html/2609.02244#S3.F1)所示,我们引入了AmbiMath(歧义数学推理基准),一个基于函数计算任务f(x₁, x₂)=y的合成基准,其中两个输入参数中只有一个决定答案y,而另一个是无关的。在此设置中,模型需要学习两个不同的部分:(1)特征选择:识别哪个参数是任务相关的;(2)运算符学习:识别所需的算术运算。我们如下构建训练集𝒟_train:
𝒟_train = {(y-2, y+2, y) | y ∈ ℤ} (2)
在此构造下,出现了两个竞争的假设:目标规则(h_true: f(x₁, x₂) = x₁ + 2)和虚假规则(h_spurious: f(x₁, x₂) = x₂ - 2)。对于𝒟_train中的任何样本,两个规则都与观察到的标签完全一致。因此,符号数据构造创造了一个经验平局:仅靠训练集无法确定哪个规则应支配解耦的测试案例。为了解决任务歧义,我们提供了一个自然语言先验:“输出应从第一个输入参数推导而来,忽略另一个。”这个先验仅处理特征选择任务,而算术运算仍需从数据分布中学习,确保来自自然语言先验的学习信号和来自数据分布的模式在概念上是解耦的,两者对于任务都是必要的。在推理时,我们评估时不使用先验,以测试模型是否已经学习了目标规则而非虚假规则。我们在解耦样本上测试模型,其中x₁+2 ≠ x₂-2(例如,f(17, 5))。如果模型有效学习了预期规则,它应输出19(17+2);否则,它可能输出3(5-2),表明未能打破统计平局并抵消虚假关联。
参考标题图1:在AmbiMath上标准微调与先验引导调优(PGT)的比较。标准微调在兼容多个规则的样本上训练。PGT使用任务级自然语言先验作为辅助训练信号,帮助选择预期假设,同时保留数据驱动的运算符学习。我们精心整理了一个包含200个样本的紧凑数据集,以模拟低资源场景。为了测试CPS是否能利用同一任务级规则的不同描述,我们改变了相关参数x₁和x₂的表达方式:第一个参数用中文数字书写,第二个用英文单词书写。我们进一步评估了两种形式的先验:位置先验(例如,“关注第一个/第二个参数”)和语义先验(例如,“关注中文/英文参数”)。此设置测试该方法是否能利用任务级选择规则的不同自然语言描述,而不是仅依赖一个固定的提示模板。
## 4方法
### 4.1先验引导调优
我们专注于低资源任务学习,其中可用的数据可能过于稀疏或模糊,无法完全确定任务应如何解决。在许多实际场景中,收集大量的标注数据成本高昂,构建结构化知识库或实例级标注可能不切实际。然而,从业者通常拥有可能用自然语言表述的任务级知识:例如,应该信任哪个特征,应该避免哪个启发式方法,或者哪个领域特定的标准应该指导预测。此类知识不是另一个标注样本,但它仍然可以提供关于任务应如何解决的有用监督。
我们提出先验引导调相似文章
论大语言模型适应性的局限:模型内化先验对标注任务性能的影响
本文研究了LLM的内化先验如何影响零样本标注性能,发现近三分之二的错误抵抗基于提示的修正,并引入了定义特定熟悉度(DSF)作为比记忆化指标更好的预测因子。
实际环境中的多语言多模态大语言模型:面向低资源语言的构建
本教程论文概述了如何为低资源语言构建多语言多模态大语言模型,涵盖数据创建、模型对齐、微调和评估,重点提供实用方案和动手资源。
目标条件监督学习用于LLM微调
本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
基于语义奖励的强化学习实现低资源语言扩展而无对齐代价
本文提出使用基于语义奖励的强化学习(通过GRPO)来将LLM扩展到低资源语言,避免了典型的灾难性遗忘对齐代价,展示了相比监督微调更好的语义质量和迁移性。