学习失败模式:用于对抗性数据策展的上下文强盗方法

arXiv cs.CL 论文

摘要

本文介绍了一种故障感知的对抗检索增强框架,利用上下文强盗来提升自然语言理解的鲁棒性,并在SNLI、ANLI和MultiNLI等基准测试中取得了显著改进。

arXiv:2608.18681v1 公告类型:新 摘要:我们介绍了一种故障感知的对抗检索增强框架,用于提升自然语言理解的鲁棒性。与使用固定奖励阈值选择合成示例不同,我们的方法将对抗性数据策展表述为故障模式上下文强盗问题。候选示例通过检索增强提示生成,由当前目标模型过滤,由LLM评判集合自动验证,并聚类为反复出现的故障模式。随后,一个随机策略选择哪些故障模式进行重训练采样,并使用基于验证的奖励进行更新,该奖励平衡了鲁棒性增益、遗忘和数据成本。这使得数据策展器本身成为学习代理,能够在训练轮次中自适应选择最有用的模型故障。在标准基准测试中,我们的方法将RoBERTa-base在SNLI上的准确率从88.48%提升到92.60%,在ANLI上从75.04%提升到80.95%,在MultiNLI上从54.67%提升到71.99%,同时持续优于先前的对抗增强方法。我们进一步展示了向FEVER事实验证的迁移,使用RoBERTa-large可达到高达79.86\%的FEVER分数和82.45\%的准确率。最后,我们提供了一种理论解释,表明在所述假设下,故障模式采样可以减少捷径对齐的梯度贡献,同时引入有界的分布漂移。通过结合检索、自动验证、上下文强盗故障选择和可控对抗重训练,我们的框架实现了可扩展的鲁棒性提升,无需额外的人工标注。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:16

# 学习失败模式:基于上下文老虎机的对抗性数据筛选方法
来源:https://arxiv.org/html/2608.18681
作者:  
Ofir Cohen ([email protected])  
Rami Puzis ([email protected])  
隶属单位:本·古里安大学软件与信息系统工程系  
Asaf Shabtai ([email protected])  
隶属单位:本·古里安大学软件与信息系统工程系  
Ofer Hadar ([email protected])  
隶属单位:本·古里安大学电气与计算机工程系

###### 摘要  
我们提出了一种具备失败感知能力的对抗性检索增强框架,旨在提升自然语言理解的鲁棒性。与使用固定奖励阈值选择合成样本的方法不同,我们将对抗性数据筛选构建为失败模式上下文老虎机问题。候选样本通过检索增强提示生成,经当前目标模型过滤后,由大型语言模型评判器集成自动验证,并聚类为重复出现的失败模式。随机策略随后选择用于重训练的失败模式,并通过基于验证的奖励进行更新,该奖励平衡了鲁棒性提升、遗忘问题和数据成本。这使得数据筛选器本身成为学习智能体,实现在训练轮次中自适应选择最具价值的模型失败案例。在标准基准测试中,本方法将RoBERTa-base在SNLI上的准确率从88.48%提升至92.60%,在ANLI上从75.04%提升至80.95%,在MultiNLI上从54.67%提升至71.99%,且持续优于先前的对抗性增强方法。我们进一步展示了该方法在FEVER事实验证任务上的迁移能力,使用RoBERTa-large时最高可获得79.86%的FEVER分数和82.45%的准确率。最后,我们提供了理论解释,表明在给定假设下,失败模式采样可以减少与捷径对齐的梯度贡献,同时引发有界分布漂移。通过结合检索、自动化验证、上下文老虎机失败模式选择以及受控对抗性重训练,本框架实现了无需额外人工标注的可扩展鲁棒性提升。

![图1](图片链接)  
图1:所提出的失败模式上下文老虎机筛选框架概览。给定输入-标签对,检索增强提示生成候选输出。目标模型通过仅保留错误预测来过滤候选样本,随后由大型语言模型评判器集成自动验证,并聚类为重复出现的失败模式。上下文老虎机策略在对抗性预算约束下选择失败模式,所选样本与原始数据混合用于重训练目标模型。验证反馈提供奖励$G_t$,用于更新策略$\pi_\theta$和评论器$R_\phi$,实现跨轮次的高影响失败模式自适应选择。

## 1 引言  
自然语言推理(NLI)——判断假设是否被给定前提蕴含、矛盾或保持中立的任务——是许多自然语言理解问题的核心组成部分,包括问答、摘要、对话系统和事实验证。更广泛地说,许多监督式NLP任务在面对对抗性或域外样本时都存在类似的鲁棒性限制。尽管取得了快速进展,即使是最先进的模型仍然脆弱,常常依赖虚假的词汇线索或在简单的句法和语义变化下失效([7], [3])。诸如SNLI和MultiNLI([2], [32])以及对抗性数据集([27])等基准测试推动了鲁棒性改进,但标注成本高昂且仍有许多失败模式未被覆盖。近年来,GNLI([9])等大规模合成数据集已被自动生成,但其非目标化特性可能会稀释对改进特定目标模型最有用的对抗模式。现有的对抗性数据生成流程通常依赖静态过滤、启发式选择规则或一次性验证。因此,它们没有显式地学习随着目标模型的演进应优先处理哪些类型的失败。这一限制尤为重要,因为模型失败的价值并不相等:有些暴露了持久的决策捷径,而有些则带有噪声、冗余或过于简单,无法带来有意义的鲁棒性提升。

受此差距驱动,我们将对抗性数据筛选构建为一个**失败模式上下文老虎机问题**。学习智能体并非目标分类器本身,而是决定对哪些类型的已验证模型失败进行采样以用于重训练的数据筛选器。我们的框架首先使用语义嵌入(BGE M3 [4])和词汇匹配(BM25 [30])检索标签平衡的少样本上下文。这些上下文被组装成大型语言模型提示,以生成具有挑战性的候选假设。每个候选样本由当前目标模型评估,只有那些导致错误分类的样本才会传递给自动化的大型语言模型评判器集成进行标签验证。验证后的失败被嵌入并聚类为重复出现的失败模式,例如词汇捷径失败、否定错误、实体不匹配错误、数值推理失败或矛盾混淆。随机上下文老虎机策略随后观察每个失败模式的状态向量,包括聚类大小、目标模型损失、不确定性、分类间隔、标签分布、检索分数、评判器一致性、新颖性和先前奖励统计。策略在固定对抗性预算约束下选择对哪些失败模式进行采样。在目标模型使用原始样本和所选对抗样本的受控混合进行重训练后,策略收到基于验证的奖励,该奖励平衡了鲁棒性提升、在干净数据分布上的遗忘以及数据成本。轻量级评论器估计每个失败模式的预期效用,但选择由学习到的策略而非固定奖励阈值决定。此设计为自适应对抗性数据筛选提供了显式的策略、动作空间、奖励信号和策略优化程序[14]。在NLI基准测试的无人类参与对抗性微调和迁移评估中,本方法将RoBERTa-base在SNLI上的准确率从88.48%提升至92.60%,在ANLI上从75.04%提升至80.95%,在MultiNLI上从54.67%提升至71.99%,且持续优于先前的对抗性增强方法。除NLI外,我们进一步展示了向FEVER事实验证基准的迁移。使用RoBERTa-large,本方法最高可获得79.86%的FEVER分数和82.45%的标签准确率,超越了强大的检索增强和合成数据基线。这些结果表明,失败模式老虎机筛选可以提升跨任务结构和监督模式的鲁棒性,同时使用自动生成和自动验证的数据。

我们的贡献包括:  
**框架**:我们提出了一个用于对抗性数据筛选的失败模式上下文老虎机框架。该框架无需额外人工标注,并学习应对哪些已验证的模型失败模式进行采样用于重训练。  
**方法论**:我们引入了一个自适应筛选流程,结合了标签平衡检索、基于大型语言模型的候选生成、目标模型失败过滤、自动化评判器验证、无监督失败模式聚类以及在对抗性数据预算下的上下文老虎机选择。  
**实证评估**:我们提供了经验证据,表明与静态对抗性增强、奖励阈值过滤、纯检索选择和非目标合成数据基线相比,失败模式老虎机筛选能提升鲁棒性和数据效率。  
**理论解释**:我们提供了分析性解释,表明在给定假设下,失败模式采样可以减少与捷径对齐的梯度贡献,同时保留核心特征贡献。我们进一步证明,基于混合的更新引发有界分布漂移,并且有界效用噪声导致诱导采样策略的有界失真。

## 2 背景与相关工作  
提升NLI模型的鲁棒性仍然是自然语言理解中的一个核心挑战([7], [3])。SNLI([2])和MultiNLI([32])等基准测试推动了大规模监督训练,而ANLI([27])引入了人类与模型在环的协议来收集更难的对抗样本。然而,这些数据集需要大量标注工作,且仍未覆盖许多系统性失败模式。近年来,自动化和合成数据生成方法减少了对人工标注的依赖。例如,GNLI([9])表明大规模生成的NLI数据可以媲美人类策划的数据,而[19]提出了一种无需训练的检索增强框架用于对抗性检测和过滤。关于反事实和释义生成的相关工作也用于丰富训练分布([22], [20], [15])。尽管取得了这些进展,大多数现有方法依赖于静态生成、启发式过滤或一次性验证,因此没有显式地学习随着目标模型的演进应优先处理哪些类型的模型失败。

**对抗性与合成样本生成**:自动化对抗流程旨在无需人工筛选即可暴露和纠正模型弱点。[26], [16]生成违反逻辑约束的样本,提升了SNLI和MultiNLI上的鲁棒性。[28]使用模型在环设置来呈现具有挑战性的样本并改善域外迁移。[11], [17]引入了用于释义攻击的句法控制变换。近期的基于大型语言模型的流程进一步证明,特别是结合自动化验证时,生成的假设可以提供有用的对抗性监督。然而,这些方法通常使用固定规则、置信度阈值、启发式过滤器或有限的人类反馈来选择样本。相比之下,我们的工作将对抗性数据筛选视为一个自适应学习问题:系统识别重复出现的目标模型失败,将其聚类为失败模式,并学习哪些模式对重训练最有用[18]。

**少样本提示检索**:少样本检索对于可靠的基于大型语言模型的生成至关重要,因为检索到的上下文控制着生成样本的标签分布和语义结构。密集检索模型如BGE([4])提供语义相似性,而词汇方法如BM25([30])捕捉表面层重叠和精确的词汇线索。因此,混合检索可以为生成多样且标签一致的假设提供互补上下文。在我们的框架中,检索本身并非主要贡献。相反,它是一个更大的闭环筛选流程的第一阶段:检索到的样本指导生成,生成的候选样本暴露目标模型失败,下游的老虎机策略决定应对哪些已验证的失败模式进行采样用于重训练。

**强化学习、老虎机与数据选择**:学习选择训练样本已在强化学习和课程学习环境中被研究。[6]提出神经数据过滤器,学习选择有用的训练样本。强化指导的课程也已在结构化预测任务(如神经机器翻译)中被探索,其中策略学习对样本排序或加权以改善训练([36])。近期的工作将模型微调的数据选择建模为一个序贯决策问题,其中智能体选择数据子集以优化验证奖励([13])。相关方法如LearnAlign([21])和RL-Selector([34])使用奖励反馈来选择信息丰富的样本或减少冗余。我们的方法在选择单元和监督来源上不同于这些方法。我们不是选择任意的训练样本,而是首先构建一个由当前目标模型引发的已验证对抗失败池。这些失败随后被聚类为语义失败模式,上下文老虎机策略在固定对抗性预算下选择对哪些模式进行采样。奖励在重训练后计算,使用验证改进、遗忘惩罚和数据成本。这提供了显式的状态、动作、奖励和策略更新,同时避免了逐样本效用估计的不稳定性和开销。

## 3 方法论  
![图2](图片链接)  
图2:我们的失败感知策略渐进式构建示例。从左至右:仅使用大型语言模型进行假设生成,不使用检索或反馈;添加少样本检索以基于相似失败条件化生成;完整的强化指导策略,结合检索、多模型验证和基于奖励的选择,以识别和重新注入高影响的对抗更新。

令$\mathcal{D}=\{(p_i,y_i)\}_{i=1}^N$表示NLI训练集,其中每个前提$p_i$与一个标签$y_i \in \mathcal{Y}$配对,$\mathcal{Y}=\{\text{entail},\text{neutral},\text{contradict}\}$。我们用$M^{(t)}$表示经过$t$轮失败感知对抗数据筛选后的目标模型,其中$M^{(0)}$在$\mathcal{D}$上训练。目标是构建一个紧凑的对抗训练集,以在不依赖大量非目标合成样本的情况下提升鲁棒性。我们将此过程构建为**失败模式上下文老虎机筛选**。在每次迭代中,系统检索少样本上下文,生成候选对抗样本,在当前目标模型中过滤诱导错误的候选,并使用自动化评判器集成进行验证。验证后的失败随后被分组为语义失败模式。我们不是通过固定奖励阈值选择单个样本,而是使用可训练的随机策略$\pi_\theta$观察每个失败模式,并决定应对哪些模式进行采样用于重训练。在目标模型更新后,策略收到基于验证的奖励,并使用策略梯度目标进行优化。因此,学习智能体是数据筛选器,其角色是学习应对哪些类型的模型失败进行采样。

相似文章

语境之代价:在多模态检索增强生成中缓解文本偏差

arXiv cs.CL

本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。

上下文归因如何处理模型已知的知识

arXiv cs.CL

本文介绍了一个评估协议,包含四个新指标和一个基准数据集,用于评估LLM的上下文归因方法,并表明当上下文与训练数据重叠时这些方法会失败。

面向上下文LLM级联的在线Pandora's Box

arXiv cs.AI

本文介绍了一种面向自适应查询和选择LLM API的在线上下文Pandora's Box模型,提出了一种结合GMM估计与UCB风格置信区间的学习方法,并证明了维度相关的遗憾界。

有限适应性下的上下文Slate GLM Bandits

arXiv cs.LG

提出了在有限适应性下具有广义线性奖励的上下文Slate Bandit算法,实现了与非线性参数无关的遗憾界。批量式和少切换算法计算高效,且在经验上优于基线,包括在语言模型示例选择任务中。