用上下文集成统一保形语言任务

arXiv cs.CL 论文

摘要

本文提出了保形相关性框架,该框架利用上下文学习和集成方法,在通过保形预测维持覆盖率保证的同时,提升自然语言处理任务的简洁性。

arXiv:2609.03005v1 Announce Type: new 摘要:许多自然语言处理任务(如摘要生成和抽取式问答)可归结为在两个约束条件下从文档中检索相关内容:覆盖率——保留足够相关信息以实现特定目标;简洁性——尽可能移除无关信息。保形预测方法已被用于保证覆盖率,且必须通过设计评分函数来优化简洁性。现有的最优评分函数采用手工设计的大语言模型提示,要求模型对内容重要性进行评分,但这种手动提示工程耗时费力且高度针对特定任务。我们提出了保形相关性框架,该框架通过上下文学习的示例策展和集成方法创建评分函数,在保持覆盖率的同时,以最少的人工干预提升简洁性。我们在七个自然语言处理任务上展示了该框架的应用,同时从理论层面研究了多样性对集成保形分数的影响,给出了描述集成方法在最坏情况下提升句子分数的互补性条件,以及集成改进的饱和界限。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:54

# 统一符合语言任务与上下文集成  
来源:https://arxiv.org/html/2609.03005  
陈元林  
隶属机构:Signal 1 AI  
邮箱:[[email protected]](mailto:[email protected])  
布鲁斯·桑原  
隶属机构:Signal 1 AI  
邮箱:[[email protected]](mailto:[email protected])  
梁建坤  
隶属机构:Layer 6 AI  
邮箱:[[email protected]](mailto:[email protected])  
杰西·C·克雷斯韦尔  
隶属机构:Layer 6 AI  
邮箱:[[email protected]](mailto:[email protected])  

###### 摘要  
许多NLP任务,如摘要生成和抽取式问答,都可归结为在两个约束下从文档中检索相关内容:*覆盖性*(保留足够相关信息以实现特定目标)和*简洁性*(尽可能移除无关信息)。符合性预测方法已被用于保证覆盖性,并需通过设计评分函数来优化简洁性。最先进的评分函数使用手工设计的LLM提示,要求模型评估内容的重要性,但人工提示工程既耗时又仅适用于特定任务。我们提出*符合相关性*框架,该框架利用上下文学习示例策划与集成技术构建评分函数,在保持覆盖性的同时以最少人工输入提升简洁性。我们在七个NLP任务上展示了该框架的应用,并从理论上研究了集成符合性评分的多样性影响,给出了集成改善最坏情况句子评分的互补条件,以及集成改进的饱和界。  

## 1 引言  
许多NLP任务,包括摘要生成(Mukherjee等,2022 (https://arxiv.org/html/2609.03005#bib.bib35))、抽取式问答(QA)(Yang等,2018 (https://arxiv.org/html/2609.03005#bib.bib55))、法律审查(Koreeda与Manning,2021 (https://arxiv.org/html/2609.03005#bib.bib56))和临床证据选择(DeYoung等,2020 (https://arxiv.org/html/2609.03005#bib.bib57)),都可归结为从文档中检索相关内容。这些任务的系统必须满足两项要求:*覆盖性*(保留相关内容)和*简洁性*(排除无关内容)。符合性预测(Vovk等,2005 (https://arxiv.org/html/2609.03005#bib.bib4))作为一种通用框架,因其能提供无分布假设的有限样本覆盖保证而广受欢迎。它通过在有标签数据集上校准任意评分函数来运作。虽然覆盖性得到保证,但简洁性在很大程度上取决于评分函数的预测能力。该框架已有多个详细研究实例,其差异在于相关性标准。对于问答,Mohri和Hashimoto(2024)(https://arxiv.org/html/2609.03005#bib.bib10)将相关内容定义为答案中未虚构的陈述,而虚构内容应被过滤。Kuwahara等人(2025)(https://arxiv.org/html/2609.03005#bib.bib8)研究抽取式摘要,将相关内容定义为重要句子,并为简洁性过滤掉不重要句子。对于这些NLP任务及其他任务,评分函数通常是通过任务特定提示工程配置的大语言模型(LLM),这种方法费力、脆弱且不可扩展(Lu等,2022 (https://arxiv.org/html/2609.03005#bib.bib13);Min等,2022 (https://arxiv.org/html/2609.03005#bib.bib11))。我们的目标是将所有此类内容选择任务统一到一个通用的相关性评分函数下,该函数用上下文学习(ICL)(Brown等,2020 (https://arxiv.org/html/2609.03005#bib.bib7);Dong等,2023 (https://arxiv.org/html/2609.03005#bib.bib54))示例策划取代人工提示编写。不同于以往工作中用自然语言*描述*相关性标准,我们通过精心挑选的示例*演示*它,并让LLM从演示中推断标准。我们将此框架称为*符合相关性*:基于召回导向的符合性校准与相关性评分函数相结合,通过ICL驱动的LLM评分实例化。为了以统一方式解决多样化的相关性标准,我们开发了多种ICL示例选择策略,这些策略生成的LLM评分函数具有系统性的不同优势和失败模式。集成这些评分可提升性能,同时完全保持任务无关性。具体而言,我们平均K个机制上不同的基于ICL的评分函数——选择它们以覆盖不同的信号类型,使它们的失败不太可能同时发生——并将结果视为单个符合性评分函数(Ochoa Rivera等,2025 (https://arxiv.org/html/2609.03005#bib.bib19);Waldron,2026 (https://arxiv.org/html/2609.03005#bib.bib28))。我们从数学形式化了一个*互补条件*,该条件刻画了集成何时能改善最坏情况符合性评分。每增加一个子评分函数带来的边际收益是递减的,其上界为O(1/K)。我们在涵盖五个领域的七个NLP数据集上应用了固定的ICL评分配置,展示了比手动设计、为每个任务定义相关性标准的提示更好的性能。我们的符合相关性方法在所有七个任务中移除了更多无关内容,同时保持相同的覆盖性,保留长度减少幅度高达约50%。通过几项消融实验和控制实验,我们确定收益源于集成内部示例中跨检索诱导的多样性。所需的标注预算适中:每个任务150-440个标签,包括一个共享的ICL池和一个100样本的校准集。我们的贡献如下:  
1. 一个用于不同内容选择任务、具有符合性覆盖保证的通用ICL集成评分函数。  
2. 四个覆盖不同信号类型的机制多样化子评分函数。  
3. 面向召回导向的符合性预测的评集成数学形式化。  

## 2 背景与相关工作  
内容选择。内容选择是NLP中的一项通用任务,需要从文档中提取相关信息。它以多种形式出现,具体取决于相关性的定义。典型例子是抽取式摘要,其中相关性意味着文档中的内容片段是重要的(Mukherjee等,2022 (https://arxiv.org/html/2609.03005#bib.bib35))。抽取式QA要求模型在生成答案之前从语料库中选择与问题相关的内容(检索)(Yang等,2018 (https://arxiv.org/html/2609.03005#bib.bib55)),例如在检索增强生成(RAG)中(Lewis等,2020 (https://arxiv.org/html/2609.03005#bib.bib22))。个人身份信息(PII)检测(Pilán等,2022 (https://arxiv.org/html/2609.03005#bib.bib31);Shen等,2026 (https://arxiv.org/html/2609.03005#bib.bib30);Ponomarenko等,2026 (https://arxiv.org/html/2609.03005#bib.bib3))(类似于命名实体识别(Wang等,2025 (https://arxiv.org/html/2609.03005#bib.bib2)))选择构成私人信息的内容,以便进行适当的遮蔽。这些例子远非详尽,因为内容选择以多种形式广泛存在。我们的目标是在语言建模中,将所有内容选择任务统一在一个框架下,为捕获相关内容提供符合性保证。符合性预测。给定来自联合分布(x, y*) ∼ ℙ的输入x∈𝒳和真实值y*∈𝒴,分割符合性预测(Vovk等,2005 (https://arxiv.org/html/2609.03005#bib.bib4);Shafer与Vovk,2008 (https://arxiv.org/html/2609.03005#bib.bib23))为新数据点x_test构建预测集C_{q̂}(x_test)⊆𝒴,并附带有限样本覆盖保证:ℙ[y_test* ∈ C_{q̂}(x_test)] ≥ 1−α,其中错误率α由用户定义。符合性预测需要任意的评分函数S(x, y),该函数通常源自黑盒机器学习模型。通过在有标签的校准数据集上计算评分,将符合性阈值q̂设置为n个评分的⌈(1−α)(n+1)⌉/n分位数。然后,预测集生成为C_{q̂}(x_test) = {y ∈ 𝒴 | S(x_test, y) ≤ q̂}。通过选择评分函数S,覆盖保证对任何分布都成立,尽管在有限的校准数据n下,经验覆盖率可能略低于名义水平1−α。然而,对于给定的覆盖保证,预测集的*大小*(或相关内容的数量)直接取决于评分函数S的质量:一个完美的评分器将始终为真实相关内容分配低分。因此,对于给定任务,设计合适的评分函数是实现高简洁性的关键。  

## 3 理论  
我们考虑一个文档x,其由一组内容片段{c_i}(如句子或段落)组成。设y* ⊂ {c_i}为x中“相关”片段(即应保留的片段)的集合。符合性预测目标是构建一个预测集Ĉ ⊆ x,使得每个真实相关内容c ∈ y*都包含在Ĉ中的概率至少为1−α。对于内容选择任务,定义评分函数S(x, y) = max_{c ∈ y} r(c; x),其中r(c; x)是片段c在文档x上下文下的相关性分数。给定此评分,符合性预测构造预测集Ĉ = {c ∈ x | r(c; x) ≤ q̂},其中阈值q̂根据校准数据集确定,以保证覆盖性。这种形式自然适用于内容选择,因为将高相关性片段(即r(c; x) > q̂)排除在Ĉ之外,相当于将它们包含在预测的“相关内容”集合中(即y_pred = {c ∈ x | r(c; x) > q̂})。形式上,如果真实相关内容集合为y*,则覆盖条件变为ℙ[y* ⊆ {c ∈ x | r(c; x) > q̂}] ≥ 1−α。  

### 3.1 集成评分  
我们研究一种特定形式的评分函数:通过平均K个独立的子评分器{r_j(c; x)}_{j=1}^K来构建,即r̄(c; x) = (1/K) Σ_{j=1}^K r_j(c; x)。集成评分是通过平均各个子评分器的输出得到的。  

### 3.2 互补性  
为了形式化集成如何改善性能,我们定义互补性为子评分器在相关内容上得分不一致的程度。具体而言,设R_j(c) = r_j(c; x)为第j个子评分器在片段c上的评分。我们关注在相关片段y*上的评分。集成评分函数R̄(c) = (1/K) Σ_{j=1}^K R_j(c)。集成后的符合性评分S^{(K)}是校准后y*上R̄(c)的β分位数(具体定义见公式3)。  

### 3.3 提升下限  
互补性的概念正式化为:当且仅当它们在y*上的最小值在不同的正样本上达到时,两个评分器具有互补性,除非R_j在c_i上退化。  

###### 引理1。(集成下限优势)在K=2且β=1时,S^{(2)} = 1/2 (S_max + S_min + Comp),且当Comp > S_max - S_min时,S^{(2)} > S_max。证明见附录C.2 (https://arxiv.org/html/2609.03005#A3.SS2)。  
#### 解释。该引理告诉我们,当两个评分器的平均集成提升下限时,其优势优于两个单独组件:互补性必须超过下限差距。因此,设计良好的集成意味着寻找最低分正样本不重合的评分器。关于内容片段级别的示例,见附录C.2 (https://arxiv.org/html/2609.03005#A3.SS2.SSS0.Px1),展示了互补性条件Comp > S_max - S_min在实践中如何实现。  

### 3.4 收益递减  
*我们提出:添加另一个R_{K+1}何时能提升集成下限S^{(K)}?*  
我们研究δ^K(c) ≡ R̄^{(K)}(c; x) - S^{(K)},即c的平均相关性评分与集成下限之间的差值,对于每个c ∈ y*,该差值为非负。  

###### 命题1。(O(1/K)收益递减)我们有S^{(K+1)} > S^{(K)}当且仅当对于每个c ∈ y*,R_{K+1}(c) > S^{(K)} - K δ^K(c)。当条件成立时,0 < S^{(K+1)} - S^{(K)} ≤ 1/(K+1)。当添加更多子评分器时,收益递减。  

对于分位数β < 1,类似的条件和界限成立(引理2 (https://arxiv.org/html/2609.03005#Thmlemma2))。换句话说,当至少⌈β|y*|⌉个正片段满足R̄(c) > S_{β,max}时,下限得到提升。对于一般K,向现有集成添加一个额外的评分函数将在至少⌈β|y*|⌉个正片段满足R_{K+1}(c) > S_β^{(K)} - K δ_β^K(c)时给出S_β^{(K+1)} > S_β^{(K)},其中差值现在为δ_β^K(c) = R̄^{(K)}(c; x) - S_β^{(K)}。在这种情况下,改进上界为(1 - S_β^{(K)})/(K+1),这再次表明了O(1/K)收益递减(命题2 (https://arxiv.org/html/2609.03005#Thmproposition2))。  

## 4 方法 - 符合相关性  
在第3节 (https://arxiv.org/html/2609.03005#S3)的理论框架指导下,我们将多个机制上不同的ICL策略组合成一个平均评分函数R̄,端到端流程总结在算法1 (https://arxiv.org/html/2609.03005#alg1)中。本节定义数据分割(第4.1节 (https://arxiv.org/html/2609.03005#S4.SS1))、基于ICL的相关性函数(第4.2节 (https://arxiv.org/html/2609.03005#S4.SS2))以及ICL选择策略(第4.3节 (https://arxiv.org/html/2609.03005#S4.SS3))。我们的参考实现的设计和超参数在所有数据集和任务的主要结果中保持固定,关键消融实验见第5.3节 (https://arxiv.org/html/2609.03005#S5.SS3)。  

算法1 使用K评分器集成进行内容选择的符合性校准和预测。  
1: 输入:ICL池 Π,校准集 𝒞,K个ICL选择策略 σ_j,ICL数量 k,欠覆盖风险 α,召回目标 β  
2: 在𝒞上进行离线校准  
3: 对于所有x ∈ 𝒞 do  
4:   对于所有j ∈ {1,...,K} do  
5:     ICL_j ← σ_j(Π, x)  ⊳ 抽取k个示例  
6:     R_j(·, x) ← LLM(·, x, ICL_j)  ⊳ 定义评分器  
7:   结束循环  
8:   R̄(·, x) ← (1/K) Σ_{j=1}^K R_j(·, x)  ⊳ 平均集成  
9:   使用R̄(·, x)计算S_β(x)(公式3 (https://arxiv.org/html/2609.03005#S2.E3))  
10: 结束循环  
11: q̂ ← ⌊α(n+1)⌋ 阶统计量  
12:   {S_β(x) : x ∈ 𝒞}  ⊳ 召回式符合性分位数  
13: 在测试文档x上进行在线预测  
14: 对测试文档x重复步骤3-7以获得R̄(·, x)  
15: 输出:{c ∈ x : R̄(c; x) ≥ q̂}  

### 4.1 数据分割  
我们实验使用的数据集见表2 (https://arxiv.org/html/2609.03005#S4.T2)。每个数据集被划分为三个子集:池Π提供ICL示例,校准集𝒞用于设置符合性阈值q̂,保留的测试集用于所有报告的结果。对于单意图数据集,我们使用|Π|=50,对于多意图数据集,则为每个意图20个示例;|𝒞|=n=100,其余分配给测试集。校准和测试集从可用数据中随机均匀抽取,以满足可交换性假设;对于多意图数据集(PUMA、SubSumE、ContractNLI、Evidence Inference),Π按意图分层,因此每个策略的k个ICL示例从与测试样本相同意图子池的Π中抽取。标签预算范围从150到最多440(具有17个意图的ContractNLI)。  

### 4.2 基于ICL的相关性评分  
相关性评分函数R(c; x) ∈ [0,1]为文档x的每个定义的内容片段c(例如每个句子)分配一个分数。我们使用LLM实例化R,但不是使用包含为给定任务定义何为相关的任务特定提示(例如描述构成重要摘要信息的内容)的手工提示,而是仅使用从Π中采样的k个ICL示例,每个示例都是带有内容片段和二元相关性标签的已标注文档。避免手工提示工程意味着相同的评分函数可以应用于从抽取式QA到摘要生成再到PII检测等各种内容选择任务。ICL提示构建的详细信息,如提示格式、窗口压缩、可选任务提示和输出模式,在附录E (https://arxiv.org/html/2609.03005#A5)中有详细说明。  

表2:数据集统计。完整处理细节见附录D (https://arxiv.org/html/2609.03005#A4)。  

### 4.3 ICL示例选择策略  
基于第3节 (https://arxiv.org/html/2609.03005#S3)中描述的评分集成的潜在优势,我们的目标是设计多样化的相关性评分函数R_j,这些函数可以通过平均集成为R̄^{(K)},然后进入符合性评分S_β^{(K)}用于内容选择(公式3 (https://arxiv.org/html/2609.03005#S2.E3))。我们开发了四种不同的ICL选择策略来生成这些子评分器。这些策略的选择是为了使评分器之间具有互补性,即它们在相关片段上的最差表现出现在不同的样本上。策略包括:  
1. **随机基线**:从池Π中均匀随机抽取k个示例。  
2. **难度导向**:选择那些在先前评分器(从随机基线开始)上得分较高(较难)的示例。  
3. **多样性导向**:选择与已选示例在嵌入空间中距离最远的示例,以最大化覆盖范围。  
4. **任务无关提示**:在ICL提示中加入一个固定的、通用的任务描述(如“此任务涉及选择相关信息”),而不是特定于任务的指令。  
每个策略生成一个评分器R_j。集成评分R̄是这些评分器的平均。校准和预测随后使用R̄进行。

相似文章

超越表面统计:通过内部表示实现LLM鲁棒共形预测

arXiv cs.CL

本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。

面向视觉与语言模型的经验贝叶斯共形预测

arXiv cs.LG

本文介绍了一种经验贝叶斯共形预测框架,该框架使用 r 值将评分变异性纳入非一致性得分中,从而提升排序稳定性并缩减集合大小,同时保持对视觉与语言模型的覆盖。

自巩固语言模型:从上下文中持续整合知识

arXiv cs.CL

本文介绍了自巩固语言模型(SCoL),这是一种利用元强化学习将当前上下文写入模型权重以实现持续知识整合的框架。实验表明,在问答任务和长上下文巩固任务中,该方法在知识获取和保留方面均优于基线方法。

多样本思维链上下文学习:让上下文学习真正学会

Hugging Face Daily Papers

本文研究了推理任务的多样本思维链上下文学习,揭示了标准扩展规则并不适用,并提出了Curvilinear Demonstration Selection (CDS)方法以改进示例排序,最高可获得5.42个百分点的性能提升。