检索主导的抽取式问答中的内在序列似然置信度:两个预设的负例及其归因分析

arXiv cs.CL 论文

摘要

本文评估了检索主导的抽取式问答中的内在序列似然置信度,发现置信度信号不足以用于模型控制,且仅检索在预设标准下就能达到高准确率。

arXiv:2609.19942v1 公告类型:新 摘要:在抽取式文档问答中,问题由包含答案的段落生成,因此检索能恢复任何模式组合可达的92-99.8%的性能,无论其绝对准确率如何,置信度驱动的机制收益甚微。在专业领域语料库上微调一个开放语言模型,会产生一个以其自身置信度作为诱人控制信号的模型:它可以决定哪些查询值得进一步适应,以及哪些答案值得信任。我们在运行前固定的条件下评估了这两种用途,涉及四个7-9B模型系列,其适应仅使封闭书F1提升最多+0.03,两者均失败:在预设的三步迁移预算下,所有四个模型系列的蒸馏触发器,以及单模型试点中的路由与弃权策略。仅检索在我们测试的每个正确性标准下都能恢复最佳组合准确率的92-99.8%,使路由器没有显著收益。相对于该模式,序列似然信号不足——在注册标准下,受试者工作特征曲线下面积为0.65-0.81——在适应前后均如此,标量重校准未改变,且令牌级温度调整也未一致改善。更精细的诊断取决于正确性标准和答案长度;在我们能够测试的三个适应组合中,选择器消融实验显示置信度项在任何种子上都没有统计可检测的下游益处;在Gemma上,移除它使选择器从失败变为通过两个注册标准。可用的成果是一组预设的负例,其依赖关系被明确说明。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:07

# 检索主导式抽取问答中的内在序列似然置信度:两种预设负例及其归因与局限
来源:https://arxiv.org/html/2609.19942  
††脚注:投稿至*Applied Intelligence*(编号APIN-D-26-13306)  
作者:  
**金旼廷** 邮箱:[[email protected]](mailto:[email protected])  
所属机构:韩国科学技术信息研究院(KISTI)大规模人工智能研究中心,地址:韩国大田广域市儒城区大学院路245号,邮编34141  
**成昌旻** 邮箱:[[email protected]](mailto:[email protected])  
所属机构:韩国科学技术信息研究院(KISTI)大规模人工智能研究中心,地址:韩国大田广域市儒城区大学院路245号,邮编34141  
**郭相焕** 邮箱:[[email protected]](mailto:[email protected])  
所属机构:韩国科学技术信息研究院(KISTI)大规模人工智能研究中心,地址:韩国大田广域市儒城区大学院路245号,邮编34141  
**金珢雅** 邮箱:[[email protected]](mailto:[email protected])  
所属机构:韩国科学技术信息研究院(KISTI)大规模人工智能研究中心,地址:韩国大田广域市儒城区大学院路245号,邮编34141  
**崔智英** 邮箱:[[email protected]](mailto:[email protected])  
所属机构:韩国科学技术信息研究院(KISTI)大规模人工智能研究中心,地址:韩国大田广域市儒城区大学院路245号,邮编34141  
**李京河** 邮箱:[[email protected]](mailto:[email protected])  
所属机构:韩国科学技术信息研究院(KISTI)大规模人工智能研究中心,地址:韩国大田广域市儒城区大学院路245号,邮编34141  
所属机构:韩国科学技术大学(UST)应用人工智能学系,地址:韩国大田广域市儒城区嘉正路217号,邮编34113  

###### 摘要  
在问题由包含答案的段落生成的抽取式文档问答中,检索模式可恢复任何模式组合所能达到性能的92-99.8%(无论绝对准确率如何),因此基于置信度的机制收效甚微。将开放语言模型在特定领域语料上微调后,模型自身的置信度成为极具吸引力的控制信号:它既能判断哪些查询值得进一步适配,也能决定哪些答案可信。我们在运行前即确定的评估标准下,对四个7-9B参数规模模型家族(其适配使闭卷F1提升不超过+0.03)检验了这两种用途,结果均告失败:蒸馏触发器在所有四个家族、其预设的三步迁移预算内失效;路由与弃答策略在其单模型试点中同样失败。在所有测试的正确性标准下,仅检索模式就能恢复最佳组合准确率的92-99.8%,使路由器无法获得显著增益。该序列似然信号相对于检索模式显著不足——在注册标准下接收者操作特征曲线下面积仅为0.65-0.81——适配前后均如此,标量重校准无法改变此结论,令牌级温度重缩放也未带来一致改善。更细致的诊断结果依赖于正确性标准与答案长度;在可测试的三个适配组合中,选择器消融实验未显示置信度项在任何种子上带来统计可检测的下游收益;在Gemma模型上,移除该选项使选择器从两项注册标准均未通过变为全部通过。最终成果是一组依赖关系明确的预设负例。  

###### 关键词  
选择性预测、置信度校准、检索增强生成、领域适配、预设评估标准、大语言模型  

## 1 引言  
企业在自有语料上微调开源LLM后,除获得适配权重外,还会得到一个诱人的副产品:模型对自身答案的置信度。两个部署决策自然会依赖该信号:在持续适配阶段,低置信度可标记模型尚未掌握的查询,作为进一步蒸馏的候选;在推理阶段,置信度决定采用何种应答模式(适配参数或检索系统),或何时拒绝回答。两者都将同一种量——内在序列似然分数——作为控制信号,且恰恰在最难以验证的场景中最具吸引力:在缺乏外部真实依据的封闭环境中,使用该信号成本低廉,但信任其结果影响重大。  
本文质询该信号是否值得信赖,评估其操作效用:无需额外模型获得的分数,是否可用于筛选需进一步适配的查询,以及在推理时选择应答模式。该问题无法由已知的未适配模型行为解决:大型模型的已报道校准情况(Kadavath等人,2022)涉及不同规模和评估分布——我们研究的是7-9B开源模型在领域语料上适配前后的表现(第2节)。大量选择性预测文献基于置信度能排序正确性的前提构建路由与弃答机制,但据我们所知,该前提在该模型类别和场景下尚未通过预先确定的标准进行检验。  
因此,我们在运行前确定的标准下评估部署模型置信度的两种用途。测试平台采用企业风格、基于溯源的抽取式文档问答,涵盖两个语料库(第三个作为对比集),并涉及四个7-9B开源模型家族:LLaMA-3.1、Qwen-2.5、Gemma-2和Mistral。第一种用途是蒸馏触发器,通过带置信度的复合评分选择需集中进一步适配的查询;第二种是路由与弃答策略,为每个查询决定由适配参数还是检索系统应答,或何时弃答。触发器对每个家族独立评估,遵循相同预设标准;路由则作为单模型试点。  
需强调一点:本文报告的两次失败并非关于该信号的两类证据;第9节将分离各自指向的方面。预先规范正是负面结论可信的保证,因事后生成的负面结果总难免选择性报告的嫌疑。全文中,“注册”指在对应运行前即提交至版本控制,而非向外部机构登记(在线资源3,第S4节及表S-9)。两种用途均未通过其预设标准——触发器在所有四个家族失效,路由策略在其单模型试点失效。  
相对于0.73-0.85准确率的检索模式,置信度信号强度不足——其“弱”体现在:适配前后,跨组合的受试者工作特征曲线下面积为0.65-0.81(概率尺度上描述性预期校准误差为0.48-0.72),且三种替代内在信号(最小令牌概率、平均熵、Top-1/Top-2概率差)处于相同区间。但失败不能简单归因于信号本身。在注册标准下,触发器选择的查询确实集中于目标领域;而在令牌-F1标准下,五个组合中有四个未能实现此目标,且目标集与“检索正确”的查询集高度重叠,因此我们既不归因于信号,也不为其开脱——除了在三个适配组合中,移除置信度项未导致统计可检测的损失,且在Gemma上使注册选择器从两项标准均未通过变为全部通过(第9.2节)。路由策略劣于始终检索,因为仅检索已能恢复最佳组合准确率的99.3-99.8%,这是任何路由器无法突破的上限。标量重校准无法改变基于排序的结论(仅消除概率尺度偏移),令牌级温度重缩放虽能重排查询,但在T=0.5时未提升任何组合的区分度,在T=2或5时仅少数组合得到改善。  
本文贡献如下:  
1. **对正确性标准稳健的场景特性分析**:在包含性、两种阈值的令牌-F1及完全匹配标准下,检索恢复了最佳组合准确率的92-99.8%(此为比例而非绝对准确率),参数模式在任何标准下最多正确回答3.4%的查询——包括检索失败的子集。  
2. **附带敏感性分析的信号特征描述**:涵盖六种排序与概率尺度指标、适配前后、四种内在信号;在注册标准下区分度弱,在令牌-F1标准下更弱;目标过度表现在注册标准下成立,在令牌-F1下不成立,因此我们不主张因果归因。标量重校准下的排序不变性仅作为合理性检验,不视为贡献。  
3. **预设负例,仅在选择器消融可验证处主张归因**:触发器在所有四个测试家族上未通过观察前确定的标准;路由试点在LLaMA上未通过;两个组合为基础模型回滚后结果;在一个探索性的LLaMA/SciTech组合上,十倍预算反而使性能恶化。  
两项边界约束所有结论的适用范围:第一是场景——检索在结构上占优的抽取式、溯源问答;路由上限是*关于此场景*的发现,基于置信度的路由在检索效果差或不可用时的价值仍是未解的开放问题。第二是信号——结论针对序列级内在置信度(几何平均令牌概率及三种衍生指标),独立训练的评估器不在本研究范围内。  
## 2 相关工作  
### 选择性预测、校准与语言模型置信度  
选择性预测将弃答形式化为带拒绝选项的预测(Geifman与El-Yaniv,2017),通过风险-覆盖率行为评估(El-Yaniv与Wiener,2010);另一研究脉络直接考察神经网络校准(Guo等人,2017),温度缩放是其标准事后修复方法。对于语言模型,Kadavath等人(2022)报告模型在标准基准上对其知识范畴的校准整体合理。我们的测量涉及相似置信度属性但条件不同——在狭窄领域语料上微调并评估的小型开源模型。该信号在适配前后均显微弱(ECE 0.48-0.72,与正确性相关性+0.12至+0.32,跨四个家族与两个语料库;第9节)。我们将其解读为该结论适用范围的约束,而非矛盾(第10.1节)。区别于事后校准研究,我们的结论是排序层面的:第9.4节显示任何标量单调重校准无法改变结论,令牌级重缩放也未一致提升区分度。  

### 超越序列似然的LLM不确定性估计  
另一类研究基于生成行为而非单序列分数估计不确定性:语义不确定性先聚类语义等价样本再测量熵(Kuhn等人,2023),语义熵已应用于幻觉检测(Farquhar等人,2024);模型可被训练表达不确定性(Lin等人,2022)、经提示获得校准置信度(Tian等人,2023),并评估引出置信度的忠实性(Xiong等人,2024);基于采样的一致性检查作为无需参考的可信度验证(Manakul等人,2023),基于自一致性解码(Wang等人,2023);选择性分类提供经典框架(Geifman与El-Yaniv,2017)。这些评估器超出本研究预设范围——我们关注部署可免费获取的内在序列级信号;其在领域适配下的表现未在本研究检验,值得未来探索。  

### 检索与参数模式间的蒸馏  
知识蒸馏(Hinton等人,2015)将行为从教师迁移至学生,扩展至数据集蒸馏(Wang等人,2018)和自蒸馏(Zhang等人,2019);另一脉络将检索与训练(而非推理)整合(Borgeaud等人,2022;Shi等人,2024;Izacard等人,2023)。据我们所知,尚无研究在适配后的企业场景中,通过适配模型自身置信度驱动选择,实现两种*已适配*模式间的闭环交互。第5节的触发器实例化了该设计,我们报告其为未通过自身预设检验的假设。自蒸馏及其相关方法假设模型自身输出可作为可用训练信号;第6与9节测量此假设在本场景适配模型上遭遇的实际表现。  

### 检索与参数应答间的路由  
自适应检索在生成过程中动态决定何时调用检索器:FLARE在生成含低置信度令牌的试探性句子时重新检索(Jiang等人,2023),Adaptive-RAG训练问题复杂度分类器,选择无检索、单步检索或多步检索(Jeong等人,2024)。是否检索可通过反思令牌学习(Asai等人,2024),并与查询实体的知名度关联——检索对较不知名的知识帮助最大(Mallen等人,2023)。模型层面,RouteLLM在偏好数据上训练路由器,将查询分配给更强或更弱的语言模型(Ong等人,2024)。应用研究通过知识图谱扩展检索以增强问答可靠性(Linders等人,2019)……

相似文章

超越Logprobs:一种基于多信号的LLM文档字段提取置信度引擎

arXiv cs.CL

ExtractConf是一种用于基于LLM的文档字段提取的置信度估计方法,它通过两种结构不同的调用(字段引导和文档引导)来推导不一致信号,在DocILE发票数据集上实现了0.928的ROC AUC,并为高风险自动化场景提供了可靠的选择性预测能力。

当检索无济于事:一项大规模生物医学 RAG 研究

arXiv cs.CL

这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。