评估基于BERT的模型在问答任务中的可靠性
摘要
本文评估了基于BERT的问答模型(RoBERTa、ALBERT、DistilBERT)在蒙特卡洛Dropout和输入改写条件下的可靠性,发现RoBERTa更为一致,并验证了MCD作为可靠性指标的有效性。
arXiv:2608.10806v1 公告类型:新
摘要:大型语言模型的可靠性估计在许多情况下与其准确性同样重要,因为可靠的模型更值得信赖、更稳健,并且更适合实际应用。自然语言处理(NLP)的近期进展,特别是基于Transformer架构的进展,显著加速了各种NLP任务的进步。本研究聚焦于基于Transformer的问答(QA)模型的可靠性,特别是BERT模型及其变体(RoBERTa、ALBERT、DistilBERT)。这些仅编码器的预训练Transformer在可视为分类任务的QA任务中展现了显著的准确性。然而,其可靠性仍未得到充分探索。本研究通过评估四种基于BERT的模型在两种条件下的响应稳定性来评估其可靠性:(1)通过蒙特卡洛Dropout(MCD)引起的内部模型变化;(2)通过改写引起的输入扰动。使用SQuAD和QuAC数据集,我们研究了Dropout率如何影响预测一致性,以及词汇变化是否影响答案稳定性。我们的发现表明,RoBERTa保持了更高的可靠性,而ALBERT和DistilBERT表现出显著的不一致性。统计分析证实,在预测期间启用MCD不会干扰推理动态,验证了其作为可靠性指标的有效性。这些发现强调了在QA模型中评估准确性和稳定性的重要性,以确保在实际应用中的稳定性。
查看缓存全文
缓存时间: 2026/08/12 08:37
# 评估基于BERT的模型在问答任务中的可靠性 来源:https://arxiv.org/html/2608.10806 Pooja Yadav 电子邮件:[email protected] 印度拉贾斯坦邦斋浦尔马拉维亚国家理工学院数学系 Priyanka Harjule Basant Agarwal 印度拉贾斯坦邦基申格尔中央大学计算机科学与工程系 Marko Robnik Šikonja 通讯作者。电子邮件:[email protected] 斯洛文尼亚卢布尔雅那大学计算机与信息科学学院 **摘要:**大型语言模型的可靠性估计在许多情况下与其准确性同等重要,因为可靠的模型更值得信赖、更稳健,也更适合实际应用。近年来,自然语言处理(NLP)的进展,尤其是基于Transformer架构的进展,显著加速了各类NLP任务的发展。本研究聚焦于基于Transformer的问答(QA)模型的可靠性,特别是BERT模型及其变体(RoBERTa、ALBERT、DistilBERT)。这些仅包含编码器的预训练Transformer模型在可视为分类任务的QA任务中表现出显著的准确性。然而,它们的可靠性仍未得到充分探索。本研究通过评估两种条件下的响应稳定性来评估四种基于BERT的模型的可靠性:(1)通过Monte Carlo Dropout(MCD)引入的内部模型变化,以及(2)通过释义引入的输入扰动。利用SQuAD和QuAC数据集,我们研究了dropout率如何影响预测一致性,以及词汇变化是否会影响答案稳定性。我们的研究发现,RoBERTa保持了更高的可靠性,而ALBERT和DistilBERT则表现出显著的不一致性。统计分析证实,在预测期间启用MCD不会干扰推理动态,验证了其作为可靠性指标的有效性。这些发现强调了在QA模型中评估准确性和稳定性两者的重要性,以确保在实际应用中的稳定性。 **关键词:**可靠性估计,Monte Carlo Dropout,自然语言处理(NLP),BERT模型,问答 ## 1 引言 近年来,自然语言处理(NLP)领域取得了显著进展。自然语言处理(NLP)的快速发展具有变革性,推动了能够以显著准确性处理、理解和生成人类语言的智能系统的发展。这些进展不仅提升了基于语言的应用程序的效率,也扩展了机器可以处理的任务范围,从基本文本处理到复杂对话。这一进展的核心是Transformer架构的引入,该架构通过采用自注意力机制[[28 (https://arxiv.org/html/2608.10806#bib.bib5)]]有效捕获复杂的语言模式和上下文依赖关系,重新定义了机器学习模型的能力。这些架构以其可扩展性和适应性为特征,在广泛的NLP任务中树立了新的基准。此外,基于Transformer的模型的稳健性和多功能性使其成为推进研究和实际应用(如医疗保健、客户支持和信息检索)不可或缺的工具。它们建模双向上下文和管理长距离依赖的能力已在许多NLP任务中实现了突破[[18 (https://arxiv.org/html/2608.10806#bib.bib20)]]。 在众多任务中,问答(QA)已成为评估语言模型理解和推理能力的关键基准。基于Transformer的表示架构,如基于BERT的模型,已在各种数据集上取得了显著的准确性。QA系统对于虚拟助手、客户支持系统和自动知识检索等应用至关重要。多位作者[[8 (https://arxiv.org/html/2608.10806#bib.bib15),12 (https://arxiv.org/html/2608.10806#bib.bib16)]]专注于通过架构创新、预训练策略和各种优化技术来提升性能。鉴于其相对较好的计算效率和令人印象深刻的性能,类似BERT的模型在许多情况下是完成此任务的合适候选。然而,传统评估指标虽然提供了性能的定量度量,但往往呈现的模型能力图景并不完整。准确率等指标主要反映模型在理想条件下的表现,但未能捕捉模型对不确定性、内部随机变化或输入修改的反应。由于现实世界的应用往往涉及不可预测的条件,评估模型如何应对此类变化以确保可靠性和一致性至关重要。 本研究的动机源于以下观察:尽管基于BERT的QA模型具有较高的准确性,但在受控变化下其可靠性和预测稳定性尚未得到系统探索。本研究通过其方法论框架与其他研究区分开来。它引入了一种可靠性评估方法,系统性地考察BERT变体在随机变化和输入扰动下的一致性和稳定性。该分析研究了两种关键扰动——内部随机变化和输入修改——的影响,以识别模型行为中的潜在弱点。所考虑的模型利用基于Transformer的架构,通过有效捕获语言细微差别和上下文来提供高准确性。BERT模型已在包括QA在内的各种任务中表现出稳定的性能[[6 (https://arxiv.org/html/2608.10806#bib.bib26)]]。2022年,Miok等人[[17 (https://arxiv.org/html/2608.10806#bib.bib7)]]证明BERT在分类任务中可以相对可靠。Liu等人[[14 (https://arxiv.org/html/2608.10806#bib.bib27)]]证明RoBERTa通过优化训练优于BERT,在SQuAD和GLUE基准上取得了更高的准确率。Lan等人[[10 (https://arxiv.org/html/2608.10806#bib.bib28)]]观察到ALBERT在QA任务中以更少的参数取得了与BERT相当或更好的性能。虽然它们在准确率方面的性能已使用各种数据集(如SQuAD、TriviaQA、WikiQA和QuAC)在文献中得到了评估和记录[[20 (https://arxiv.org/html/2608.10806#bib.bib1),21 (https://arxiv.org/html/2608.10806#bib.bib3)]],但仍有必要评估其可靠性。本研究旨在通过考察在QA任务中表现一致的BERT模型及其变体在变化条件下是否同样可靠来填补这一空白。 在问答语境下,可靠性指的是当模型配置或输入受到受控扰动时,模型对输入查询生成答案的一致性。在NLP语境中,输入变化指的是输入发生修改,例如使用替代短语、同义词或添加噪声。该过程通过检查模型在受控变化下的稳定性并评估产生输出的变异性来评估模型的可靠性。在本研究中,我们通过受控改变模型内部配置和输入变化来考察基于BERT的QA模型的可靠性,并分析生成输出的变化。这种更广泛的评估提供了对模型稳定性和可靠性的更深入理解。可靠性通过分析当模型本身或提供的输入发生微小改变时模型生成输出的方差来量化,确保对其稳定性进行全面评估。 本研究主要聚焦于: 1. 评估四种BERT模型变体——RoBERTa、BERT-Base、DistilBERT和ALBERT——在问答任务中的可靠性。 2. 研究模型配置变化和输入变化如何影响生成答案的一致性。 3. 使用两个数据集SQuAD(高准确率)和QuAC(较低准确率)来考察模型准确性与可靠性之间的关系。 4. 为BERT变体的稳定性提供见解,有助于开发更稳定的NLP系统。 本文分为五个部分。第[2](https://arxiv.org/html/2608.10806#S2)节介绍了该领域的相关工作。第[3](https://arxiv.org/html/2608.10806#S3)节概述了研究方法,包括研究中使用的数据集详细信息。第[4](https://arxiv.org/html/2608.10806#S4)节报告了分析获得的结果,随后第[5](https://arxiv.org/html/2608.10806#S5)节对模型无法回答的实例进行了简要分析。最后,第[6](https://arxiv.org/html/2608.10806#S6)节深入讨论这些发现,第[7](https://arxiv.org/html/2608.10806#S7)节总结研究,概述关键见解和影响。 ## 2 相关工作 Rawat和Samant[[25 (https://arxiv.org/html/2608.10806#bib.bib2)]]对用于问答的Transformer模型进行了详细分析,重点关注BERT、ALBERT、RoBERTa、XLNet、DistilBERT、Electra和Pegasus。他们使用SQuAD2数据集,证明了Transformer模型(如HuggingFace的BERT QA模型)在从大型文档中提取答案方面优于传统的“词袋”方法。Van Aken等人[[27 (https://arxiv.org/html/2608.10806#bib.bib14)]]考察了包括针对问答(QA)微调的各种LLM(如BERT),以探索它们如何转换token向量来找到正确答案,并对隐藏状态进行逐层评估以提取有价值的信息。Nassiri和Akhloufi[[19 (https://arxiv.org/html/2608.10806#bib.bib4)]]对基于文本的QA系统中的Transformer模型进行了全面综述,将架构分为编码器、解码器和编码器-解码器。他们的研究还强调了QA数据集、系统架构和评估方法的趋势,并强调了简化Transformer模型实现的重要性。 Ozkurt[[20 (https://arxiv.org/html/2608.10806#bib.bib1)]]探索了各种基于Transformer的模型在问答中的优势,并确定ALBERT是表现最好的模型,在SQuAD v2数据集上实现了令人印象深刻的86.85%精确匹配和89.91%的F1分数。类似地,Kate Pearce和Tiffany Zhan[[21 (https://arxiv.org/html/2608.10806#bib.bib3)]]在不同QA数据集上对Transformer模型进行了综合研究。他们的研究发现RoBERTa和BART预训练模型始终优于其他模型,而他们自定义的BERT-BiLSTM模型在F1分数上超过了基线BERT模型。 尽管这些模型具有较高的准确性,但其可靠性仍未得到充分探索。现有文献探索了评估语言模型可靠性的各种方法[[29 (https://arxiv.org/html/2608.10806#bib.bib6),23 (https://arxiv.org/html/2608.10806#bib.bib8),22 (https://arxiv.org/html/2608.10806#bib.bib11)]],且方法适应特定问题领域。Miok等人[[16 (https://arxiv.org/html/2608.10806#bib.bib9)]]强调了具有Monte Carlo Dropout的LSTM模型在增强分类任务(仇恨言论分类)可靠性方面的有效性。在另一项研究中,Miok等人[[17 (https://arxiv.org/html/2608.10806#bib.bib7)]]评估了具有Monte Carlo Dropout(MCD BERT)的LSTM和BERT变体的可靠性。他们发现MCD BERT变体,包括BERT-base和mBERT,在分类方面特别可靠。 先前的研究广泛强调了各种BERT模型变体可以被设计和优化用于不同的自然语言处理(NLP)任务,展示了它们在广泛实际应用中的多功能性和适应性。其中,RoBERTa、BERT-Base、DistilBERT和ALBERT已被认为是问答(QA)任务中广泛采用的模型[[8 (https://arxiv.org/html/2608.10806#bib.bib15),12 (https://arxiv.org/html/2608.10806#bib.bib16)]]。最近的研究还探索了在问答和推荐导向应用中使用大型语言模型(LLM)。诸如LE-DLCM之类的基于LLM的推荐框架表明,大型语言模型可以改善个性化推荐任务中的语义理解和上下文推理[[15 (https://arxiv.org/html/2608.10806#bib.bib34)]]。[[30 (https://arxiv.org/html/2608.10806#bib.bib35),13 (https://arxiv.org/html/2608.10806#bib.bib36)]]同样研究了使用LLM进行对话推荐和生成性推理,主要侧重于提高推荐质量、用户交互和语言模型的生成能力。[[26 (https://arxiv.org/html/2608.10806#bib.bib37)]]强调了LLM越来越多地集成到推荐流水线中,用于语义表示学习、对话交互和上下文感知的推荐策略。这些发展表明LLM驱动的语义推理在现代基于NLP的推荐和问答相关系统中作用日益增强,同时也激发了对问答模型进行系统性可靠性评估框架的需求。 ## 3 实验与方法 本节概述了本研究中使用的数据集以及用于评估选定模型可靠性的方法。为了全面评估可靠性,分析中采用了两种方法:一种是通过诱导模型内部配置变化来评估可靠性,另一种是通过引入输入变化。为了在保持输入不变的情况下考察内部配置变化下的可靠性,在预测阶段向模型输出中引入随机性,从而可以评估生成的答案是否在语义上仍然与正确答案相似。这有助于评估模型的可靠性。此外,通过在一定模型配置下修改输入来评估可靠性,以考察模型是否优先考虑句法结构而非语义理解。具体来说,使用预训练的释义模型生成输入的释义版本,并观察对模型响应的影响。该分析有助于确定模型是否在轻微词汇变化下仍保持答案一致性。 在工作中,可靠性指的是在受控扰动下模型预测的一致性。所提出的框架通过考察基于Transformer的问答模型在变化条件下是否继续生成语义一致的答案来评估可靠性,这些变化要么通过Monte Carlo Dropout在模型内部引入,要么通过释义问题在输入层面引入。分析生成输出的变化,以评估模型在受控扰动设置下预测行为的一致性和稳定性。 ### 3.1 数据描述 为了评估BERT模型在问答任务中的可靠性,我们选择了两个数据集:Stanford Questi
相似文章
选择性问答中的渐近风险校准
本文提出了 A-CRC-QA,一种用于选择性问答的事后校准框架,通过渐近风险校准控制已接受答案中的错误率,并在 CoQA 和 MedMCQA 上展示了更好的可靠性与保留率之间的权衡。
面向Agentic RAG管道的贝叶斯不确定性传播:关于多跳问答的概念验证研究
本文提出了一种面向Agentic RAG系统的贝叶斯不确定性传播框架,并在使用GPT模型的多跳问答基准上进行了评估,显示出在工业决策支持中监控可靠性的潜力。
Persona Non Grata: LLM角色驱动生成在MCQA中在不同维度上不稳定
本文研究了大型语言模型在多选题问答(MCQA)任务中角色驱动生成的不稳定性,提出了三个衡量指标来评估模型族、模型规模和问题域的性能、结果和正确性稳定性。研究发现,不稳定性的变化具有一致性,数学和常识问题表现出更大的不稳定性,并且任务提示格式比其他超参数(如温度)引入了更多的不稳定性。
基于推理的不确定性估计:LLM在多语言和跨语言MCQA性能中的大规模研究
本文对LLM在22种语言中的九种不确定性估计方法进行了大规模评估,发现提示模型用英语推理可改善低资源语言的不确定性估计,且方法的选择取决于模型规模。
AB-RAG:自适应预算检索增强生成用于可靠问答
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。