标签
This paper empirically studies token-probability-based confidence estimation and calibration for LLMs in mathematical question answering, comparing single-pass and multi-pass estimators and evaluating post-hoc calibration methods.
本文研究金融视觉语言模型在图表与文档理解中的置信度估计,评估了五种LVLM上的七种估计器。研究发现,稀缺的属性是校准而非排序,只有经过训练的探针才能产生可设阈值的分数,从而安全地将任务转交给人工审核。
谷歌的Gemma 4模型已被增强,能够识别自己何时出错,从而提高了其校准和可靠性。
本文介绍了FALCON-Discover,这是一个事后(post-hoc)框架,用于发现模型预测高置信度但错误的区域,将校准重点从总体指标转向样本级的危险故障。
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
本文介绍了CARE-PPO,一种将置信度估计与PPO微调相结合的强化学习框架,用于基于语言的定量预测,使模型能够同时产生准确的数值估计和可靠的置信度信号,并在医疗和金融任务中进行了展示。
介绍Critic Experience Bank (CEB),一个用于LLM智能体逐步置信度估计的自我演进批评框架,利用过去判断和后果的记忆库来改进校准,无需训练。
本文审计了自洽性与跨模型一致性是否是LLM正确性的可靠指标,发现一致性是一个弱的、依赖于场景的代理指标,且前沿模型表现出过度自信。
本文研究了在大型语言模型(LLM)答案生成过程中置信度相关信息的演化,并提出了未来置信度蒸馏方法。该方法利用后解决方案正确性探针生成的教师置信度估计,对前解决方案隐藏表示进行预测器训练,从而实现可靠且样本高效的置信度估计。
SpanUQ 引入了一种轻量级探针,用于大语言模型中的跨度级不确定性量化,采用 DETR 风格的解码器和 Beta 分布混合,实现了优于基于采样的方法的错误定位和更快的推理速度。
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。
ExtractConf是一种用于基于LLM的文档字段提取的置信度估计方法,它通过两种结构不同的调用(字段引导和文档引导)来推导不一致信号,在DocILE发票数据集上实现了0.928的ROC AUC,并为高风险自动化场景提供了可靠的选择性预测能力。
本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。
本文探讨了大语言模型在结构化临床数据上无法识别自身知识局限的问题,提出了一种跨模型归因差异方法来检测认知盲点。该方法结合少样本示例和 SHAP 衍生的特征证据,无需训练即可改进校准性和准确性。
本文解决了评估不确定性下多模态大语言模型的鲁棒检查点选择挑战,提出了一个多阶段框架,整合了精心策划的真实世界数据、基于LLM的判断以及带有置信度估计的排序协议。
本文提出检索增强的语言校准(RALC),一种事后流水线方法,通过将语言置信度建模为分布并使用检索增强重写来校准大语言模型中的置信度信号。它引入了忠实度散度指标,并在多个基准测试中展示了显著改进。
提出逐步置信归因(SCA),一个无需内部访问即可为黑盒大语言模型的推理轨迹分配逐步置信度的框架,利用信息瓶颈原理区分合法变异性与错误。实验表明,SCA能可靠地识别低置信度步骤,并将自纠正成功率相比答案级别反馈提升高达13.5%。
本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。
本文提出一种元认知框架,将LLMs中的监控与推理分离,利用解决前的已知感(feeling-of-knowing)和解决后的学习判断(judgment-of-learning)信号来控制何时信任、重试或聚合答案,在不更新参数的情况下提升文本、代码和多模态基准测试的准确率。