信心源于经验:从推理到智能体的经验性置信度估计

Hugging Face Daily Papers 论文

摘要

本文介绍了XConf,一种经验性置信度估计方法,该方法利用模型的过去经验,以提升语言模型在推理、编码和智能体任务中的置信度校准。

可靠的置信度估计对于语言模型的可信部署越来越关键:一个校准的输出正确概率估计决定了要发布什么、要升级什么、要重试什么。然而,现有的置信度估计器共享一个设计前提:它们仅读取当前的推理过程,无论是通过内省、评分其标记概率,还是重新采样。我们认为当前的推理不是置信度的充分基础。我们提出XConf(经验性置信度):与模型的累积经验一起估计置信度。经验被存储为模型自身分级过去事件的记录,每个事件包含任务、模型的反思、其陈述的置信度、结果,以及在分级到达后写下的教训。对于新任务,XConf的召回阶段检索具有类似任务和类似陈述置信度的过去事件,并读取其历史成功率;其反思阶段向模型展示此记录,让其命名其反复出现的失败模式,并重新陈述一个现在基于其自身记录的置信度。我们的估计器是格式通用的,不需要访问logit或更新权重,并且只需一次答案生成。在涵盖推理、编码、多模态问答和交互式智能体的九个基准测试中,以及来自三个家族的四个模型中,XConf在24次比较中有23次在区分度(AUROC)上击败或匹配十样本自我一致性,具有更低的校准误差(ECE),且生成成本仅为十分之一。用于选择性预测时,放弃10%最不自信的事件可将智能体任务的交付成功率提高多达8.7个百分点。因此,我们将经验性置信度估计视为未来通用置信度估计的新范式。
查看原文
查看缓存全文

缓存时间: 2026/09/17 06:52

论文页面 - 置信源于经验:从推理到智能体的经验性置信度估计

来源:https://huggingface.co/papers/2609.17708

摘要

可靠的置信度估计对于语言模型的可信部署日益关键:经过校准的输出正确概率估计决定了哪些结果可以直接发布、哪些需要上报、哪些需要重试。然而,现有的置信度估计器共享一个设计前提:它们仅关注当前推理过程,无论是通过内省、评分其token概率还是对其重采样。我们认为当前推理过程不足以作为置信度判断的充分基础。我们提出XConf(经验置信度):将置信度估计与模型的积累经验相结合。经验以模型自身评分的过往经验记录形式存储,每条记录包含任务、模型的反思、其声明的置信度、结果以及根据评分生成的经验教训。面对新任务时,XConf的召回阶段会检索相似任务且具有相似声明置信度的历史经验,并参考其历史成功率;其反思阶段会向模型展示此记录,让其识别反复出现的失败模式,并参考自身历史表现重新评估当前的置信度。我们的估计器具有格式通用性,无需访问逻辑值或权重更新,仅需一次答案生成。在涵盖推理、编程、多模态问答和交互式智能体的九个基准测试中,以及三个模型家族的四个模型上,XConf在24项对比中的23项上超越或匹配了十样本自一致性在判别力(AUROC)上的表现,同时校准误差(ECE)更低,生成成本仅为十分之一。在选择性预测应用中,对10%最低置信度经验放弃预测,可将智能体任务上的实际成功率最高提升8.7个百分点。因此,我们视经验性置信度估计为未来通用置信度估计的新范式。

查看 arXiv 页面 (https://arxiv.org/abs/2609.17708) | 查看 PDF (https://arxiv.org/pdf/2609.17708) | 项目页面 (https://caiqizh.github.io/xconf/) | GitHub (https://github.com/caiqizh/xconf) | 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.17708)

通过智能体获取此论文:

hf papers read 2609.17708

没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型:0

暂无模型链接此论文。

在模型 README.md 中引用 arxiv.org/abs/2609.17708,即可从此页面链接到该模型。

引用此论文的数据集:0

暂无数据集链接此论文。

在数据集 README.md 中引用 arxiv.org/abs/2609.17708,即可从此页面链接到该数据集。

引用此论文的 Space:0

暂无 Space 链接此论文。

在 Space README.md 中引用 arxiv.org/abs/2609.17708,即可从此页面链接到该 Space。

包含此论文的收藏夹:0

暂无收藏夹包含此论文。

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

CALIBER:语言模型中推理前后的置信度校准

arXiv cs.CL

本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。