信心源于经验:从推理到智能体的经验性置信度估计
摘要
本文介绍了XConf,一种经验性置信度估计方法,该方法利用模型的过去经验,以提升语言模型在推理、编码和智能体任务中的置信度校准。
查看缓存全文
缓存时间: 2026/09/17 06:52
论文页面 - 置信源于经验:从推理到智能体的经验性置信度估计
来源:https://huggingface.co/papers/2609.17708
摘要
可靠的置信度估计对于语言模型的可信部署日益关键:经过校准的输出正确概率估计决定了哪些结果可以直接发布、哪些需要上报、哪些需要重试。然而,现有的置信度估计器共享一个设计前提:它们仅关注当前推理过程,无论是通过内省、评分其token概率还是对其重采样。我们认为当前推理过程不足以作为置信度判断的充分基础。我们提出XConf(经验置信度):将置信度估计与模型的积累经验相结合。经验以模型自身评分的过往经验记录形式存储,每条记录包含任务、模型的反思、其声明的置信度、结果以及根据评分生成的经验教训。面对新任务时,XConf的召回阶段会检索相似任务且具有相似声明置信度的历史经验,并参考其历史成功率;其反思阶段会向模型展示此记录,让其识别反复出现的失败模式,并参考自身历史表现重新评估当前的置信度。我们的估计器具有格式通用性,无需访问逻辑值或权重更新,仅需一次答案生成。在涵盖推理、编程、多模态问答和交互式智能体的九个基准测试中,以及三个模型家族的四个模型上,XConf在24项对比中的23项上超越或匹配了十样本自一致性在判别力(AUROC)上的表现,同时校准误差(ECE)更低,生成成本仅为十分之一。在选择性预测应用中,对10%最低置信度经验放弃预测,可将智能体任务上的实际成功率最高提升8.7个百分点。因此,我们视经验性置信度估计为未来通用置信度估计的新范式。
查看 arXiv 页面 (https://arxiv.org/abs/2609.17708) | 查看 PDF (https://arxiv.org/pdf/2609.17708) | 项目页面 (https://caiqizh.github.io/xconf/) | GitHub (https://github.com/caiqizh/xconf) | 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.17708)
通过智能体获取此论文:
hf papers read 2609.17708
没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型:0
暂无模型链接此论文。
在模型 README.md 中引用 arxiv.org/abs/2609.17708,即可从此页面链接到该模型。
引用此论文的数据集:0
暂无数据集链接此论文。
在数据集 README.md 中引用 arxiv.org/abs/2609.17708,即可从此页面链接到该数据集。
引用此论文的 Space:0
暂无 Space 链接此论文。
在 Space README.md 中引用 arxiv.org/abs/2609.17708,即可从此页面链接到该 Space。
包含此论文的收藏夹:0
暂无收藏夹包含此论文。
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
CALIBER:语言模型中推理前后的置信度校准
本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。
智能体是否知道成功?基于内部表示的智能体置信度校准
本论文提出通过内部表示来校准智能体系统的置信度,在多轮基准测试中展示了其相对于基线方法的性能提升。
Critic Experience Bank: 自演进的步骤级置信度估计用于LLM Agents
介绍Critic Experience Bank (CEB),一个用于LLM智能体逐步置信度估计的自我演进批评框架,利用过去判断和后果的记忆库来改进校准,无需训练。
记忆与重加权:基于经验记忆与置信度估计增强多智能体辩论
本文提出了R2-MAD,一个通过使用经验记忆和置信度估计来解决共享误解的框架,从而增强大型语言模型中的多智能体辩论,在基准测试中实现持续改进。
ConfidenceBench:评估大型语言模型中的置信度校准
ConfidenceBench是一个新的基准测试,使用Brier分数评估大型语言模型中的口头置信度估计,揭示了准确性和校准之间的分歧,即使是高精度的模型也可能严重校准不良。