教导模型用语言表达其不确定性

OpenAI Blog 论文

摘要

OpenAI研究人员展示了GPT-3可以学会用自然语言表达关于其答案的标定不确定性,而无需使用模型logits。他们引入了CalibratedMath基准套件来评估这种能力。这种方法在分布漂移下表现出强劲的泛化能力,代表了模型首次表达关于其自身预测的良好标定口头不确定性的证据。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:46

# 教导模型用语言表达其不确定性 来源: https://openai.com/index/teaching-models-to-express-their-uncertainty-in-words/ 我们展示了 GPT-3 模型可以学会用自然语言表达对自己答案的不确定性——无需使用模型对数。当给定一个问题时,模型既生成答案,也生成置信水平(例如"90% 置信度"或"高置信度")。这些水平映射到经过很好校准的概率。该模型在分布偏移下也保持适度的校准,并对其自己答案中的不确定性敏感,而不是模仿人类示例。据我们所知,这是首次证明模型能够用自然语言表达关于自己答案的经过校准的不确定性。为了测试校准,我们引入了 CalibratedMath 任务套件。我们比较了用语言表达的不确定性("口头概率")与从模型对数中提取的不确定性的校准。两种不确定性都能够在分布偏移下泛化校准。我们还提供证据表明,GPT-3 泛化校准的能力取决于与其答案上的认识论不确定性相关的预训练潜在表征。

相似文章

教人工智能模型说“我不确定”

MIT News — Artificial Intelligence

MIT CSAIL 研究人员提出 RLCR 方法,在强化学习中引入布雷尔分数(Brier scores),训练 AI 模型输出经过校准的置信度估计,在显著降低过度自信的同时,不牺牲准确率。

概率校准是大语言模型中的一项可训练能力

arXiv cs.CL

本文研究了语言模型的概率校准能力是否可以通过微调得到提升,并在12种模型上比较了软目标和硬目标两种方法。结果表明,校准能力是可以训练的,但有时会导致下游算术推理能力的下降。

从语言模型轨迹中读取校准后的不确定性

arXiv cs.LG

本文介绍了一种校准语言模型不确定性的方法,该方法从每层MLP更新轨迹中提取十一个尺度不变几何特征,并将其输入稀疏线性探测器,在选择性弃权条件下比MSP表现更好,AURC分数最高提升21点。

CALIBER:语言模型中推理前后的置信度校准

arXiv cs.CL

本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。