从评论家到置信度:用于语言定量预测与置信度估计的PPO

arXiv cs.CL 论文

摘要

本文介绍了CARE-PPO,一种将置信度估计与PPO微调相结合的强化学习框架,用于基于语言的定量预测,使模型能够同时产生准确的数值估计和可靠的置信度信号,并在医疗和金融任务中进行了展示。

arXiv:2607.12687v1 公告类型:新 摘要:大型语言模型(LLM)能够根据非结构化输入进行基于语言的定量预测,但仍容易产生幻觉和过度自信的错误,因此关键不仅在于知道模型预测了什么,还在于何时可以信任其预测。我们引入了CARE-PPO,这是一种强化学习框架,它建立了用于不确定性估计的损失预测与演员-评论家PPO微调之间的联系,从而在基于语言的定量预测中实现准确的数值估计和可靠的置信度信号的联合学习。CARE-PPO使用一种定义为预测误差函数的置信度对齐奖励(Confidence-Aligned Reward for Estimation),为演员提供密集的误差感知反馈,同时诱导评论家学习与预测质量对齐的值函数。在推理过程中,我们将评论家重新用作置信度估计器。通过在医疗和金融领域的两个真实世界任务以及两种Qwen-3模型规模(4B和8B)上的实验,CARE-PPO实现了强大的定量预测性能,同时通过评论家生成的置信度估计比基于logit的和口头化的基线方法对齐性显著更好。这些收益在跨领域的现实分布外设置中持续存在,涵盖语言和领域变化。最后,CARE-PPO减少了对通用指令跟随提示的任务特定过拟合,这与强化学习微调相比监督方法具有更广泛的泛化优势是一致的。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# 从批评到自信:基于语言的量化预测与置信度估计的PPO方法 来源:https://arxiv.org/html/2607.12687 Mehak Dhaliwal Rasta Tadayon Andong Hua Haewon Jeong Yao Qin 加州大学圣塔芭芭拉分校 mdhaliwal@ucsb\.edu, yaoqin@ucsb\.edu ###### 摘要 大语言模型能够从非结构化输入进行基于语言的量化预测,但依然容易产生幻觉和过度自信的错误。因此,关键不仅在于知道模型预测了什么,还在于知道何时可以信任其预测。我们引入了CARE-PPO,这是一种强化学习框架,它将用于不确定性估计的损失预测与演员-评论家PPO微调建立联系,从而在基于语言的量化预测中实现准确数值估计与可靠置信度信号的联合学习。CARE-PPO使用一种面向估计的置信度对齐奖励,该奖励定义为预测误差的函数,为演员提供密集的误差感知反馈,同时引导评论家学习一个与预测质量对齐的价值函数。在推理时,我们将评论家重新用作置信度估计器。在两个真实世界的任务(医疗健康和金融)以及两种Qwen-3模型规模(4B和8B)上,CARE-PPO展现了强大的量化预测性能,同时通过评论家产生的置信度估计比基于logit和口头表达的基线方法具有显著更好的对齐性。这些优势在跨领域的现实分布外设置(包括语言和领域转移)下仍然保持。最后,CARE-PPO减少了在通用指令遵循提示上的特定任务过拟合,这与RL微调相比监督方法具有更广泛泛化优势是一致的。 ## 1 引言 近年来,大型语言模型(LLM)的进展表明,它们不仅是强大的语言生成器,还在医疗健康(Hua等人,2024 (https://arxiv.org/html/2607.12687#bib.bib2))、金融(Vedula等人,2025 (https://arxiv.org/html/2607.12687#bib.bib23))和科学分析(Lewkowycz等人,2022 (https://arxiv.org/html/2607.12687#bib.bib86))等领域的量化预测任务中表现出色。然而,LLM仍然容易产生幻觉和过度自信的错误(Achiam等人,2023 (https://arxiv.org/html/2607.12687#bib.bib75)),这个限制在医疗保健和法律等高危领域尤其令人担忧(Dahl等人,2024 (https://arxiv.org/html/2607.12687#bib.bib73); Omar等人,2025 (https://arxiv.org/html/2607.12687#bib.bib72))。例如,LLM在从餐食描述中准确估计碳水化合物方面显示出潜力(Hua等人,2024 (https://arxiv.org/html/2607.12687#bib.bib2)),这项任务对于决定糖尿病患者胰岛素剂量至关重要,而过度自信但错误的碳水化合物估计可能导致严重的血糖后果。因此,在实际部署此类模型不仅需要准确的点估计——在安全关键环境中的用户需要知道模型预测了什么,还要知道何时信任该预测,以便在必要时进行人工干预(Kalai等人,2025 (https://arxiv.org/html/2607.12687#bib.bib79); Tao等人,2024 (https://arxiv.org/html/2607.12687#bib.bib24))。虽然越来越多的研究致力于LLM在分类和开放生成任务中的置信度估计(Geng等人,2024 (https://arxiv.org/html/2607.12687#bib.bib42)),但在基于语言的数值预测设置中,这一点很大程度上仍未得到探索,现有工作主要集中在产生准确的点估计,而忽略了可靠的置信度信号(Tang等人,2024 (https://arxiv.org/html/2607.12687#bib.bib14); Jacobs等人,2024 (https://arxiv.org/html/2607.12687#bib.bib11); Zausinger等人,2024 (https://arxiv.org/html/2607.12687#bib.bib10); Vacareanu等人,2024 (https://arxiv.org/html/2607.12687#bib.bib7))。为了解决这个差距,我们研究基于语言的量化预测与置信度估计,其中LLM通过自然语言推理生成数值估计,并附带反映预测可靠性的置信度信号。 参照说明图1:CARE-PPO概览(面向估计的置信度对齐奖励与PPO)。左侧:训练期间,演员根据输入生成数值预测,使用定义为预测误差函数的置信度对齐奖励进行评估。策略通过使用GAE的PPO进行优化,而评论家被训练为回归到经验收益。右侧:推理时,评论家的价值估计被重新用作演员预测的置信度分数。 具体来说,我们在不确定性估计的损失预测(Gollakota等人,2025 (https://arxiv.org/html/2607.12687#bib.bib80); Lahlou等人,2021 (https://arxiv.org/html/2607.12687#bib.bib87))和LLM的演员-评论家强化学习微调(Schulman等人,2017 (https://arxiv.org/html/2607.12687#bib.bib66); Ouyang等人,2022 (https://arxiv.org/html/2607.12687#bib.bib32))之间建立了一种新颖的联系。先前的研究将模型在给定输入上的预测不确定性表征为预测器在该点上的期望损失,使这个量的估计成为一个损失预测问题(Gollakota等人,2025 (https://arxiv.org/html/2607.12687#bib.bib80); Lahlou等人,2021 (https://arxiv.org/html/2607.12687#bib.bib87))。换句话说,识别预测何时不可靠对应着识别模型何时可能产生高误差。这个视角自然地与PPO的演员-评论家框架(Schulman等人,2017 (https://arxiv.org/html/2607.12687#bib.bib66))联系起来,其中评论家学习一个价值函数来估计从给定状态获得的期望收益(方程3 (https://arxiv.org/html/2607.12687#S3.E3)):当奖励被定义为预测误差的函数时,评论家的价值函数收敛到演员期望误差的估计——将损失预测作为RL训练的自然副产品,而不是事后程序。基于此,我们引入了CARE-PPO(面向估计的置信度对齐奖励与PPO),这是一个用于基于语言量化预测的强化学习框架,它联合训练一个演员通过自然语言推理生成准确的数值估计,同时训练一个评论家,其价值函数充当与预测误差对齐的置信度估计器。我们将奖励设计为预测误差的单调函数,具有双重作用。首先,它提供了一个密集的、误差感知的训练信号,捕捉正确性的程度,并指导演员朝着准确的数值预测方向发展。其次,因为评论家被训练来预测在这种奖励下的收益,它学习了一个与预测质量对齐的价值函数:高值对应低期望误差,而低值对应高期望误差。这使得评论家自然地充当置信度估计器,而不需要显式的置信度监督。我们在图1 (https://arxiv.org/html/2607.12687#S1.F1)中说明了这个框架,并在下面总结我们的主要贡献。 - **问题与洞察**。我们研究基于语言的量化预测与置信度估计,并在损失预测理论与演员-评论家RL微调之间建立联系:当奖励与预测误差对齐时,PPO评论家自然学会估计演员的期望损失,从而在无需显式监督的情况下实现可靠的置信度估计。 - **CARE-PPO**。我们提出了CARE-PPO,一个基于PPO的演员-评论家框架,使用面向估计的置信度对齐奖励。通过将奖励定义为预测误差的单调函数,CARE-PPO为演员提供密集的误差感知反馈,同时使评论家在推理时充当与误差对齐的置信度估计器。 - **全面评估**。我们在跨Qwen-3 4B和8B模型(Yang等人,2025 (https://arxiv.org/html/2607.12687#bib.bib89))的两个真实世界量化预测任务(医疗健康和金融)上评估了CARE-PPO,研究了高斯和线性两种奖励公式。CARE-PPO在实现有竞争力的预测性能的同时,显著提升了置信度对齐性,优于基于logit和口头表达的基线方法。 - **鲁棒性和任务意识**。我们展示了CARE-PPO的置信度对齐优势在现实的分布外设置(包括语言和领域转移)下得以保持。我们进一步展示了CARE-PPO减少了在通用指令遵循查询上的特定任务过拟合,有助于在目标预测设置之外保持通用行为。 ## 2 相关工作 ##### 基于语言量化预测中的LLM。先前关于将LLM应用于基于语言的量化预测的研究主要遵循三个方向:(i) 使用LLM派生的表示作为下游模型的固定输入特征(Imperial,2021 (https://arxiv.org/html/2607.12687#bib.bib13); Tang等人,2024 (https://arxiv.org/html/2607.12687#bib.bib14)),(ii) 通过针对特定任务的微调来使LLM直接产生数值预测(Jacobs等人,2024 (https://arxiv.org/html/2607.12687#bib.bib11); Zausinger等人,2024 (https://arxiv.org/html/2607.12687#bib.bib10)),以及(iii) 利用上下文学习从自然语言提示中进行零样本或少样本数值估计(Vacareanu等人,2024 (https://arxiv.org/html/2607.12687#bib.bib7); Gopali等人,2025 (https://arxiv.org/html/2607.12687#bib.bib15))。虽然基于特征的方法可以很有效,但它们主要将LLM视为编码器,因此没有利用其生成接口进行交互使用或自然语言解释。同时,微调和上下文学习都强调点估计,而非丰富的语言生成。在本研究中,我们重点在于微调LLM以进行基于语言的量化预测,同时保留其生成和对话能力,以实现透明性和交互性。 ##### LLM中的置信度估计。LLM的日益普及增加了对与答案正确性对齐的可靠置信度估计的需求。先前的研究大致可以分为黑盒和白盒方法,取决于是否访问内部模型状态(Geng等人,2024 (https://arxiv.org/html/2607.12687#bib.bib42))。黑盒方法仅利用模型输出来推断置信度。这些方法包括置信度口头表达方法(Lin等人,2022 (https://arxiv.org/html/2607.12687#bib.bib17); Xiong等人,2023 (https://arxiv.org/html/2607.12687#bib.bib16); Tian等人,2023 (https://arxiv.org/html/2607.12687#bib.bib41); Yang等人,2024 (https://arxiv.org/html/2607.12687#bib.bib18)),它们通常遭受系统性过度自信(Wei等人,2022 (https://arxiv.org/html/2607.12687#bib.bib31); Mei等人,2025 (https://arxiv.org/html/2607.12687#bib.bib43); Kirichenko等人,2025 (https://arxiv.org/html/2607.12687#bib.bib44)),以及基于采样的技术,这些技术利用共识启发法(Kang等人,2025 (https://arxiv.org/html/2607.12687#bib.bib52))、语义多样性(Aichberger等人,2025 (https://arxiv.org/html/2607.12687#bib.bib53))或基于熵的度量(Kuhn等人,2023 (https://arxiv.org/html/2607.12687#bib.bib20))从输出变异性中估计置信度。白盒方法则利用内部信号,如令牌概率、熵或似然移位(Gupta等人,2024 (https://arxiv.org/html/2607.12687#bib.bib54); Duan等人,2024 (https://arxiv.org/html/2607.12687#bib.bib21); Huang等人,2023 (https://arxiv.org/html/2607.12687#bib.bib19); Kadavath等人,2022 (https://arxiv.org/html/2607.12687#bib.bib55)),或训练在隐藏表示上的探针来预测正确概率(Azaria和Mitchell,2023 (https://arxiv.org/html/2607.12687#bib.bib56); Mielke等人,2022 (https://arxiv.org/html/2607.12687#bib.bib57))。尽管存在差异,大多数方法都是事后推断置信度,而非在训练期间进行优化。相反,CARE-PPO显式地训练评论家使预测的置信度与量化预测误差对齐,从而实现直接在训练期间优化的置信度估计,而不是事后推断。 ##### 置信度感知的LLM微调。在置信度估计和语言模型微调的交汇处,先前的研究主要遵循两个方向。一个方向的工作将置信度或不确定性信号作为辅助奖励来提高下游任务性能,包括说话人-听话人框架(Stengel-Eskin等人,2024 (https://arxiv.org/html/2607.12687#bib.bib30))以及从自我置信度中派生奖励的强化学习方法(Li等人,2025a (https://arxiv.org/html/2607.12687#bib.bib28); He等人,2025 (https://arxiv.org/html/2607.12687#bib.bib27))。第二个方向的工作直接微调模型以输出校准的置信度或不确定性,包括使用标记化Brier分数损失优化口头置信度的SFT方法(Li等人,2025b (https://arxiv.org/html/2607.12687#bib.bib29)),以及利用人类偏好信号指导置信度校准的方法(Tao等人,2024 (https://arxiv.org/html/2607.12687#bib.bib24))。这些方法继承了SFT的局限性,可能遭受“灾难性遗忘”和先前能力的退化(Luo等人,2025 (https://arxiv.org/html/2607.12687#bib.bib34))。相比之下,我们的CARE-PPO框架联合优化正确性和置信度校准,在显式奖励准确预测的同时学习良好校准的不确定性估计。此外,我们的方法无需口头表达或外部监督即可产生可靠的置信度估计,同时保留了完整的生成表达能力和结构化推理行为。 ## 3 方法论 ### 3.1 基于语言量化预测的PPO 根据先前的研究,我们将语言生成建模为马尔可夫决策过程(MDP),其中状态对应令牌序列,初始状态s0s\_\{0\}由输入提示给出(Shoaeinaeini和Harrison,2024 (https://arxiv.org/html/2607.12687#bib.bib65); Stangel等人,2025 (https://arxiv.org/html/2607.12687#bib.bib25))。在每个时间步tt,演员(策略)πθ\\pi\_\{\\theta\}选择一个动作at∼πθ\(⋅∣st\)a\_\{t\}\\sim\\pi\_\{\\theta\}\(\\cdot\\mid s\_\{t\}\),对应下一个生成的令牌。MDP公式的完整细节见附录A (https://arxiv.org/html/2607.12687#A1)。我们使用基于近端策略优化(PPO)的演员-评论家框架(Schulman等人,2017 (https://arxiv.org/html/2607.12687#bib.bib66))来优化策略,该框架最大化裁剪的替代目标: LPPO\(θ\)=Et\[min⁡\(rt\(θ\)At,clip\(rt\(θ\),1−ε,1\+ε\)At\)\],\\mathcal\{L\}\_\{\\text\{PPO\}\}\(\\theta\)=\\mathbb\{E\}\_\{t\}\\left\[\\min\\left\(r\_\{t\}\(\\theta\)A\_\{t\},\\text\{clip\}\\left\(r\_\{t\}\(\\theta\),1\-\\epsilon,1\+\\epsilon\\right\)A\_\{t\}\\right\)\\right\],\(1\)其中rt\(θ\)=πθ\(at∣st\)πθold\(at∣st\)r\_\{t\}\(\\theta\)=\\frac\{\\pi\_\{\\theta\}\(a\_\{t\}\\mid s\_\{t\}\)\}\{\\pi\_\{\\theta\_\{\\text\{old\}\}\}\(a\_\{t\}\\mid s\_\{t\}\)\}表示当前策略πθ\\pi\_\{\\theta\}与用于收集轨迹的行为策略πθold\\pi\_\{\\theta\_\{\\text\{old\}\}\}之间的重要性采样比率,而ε\>0\\epsilon\>0是一个裁剪超参数,用于约束策略更新的幅度。我们使用广义优势估计(GAE)(Schulman等人,2015 (https://arxiv.org/html/2607.12687#bib.bib67))计算方程1中的优势估计AtA\_\{t\}:

相似文章

置信度感知对齐让推理型大语言模型更加可靠

arXiv cs.AI

本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。

CEPO:基于对比证据策略优化的RLVR自我蒸馏

Hugging Face Daily Papers

CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。