通过验证器与生成器的对齐改进LLMs

arXiv cs.CL 论文

摘要

一种新方法FLORA(频率校正的有序秩对齐学习)通过基于原理的频率校正确对齐生成器和验证器模式,改进了LLMs。实验表明,在IFEval和HumanEval等基准测试上,G-V一致性和生成器性能均取得了显著提升。

arXiv:2607.02668v1 Announce Type: new Abstract: 大型语言模型存在不一致性问题:改变提示词或包含无关信息可能导致模型输出出现意外变化。生成器-验证器(G-V)差距是这一现象的一种表现,即LLMs生成的响应在重新查询验证时会被其自身判定为无效。在这项工作中,我们引入了一种新的G-V一致性公式,该公式涉及对话语频率的基于原理的校正。具体来说,生成器常常为有效字符串分配低概率,仅仅因为这些字符串先验上不太可能,这使得朴素的G-V一致性概念不可行。我们证明,在一个回答多答案问题的理性代理的自然模型下,验证器与频率校正后的生成器分数的一致性自然出现。我们的方法 \emph{\FCPAname} (\FCPA),是一个训练目标,为现实世界中的LLMs实现了频率校正的G-V一致性。实验结果表明,使用\FCPA{}进行训练显著提高了G-V一致性和生成器性能,优于先前的方法,在IFEval和HumanEval上的皮尔逊相关系数提升高达$+27$pp,同时在所有评估任务中保持了验证器质量。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:36

# 通过验证器到生成器对齐改进大语言模型

来源:https://arxiv.org/html/2607.02668

Juan Diego Rodriguez♠ Jocelyn Zhang♠ Katrin Erk♢ Greg Durrett♣
♠德克萨斯大学奥斯汀分校计算机科学系
♢马萨诸塞大学阿默斯特分校语言学与计算机科学系
♣纽约大学计算机科学系 & 数据科学中心
{juand-r, jocelynzhang}@utexas.edu
[email protected]
[email protected]

###### 摘要

大语言模型具有不一致性:改变提示或加入无关信息可能导致模型输出发生意外变化。生成器-验证器(G-V)差距是这一现象的一个体现,即模型生成回复后,若重新询问其验证这些回复,模型会将它们判定为无效。在这项工作中,我们提出了一种G-V一致性的新形式化方法,该方法包含对语句频率的原则性修正。具体来说,生成器常常仅因有效字符串在先验上不太可能就赋予其似然较低的值,这使得G-V一致性的朴素概念难以成立。我们证明,在一个自然的多答案问题回答理性主体模型下,验证器与频率修正生成器得分之间的一致性会自然出现。我们的方法*频率修正有序秩对齐学习*(FLORA)是一个训练目标,用于在真实大语言模型中实现频率修正的G-V一致性。实验结果表明,与以往方法相比,使用FLORA进行训练显著提高了G-V一致性和生成器性能,在IFEval和HumanEval上的皮尔逊相关系数提升高达+27个百分点,同时在所有评估任务上保持了验证器的质量。¹¹代码和数据参见https://github.com/juand-r/flora

通过验证器到生成器对齐改进大语言模型

Juan Diego Rodriguez♠ Jocelyn Zhang♠ Katrin Erk♢ Greg Durrett♣
♠德克萨斯大学奥斯汀分校计算机科学系
♢马萨诸塞大学阿默斯特分校语言学与计算机科学系
♣纽约大学计算机科学系 & 数据科学中心
{juand-r, jocelynzhang}@utexas.edu
[email protected]
[email protected]

## 1 引言

大语言模型(LLM)可以以两种互补的模式使用:作为*生成器*产生候选回复,以及作为*验证器*评估回复的正确性或恰当性。这两种模式对于LLM的自我精炼(Madaan et al., 2023)和链式思维回溯(Yao et al., 2023)等用法至关重要。然而,这两种模式表现出不同的行为,反映了潜在的不一致性:即使是最前沿的LLM,也可能以高概率生成回复,但随后判定其为错误,反之亦然。因此,过去的工作研究了如何训练语言模型明确地实现生成器-验证器(G-V)一致性,希望这也能使模型更准确(West et al., 2024;Li et al., 2024;Rodriguez et al., 2025)。但事实证明,形式化这一点异常困难。以前的方法缩小了G-V相关性的差距(Rodriguez et al., 2025),但这些方法有可能导致病理行为,例如抑制正确回复,或通过矛盾的训练信号进一步增加不一致性。

参见图注 图1:大语言模型可能生成与其验证结果不一致的输出,因为低概率选项可能只是不常被说出来。FLORA提供了生成器的原则性修正,并允许训练G-V一致的模型。

这项工作的目标是通过两个贡献来改进G-V一致性。首先,我们基于一个对提示作出响应的理性概率主体模型,对G-V一致性进行了公理化。尽管LLM*并非*理性主体,但这个模型允许我们检视,在生成器可能偏好某些可能回复而验证器认为它们都很有可能的情况下,生成器与验证器之间的关系应该是什么。我们推导了生成器概率与验证器概率之间的理论关系,这意味着需要通过减去*错误概率*(即当请求一个*错误*回复时,该回复被采样的可能性)来调整生成器得分。由于该值反映了回复的基本似然,我们将最终量称为*频率修正生成器得分*。

参见图注 图2:IFEval上一个长形式生成任务的生成器-验证器差距。一封带有少量占位符的简短电子邮件(红色)没有遵循指令,未通过验证,但具有较高的生成器得分。另一封电子邮件(绿色)生成器得分较低,但正确遵循了指令,并被验证为正确。

其次,我们在一个名为*频率修正有序秩对齐学习*(FLORA)的训练目标中使用了这一关系。该目标鼓励验证器得分与频率修正生成器得分的秩对齐,这代表了我们对理性主体G-V一致性的理论近似。我们将此目标函数与标准损失函数结合使用,对LLM进行微调,以确保生成器和验证器的正确性。我们的实验集中在验证器优于生成器的任务上。我们的目标是观察生成器在验证器性能不下降的情况下得到改进。我们特别关注*生成器AUROC*,即确保频率修正生成器分布能够正确地将正回复集合排在负回复集合之前,哪怕是在分布的尾部,这与以往关注头部的工作不同(Li et al., 2024)。这是对一致性和生成器正确性的一项强有力的检验。我们在三个任务上进行了评估:指令遵循、代码生成和分类学知识抽取。其中两个任务是长形式(对于IFEval而言是多个句子,对于HumanEval而言是Python代码),这与以往关注简短答案的工作不同(Rodriguez et al., 2025;Li et al., 2024)。

在所有这些任务和三个LLM上,我们发现我们的方法比以往工作更有效地缩小了G-V差距,并提高了正确与错误补全的可区分性。具体来说,相比于最强先前的对齐方法,FLORA将生成器AUROC提升了高达+7.3个百分点,将生成器-验证器相关性提升了高达+27个百分点,同时保持或提升了验证器的质量。

## 2 背景与动机

LLM在多大程度上具有一致的内部处理是一个重要的科学问题(Pres et al., 2026),而生成与验证之间的不匹配是一种值得测量和修复的重要不一致性。模型“知道”的很多内容从未出现在其采样输出中,因为它们存在于判别性判断中,而非流畅的延续中(Gekhman et al., 2025);这对于针对模型知识的评估来说是有问题的(Wang et al., 2024;Biderman et al., 2024)。更好地将生成器与LLM自身的验证能力对齐对于奖励建模(Yuan et al., 2024)以及重排序应用(如数学推理(Cobbe et al., 2021;Lightman et al., 2024)、代码生成(Chen et al., 2021)和事实问答)也很重要。Rodriguez等人(2025)断言生成器和验证器的对数几率应该相关。然而,在某些情况下这种关系无法成立,主要来源于两个原因:(a) 回复频率的作用,以及 (b) 随机不确定性(多个正确回复)。

#### 动机示例

使用LLM生成回复时一个众所周知的问题是表面形式歧义(Holtzman et al., 2021)。对于问题“当血液流向心脏突然受阻时你称之为什么?”,*心脏病发作*和*心肌梗死*都是正确答案。一个好的验证器应该对两者都给出高分,然而期望生成器对两者都给出高分就奇怪了,因为*心脏病发作*是更常见的表达。当问题存在多个可能的正确答案,而且不仅仅是同义改写时,这就变得更加复杂。考虑一个允许几个有效答案的问题,例如,“举一个稀有气体的例子?”(图1)。这个问题有7个可能的正确答案,加上元素的不同表面形式(例如,“氦气”与“He”)。给定这个问题,生成器实际生成*氦气*和*气*的概率不太可能相等,尽管两者都是正确的。生成器得分将话语对提示的正确性与该话语的*频率*混为一谈。

参见图注 图3:主体回复生成模型。我们将生成器pG表示为潜在有效性向量v上的混合分布,v指示模型认为正确的回复子集。π根据每个v在y上放置分布。

在这种设定下,没有单一的“完美”生成器。一种观点是模型应趋向于在可能的选项上均匀分布(Zhang et al., 2024),另一种观点是模型在有效答案上的分布应该与估计的语料频率分布相匹配(Tomov et al., 2025)。相反,一个完美的验证器肯定应该对每个正确的选项以接近1的概率说“是”,而对不正确的选项说“否”。图2展示了在IFEval的一个长形式生成任务中实际发生的这种效应。验证器并不完美,但大多数正确回复(绿色)在验证器对数几率(y轴)上得分高于大多数错误回复(红色)。然而,有些错误回复的生成器得分远高于正确回复,部分原因在于它们短且通用,并且紧密贴合提示。这个例子表明,如果不控制竞争和频率效应,通常不能期望生成器和验证器得分匹配,甚至不能期望它们线性相关。接下来,我们推导它们之间的关系,该关系同时考虑了频率效应和随机不确定性。

## 3 问题形式化

#### 问题设定

我们假设一个提示x和一组可能的回复Y。²²我们的分析要求Y的大小是有限的,但它可以非常大:对于令牌词汇Σ和某个N来说,大小为Σ^N。我们不假设Y是可处理的。对于每个y∈Y,我们假设存在一个有效性标签v(x,y)∈{0,1}。我们假设有效性是二元的且无歧义。我们考虑一个主体(在本工作中即LLM),它以两种模式运作:生成器pG(y|x)和验证器pV(v=1|x,y)。对于LLM,pV和pG是通过不同的提示实现的。

#### 一致性的性质

我们希望选择pV和pG使其一致,直觉是提高一致性也会提高准确性。我们可以直接理解pV为LM当前认为y是对x的正确回复的“信念”。然而,由于通常有许多正确回复,pG还必须对这些回复之间的竞争进行建模,以便作为生成器运作。我们将v={0,1}^|Y|定义为与每个可能回复字符串相关联的有效性向量,假设每个可能的回复要么正确要么错误,尽管主体可能对这些不确定。令vy∈{0,1}表示赋予特定字符串y的有效性。在图1的上下文中,正确的v应该将1赋给7种稀有气体及其所有写法,将0赋给所有其他字符串。图3以绿色显示了可能的v值。假设对于提示x,我们有一个已知且固定的v。如果(1)其验证器恰好返回v中的回复;(2)其生成器仅将质量放在有效回复上:当且仅当vy=1时pG(y|x)>0,则我们称主体与其信念v是一致的。我们称此为*支持约束*,其动机来自质量准则(Grice, 1975):在给定其潜在信念状态v的条件下,主体永不生成其认为不正确的回复。然而,一些选项(例如氙和氪)可能被赋予非常低的概率。在实践中,主体对v具有不确定性。我们将其建模为分布p(v|x)>0,该分布反映了主体在给定x下对可能回复集的信念。与真实LLM类似,我们假设每个v都具有非零(但可能极小)的概率质量。(注意,该分布是一个理论构造,无法在实践中具体化。)我们现在可以定义关于这个分布p(v|x)的*一致性*。如果一个验证器满足以下关系,则它是一致的:
pV(y|x) := p(vy=1|x) = ∑_{v:vy=1} p(v|x)    (1)
我们通过使用一个以v和x为条件的分布π(y|v,x)来表示生成过程。尽管π在实践中难以完全表示,但它有效地描述了质量应如何在v的正确选项中分布。为了满足支持约束,π仅对满足vi=1的项目i赋予非零概率。但在这些项目中,π控制使用哪个表面形式来表达给定的含义,在表面形式实现(Zhang et al., 2024; Holtzman et al., 2021; Zhang et al., 2025)以及当多个答案时表达哪个回复之间分配概率。

相似文章

基于位置选择性自蒸馏,从语言反馈中训练 LLM 评判模型

arXiv cs.CL

该论文提出了一种位置选择性自蒸馏方法,用于利用自然语言反馈训练 LLM 评判模型。该方法通过逐位置的熵变化来屏蔽容易记忆的词元,在主观任务上将分布外泛化能力提升了 2–9 个点,优于 GRPO 等结果监督强化学习方法。