PromptNCE: 仅使用大语言模型和对比估计提示的点互信息预测
摘要
本文介绍了PromptNCE,一种使用大语言模型和对比提示来零样本估计点互信息的方法,在三个数据集上实现了与人类标注真实值的高度相关性。
arXiv:2605.21776v1 公告类型: 新
从文本中估计互信息通常需要训练任务特定的判别器,这限制了其在低数据场景下的应用。我们探究大语言模型是否能够仅通过提示和引发概率来零样本估计点互信息。我们引入了一个包含三个公开数据集的基准,这些数据集具有人类标注的真实PMI值,并评估了五种基于信息论的提示估计方法。我们的主要方法PromptNCE将条件概率估计构建为对比任务,并通过显式添加OTHER类别来扩充候选集。我们从理论上证明,添加OTHER可以恢复真实的条件概率P(y|x),而不仅仅是候选列表上的排序,从而将对比提示转变为通用的零样本概率估计器。PromptNCE在所有三个数据集上都是最佳的零样本方法,与人类标注的PMI的Spearman相关系数高达0.82。我们还展示了一个计算机科学教育中的案例研究,说明这些估计器如何在低数据场景下用于对学生知识摘要进行评分。
查看缓存全文
缓存时间: 2026/05/22 08:43
# 仅使用LLM和对比估计提示的点互信息预测 来源:https://arxiv.org/html/2605.21776 **Juliette Woodrow** 计算机科学系 斯坦福大学 [email protected] **Chris Piech** 计算机科学系 斯坦福大学 [email protected] ###### 摘要 从文本中估计互信息通常需要训练一个任务特定的评判器,这限制了其在低数据场景下的应用。我们探索大型语言模型能否仅通过提示和诱导概率,以零样本方式直接估计点互信息。我们引入了一个基准测试,包含三个公开数据集上的人类标注的真实的点互信息,并评估了五种基于信息理论的、提示驱动的估计方法。我们的主要方法,**PromptNCE**,将条件概率估计重构为对比任务,并用一个显式的**其他**类别扩充候选集。我们从理论上证明,添加**其他**类别能够恢复真正的条件概率 \(P(y|x)\),而不仅仅是候选集上的排序,从而将对比提示转化为通用的零样本概率估计器。在所有三个数据集上,**PromptNCE** 是表现最好的零样本方法,与人类标注的PMI的斯皮尔曼相关系数最高达到0.82。我们还展示了一个计算机科学教育的案例研究,说明这些估计器如何用于在低数据场景下对学生知识摘要进行评分。 ## 1 引言 两个随机变量 \(X\) 和 \(Y\) 之间的互信息(MI)量化了知道其中一个变量能多大程度减少对另一个变量的不确定性。其点对点变体——点互信息(PMI),则是针对特定一对 \((x,y)\) 而非期望值进行度量,因此它更适合用于评估单个文本对之间提供信息量的自然指标。MI和PMI广泛出现在机器学习中,从学习表示(Hjelm et al., 2019)到特征选择(Vergara and Estévez, 2014),再到分析神经网络学到了什么(Shwartz-Ziv and Tishby, 2017)。但估计这些量是出了名的困难。相关分布通常是高维且长尾的,除了最简单的情况,精确计算几乎不可行。数十年的工作通过训练神经评判器来优化MI的变分下界来解决这个问题(Belghazi et al., 2018; Nguyen et al., 2010; van den Oord et al., 2018)。这些方法有效,但需要大量任务特定的训练数据,限制了它们在低数据场景下的使用。 大型语言模型提供了一条潜在的前进道路。近期工作表明,它们可以在其训练数据充分覆盖的任务上充当有效的零样本评分器和评判器(Liu et al., 2023; Zheng et al., 2023; Li et al., 2024a; b)。在本文中,我们研究大型语言模型能否仅通过提示和诱导的概率估计,以零样本方式估计点互信息。我们考虑了两类策略。第一类是直接要求模型估计给定词对的PMI。第二类是理论驱动的,我们将经典的互信息估计思想转化为自然语言提示,将语言模型视为一个评判器,诱导出估计PMI所需的概率。我们将此形式化为**零样本PMI估计挑战**,并从三个公开数据集构建了一个基准测试,这些数据集具有人类标注的真实的PMI。我们比较了五种基于MI估计文献的提示方法。其中,我们引入了**PromptNCE**,一种对比方法,它在候选集中添加了一个显式的**其他**类别。标准的对比方法会膨胀条件估计值。**其他**类别允许模型表达大多数质量落在候选集之外,我们从理论上证明这能恢复真实条件概率的更好近似。**PromptNCE**在所有三个数据集上取得了最高的相关性。我们发现性能强烈依赖于数据集的结构。我们引入了一种方差分解,将PMI的变异分解为来自各个组成部分的量,并表明这可以预测方法何时成功、何时失败(第4.1节)。最后,我们展示了一个案例研究,说明为什么零样本PMI估计在实践中很重要。LLM可以根据观察到的数据生成关于个体的自然语言摘要,例如基于学生编写的代码总结其理解情况的摘要,或根据患者的病历总结其健康状况的摘要。但评估这样的摘要是否良好仍是一个开放问题。一个有用的摘要应该包含足够的个体特定信息,以帮助预测该个体下一步会做什么,这正是PMI所捕捉的关系。在第5.4节,我们展示了**PromptNCE**可以在一个低数据场景下为摘要提供有原则的评分信号,而传统的PMI估计方法在此类场景下不可行。我们做出以下**贡献**: - **问题与基准测试**。我们将零样本PMI估计形式化为提示语言模型的一项挑战,并引入一个包含人类标注的真实PMI的基准测试,涵盖词关联、推理和情感三个数据集。 - **PromptNCE**。我们引入了**PromptNCE**,一种对比提示方法,它用一个显式的**其他**类别扩充候选集。我们从理论上证明这恢复了开放词汇的条件概率 \(P(y|x)\),而不是其在封闭候选集上的重新归一化。 - **实证结果**。在三个数据集和两个商业语言模型上,**PromptNCE** 一致地达到了最高的零样本PMI估计精度,在ChaosNLI上的斯皮尔曼相关系数 \(\rho = 0.82\)(比直接询问高 \(+0.10\)),在Words上 \(\rho = 0.69\)(\(+0.21\)),在GoEmotions上 \(\rho = 0.47\)(\(+0.13\))。我们还发现不同模型系列之间存在一致的差异,Claude Sonnet 4 在所有方法和数据集上均优于GPT-5.2。 - **错误分析**。我们分解每个数据集的PMI变异有多少来自条件项与边际项,并表明这可以预测边际估计何时重要——这就提供了一个可移植到新数据集的诊断框架。我们进一步表明,排序错误是主要瓶颈,并且这些错误是系统性的而非随机的,指向模型分布知识而非提示敏感性的局限。 - **案例研究**。我们展示了计算机科学教育中的一个案例研究,说明 **PromptNCE** 可以在没有任何训练数据的情况下,为学生理解情况的自然语言摘要提供有原则的评分信号,并且估计的PMI分数与专家教师评分相对应。 ### 1.1 零样本LLM互信息估计挑战 **零样本互信息估计挑战**是仅使用预训练语言模型和一个提示来估计文本对的点互信息。模型接收任务的自然语言描述,并返回一个语言化的估计值。这一挑战之所以困难,至少有两个原因。首先,文本上的PMI本质上是困难的。文本是离散的、高维的、长尾的。传统的MI估计器从训练数据中学习连续嵌入空间中的评判器(Nguyen et al., 2010; van den Oord et al., 2018; Belghazi et al., 2018)。没有经过学习的评判器,就需要其他方式来评估自然语言上的密度比。其次,PMI不仅取决于 \(x\) 和 \(y\) 关联的强度,还取决于 \(y\) 的整体普遍程度。\(y\) 的基础率是特定数据集的属性,而模型无法直接访问数据集的统计信息。它必须从一般知识推断 \(y\) 有多常见,这可能与目标分布不匹配。我们使用估计PMI与真实PMI之间的斯皮尔曼秩相关系数进行评估,因为PMI最自然的下游应用是识别哪个标签 \(y\) 与给定输入 \(x\) 具有最高的互信息。一个好的零样本MI估计器应该能正确地对PMI进行排序。 ### 1.2 背景与相关工作 MI估计的标准方法是使用学习到的评判器优化变分下界。Donsker-Varadhan (DV) 表示给出了一个紧致下界,但需要估计一个难以处理的对数配分函数。Belghazi et al. (2018) 在MINE中通过梯度下降训练神经评判器实现了这一思想。Nguyen et al. (2010) 引入了NWJ界,它给出的下界更松但通常方差更低。对比方法提供了一种更简单的替代方案。van den Oord et al. (2018) 表明,在干扰项中识别出真实配对可以给出MI的下界,这一目标在表示学习中被广泛采用(Gutmann and Hyvärinen, 2010; Hjelm et al., 2019; Chen et al., 2020)。这些方法的一个关键局限性是评判器函数需要大量训练数据和特定的建模假设。我们转而研究能否让LLM充当零训练的评判器,通过提示直接提供计算PMI所需的概率估计。 仅通过提示,LLM能否产生可用的概率估计仍是一个开放问题。Tian et al. (2023) 发现,对于RLHF模型,语言化的置信度分数比令牌级概率的校准要好得多。Xiong et al. (2024) 评估了多种LLM的黑盒置信度诱导方法,发现持续存在过度自信,没有单一提示技术能一贯解决。Chen and Mueller (2024)、Wang et al. (2024) 和 Kapoor et al. (2024) 随后探索了基于采样和基于训练的方法,以实现更可靠的不确定性表达。先前的工作将语言化概率视为最终答案的置信度。我们则将其作为计算PMI所需项的插件估计,因此相关的失败模式在于模型的分布知识而非其校准性。这种分布知识是否足以进行零样本估计是一个实证问题,但近期的证据令人鼓舞。越来越多的文献使用LLM作为零样本评分器替代人工评估(Liu et al., 2023; Zheng et al., 2023; Li et al., 2024a; b)。LLM评判器在预训练充分覆盖的任务上可以达到80%以上的人员一致率,不过它们仍然容易受到偏见的影响,并在专业标准上的表现会下降(Zheng et al., 2023; Li et al., 2024b)。我们的设置与零样本评分不同,因为我们不要求直接的质量判断。相反,我们将经典的MI估计方法重新解释为提示,使用诱导概率作为PMI中各项的插件估计。据我们所知,这是首个使用提示概率诱导进行点互信息估计的工作。 ## 2 理论动机 我们的目标是仅使用语言模型的零样本概率诱导来估计点互信息: \[ \mathrm{PMI}(x,y) = \log P(y|x) - \log P(y), \qquad (1) \] 本节为我们方法背后的理论结构奠定基础。我们首先将PMI视为两个项的差,原则上这些项可以独立地诱导出来。然后我们证明,对比公式——要求模型在干扰项中识别真实标签——能够精确恢复PMI,仅相差一个依赖于候选集的常数。最后,我们证明,在候选集中添加一个显式的**其他**类别,可以将对比后验转化为开放词汇条件概率 \(P(y|x)\) 的估计,从而实现绝对的PMI估计。 ### 2.1 PMI作为概率分解 恒等式 \(\mathrm{PMI}(x,y) = \log P(y|x) - \log P(y)\) 将PMI估计简化为估计两个量:条件概率 \(\hat{P}(y|x)\) 和边际概率 \(\hat{P}(y)\)。这两个项都可以由LLM以零样本方式估计。这种分解很有用,因为它将两个不同的估计任务分离开来。条件项 \(P(y|x)\) 依赖于输入 \(x\) 如何将概率转移到输出上,而边际项 \(P(y)\) 则捕获 \(y\) 的整体常见程度。来自任一分量的错误都会传播到最终的PMI估计中,每个分量的相对重要性取决于问题设置。在某些设置中,PMI在词对间的变异主要来自边际项,而另一些设置中条件项占主导。我们通过方差分解在第4.1节对每个数据集进行了量化。 那么问题是如何从语言模型中诱导出每一项。**估计边际**:边际是目标数据集中标签分布的一个属性。这带来了一个独特的挑战,因为模型无法直接访问数据集的标签频率,必须从其自身的先验知识中推断。我们使用的一种方法是直接询问模型,提示它考虑标签 \(y\) 的整体常见程度。但这依赖于模型内化的基础率,可能并不匹配目标分布。另一种方法是通过提供来自数据集的一小部分标签样本来为边际提示提供基础。这些例子并不直接揭示标签频率或PMI测量值,但它们将估计锚定在实际分布的结构上,而不是模型的通用世界知识。这种锚定使得该方法并非严格零样本,但它只需要来自数据集的少量输入-输出对。 ### 2.2 基于对比估计的PMI 直接从语言模型诱导出良好校准的 \(P(y|x)\) 值是困难的:模型必须分配一个绝对的单一标签概率,没有任何参考点。一种对比公式提供了一条更易处理的路径。我们不要求绝对概率,而是要求模型在 \(K-1\) 个干扰项中识别真实标签——这是一个基于具体备选集的计算判断。这种重新表述可能看起来丢弃了我们所需的概率结构,但事实恰恰相反:正如我们现在所示,这一识别任务的精确恢复点互信息,仅相差一个只依赖于候选集大小的常数。
相似文章
对比混合提示学习用于未见模态组合的不完整多模态情感分析
本文针对未见模态组合的不完整多模态情感分析问题,提出对比混合提示学习(CMPL)模型,该模型利用标签引导的对比学习和模态组合提示来增强泛化能力,在基准数据集上实现了超过5%的准确率提升。
一次响应,始终响应:通过潜在提示恢复检测LLM生成的文本
本文提出了EchoPrompt,一种无需训练的LLM生成文本检测器,通过添加通用前缀恢复潜在提示依赖性,并衡量指令微调模型与基础模型之间的似然增益差异,实现了最先进的零样本检测性能。
基于交互的LLM提示敏感性评估与解释
本文介绍了一种基于交互的提示敏感性 (IPS) 指标,通过分析交互来评估和解释大语言模型中的提示敏感性。该指标应用于50个开源LLM,识别了如微调和模型规模等因素通过低阶交互降低敏感性。
PromptPrint:通过自然语言提示在大语言模型中实现行为生物特征识别
介绍PromptPrint,一项系统性研究,表明用户在LLM提示中的习惯性词汇和句法构成可学习的行为生物特征,词汇特征优于语义编码器,并揭示了独特性-一致性悖论。
PTP:基于前文标记预测的LLM反演实现近乎精确的提示重建
本文提出了PTP,一种功能性LLM反演方法,利用目标黑盒LLM生成的合成数据,从头开始训练一个使用前文标记预测的逆语言模型,从而能够从响应中近乎精确地重建提示,性能优于先前工作。