分区、提示、聚合:语言模型中的统计自一致性

Hugging Face Daily Papers 论文

摘要

本文提出了一个框架来测试LLM估计是否在不同子群体间遵循统计自一致性(全概率定理),发现了广泛的违反以及“宏观谬误”,即细粒度估计与人类数据的一致性更好。

上下文学习通常被解释为一种条件推断形式,其中提示指定了上下文,而模型的输出被视为相应条件分布的估计。如果这一解释成立,那么LLM估计应满足基本的概率恒等式。特别地,全概率定理指出,先验加权的条件分布在任意有效的总体分区上聚合为总体水平的边缘分布。在这项工作中,我们研究LLM估计在多大程度上遵循这一自一致性原则。我们使用二叉树作为评估框架,递归地将总体划分为越来越细粒度的子群体。然后,我们向LLM提示上下文中的子群体文字描述,将所得估计聚合回总体水平估计,并在不同粒度的分区之间进行比较。将这一协议应用于多个问题领域和最先进的前沿模型,我们发现了基本一致性属性的广泛违反。一项关于角色提示的深入研究揭示了我们称之为“宏观谬误”的模式:从更细粒度的子群体响应中重建的估计往往比直接的总体水平估计与人类参考数据的一致性更好。这种效应在树结构和估计任务的变化中持续存在,并且可以通过隐式提示部分恢复。总之,这些发现表明模型拥有相关的子群体知识,但不能可靠地将其传播到聚合估计中。这一差距将统计自一致性确立为一个未饱和的、无参考的评估LLM的标准。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:42

论文页面 - 分区、提示、聚合:语言模型中的统计自洽性

来源:https://huggingface.co/papers/2607.15277

摘要

上下文学习通常被解释为一种条件推理形式,其中提示指定了上下文,模型的输出被视为相应条件分布的估计值。如果这种解释成立,那么大语言模型(LLM)的估计应满足基本的概率恒等式。特别是,全概率公式断言,先验加权的条件分布在总体上的任意有效分区上聚合后,会得到总体层面的边际分布。本研究探讨了LLM估计在多大程度上遵循这一自洽性原则。我们使用二叉树作为评估支架,递归地将总体划分为粒度越来越细的子总体。然后,我们通过上下文向LLM提供口头化的子总体描述提示,将得到的估计聚合回总体层面的估计,并在不同粒度的分区之间进行比较。将该方案应用于多个问题领域和最前沿的模型,我们发现了一致性基本属性的广泛违反。对人物提示(persona prompting)的深入研究揭示了一种我们称之为宏观谬误的模式:从更细粒度子总体响应重建出的估计,往往比直接的总体层面估计更符合人类参考数据。这种效应在树结构和估计任务的变化中持续存在,并且可以通过隐式提示部分恢复。这些发现共同表明,模型拥有相关的子总体知识,但未能可靠地将其传播到聚合估计中。这一差距将统计自洽性确立为评估LLM的一个未饱和、无参考的标准。

查看 arXiv 页面 (https://arxiv.org/abs/2607.15277)
查看 PDF (https://arxiv.org/pdf/2607.15277)
GitHub (https://github.com/patrikwolf/statistical_self_consistency)
添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2607.15277)

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.15277,以便从此页面链接该模型。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.15277,以便从此页面链接该数据集。

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.15277,以便从此页面链接该 Space。

包含此论文的合集0

没有合集包含此论文

请将此论文添加到一个合集 (https://huggingface.co/new-collection) 中,以便从此页面链接该论文。

相似文章

语言模型难以实现概念整合

arXiv cs.CL

本文研究了大型语言模型中的 compartmentalization(概念隔离)现象,即模型未能跨同一概念的不同表示共享统计强度,导致样本效率和模型容量降低。作者在多语言和多格式场景中验证了这一现象,并表明合成平行数据无法完全解决此问题。

一些大型语言模型表现出一致的风险态度

arXiv cs.AI

本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。