从令牌概率到语义约束:迈向语言模型的声明式概率评估
摘要
本文提出了ModelLog,一个声明式概率框架,用于评估语言模型,通过对令牌预测定义语义约束,并通过共享语义将评估与学习联系起来。
arXiv:2609.13520v1 公告类型:新
摘要:尽管大型语言模型进步迅速,但关于如何评估其获得的知识和推理能力,以及此类评估与预训练中使用的学习信号有何关联,仍有许多基本问题待解决。本文提出ModelLog,一个用于预训练评估的声明式概率框架,它使模型行为的语义结构显式化,并提供了将评估与学习联系起来的新形式化工具。ModelLog将评估目标指定为对令牌级别预测的符号约束,并衡量模型分布满足这些约束的强度。我们通过一套新的任务探索该框架,这些任务针对否定、互斥和一致性,发现了一些仅通过令牌似然度或答案准确性难以表征的系统性失败。我们进一步表明,这些评估分数也可以被解释为损失,其梯度反映了逻辑强度、信息量和变量级敏感性。这通过共享语义将评估与学习联系起来,提出了能够诊断模型行为同时有助于澄清学习语义结构的评估方法。
查看缓存全文
缓存时间: 2026/09/15 08:34
# 从Token概率到语义约束:迈向语言模型的声明式概率评估 来源:https://arxiv.org/html/2609.13520 Kyle Richardson, Cullen Anderson, Pranav Balakrishnan, Takuto Ban, Daksha Ladia **单位:** Allen Institute for AI **单位:** University of Massachusetts Amherst [email protected], {cyanderson,pranavbalakr,tban,dladia}@umass.edu Ankita Gupta **单位:** University of Massachusetts Amherst [email protected], {cyanderson,pranavbalakr,tban,dladia}@umass.edu Marisa Hudspeth **单位:** University of Massachusetts Amherst [email protected], {cyanderson,pranavbalakr,tban,dladia}@umass.edu ###### 摘要 尽管大型语言模型发展迅速,但关于如何评估它们所获取的知识和推理能力,以及这些评估如何与预训练中的学习信号相关联,仍有许多基本问题未解。本文提出了 **ModelLog**,一种声明式概率预训练评估框架,该框架显式地揭示了模型行为的语义结构,并为关联评估与学习提供了新的形式化工具。**ModelLog** 将评估目标定义为Token级预测上的符号约束,并衡量模型分布满足这些约束的强度。我们通过一系列针对否定、互斥性和一致性的新任务来探索该框架,发现了仅通过Token似然或答案准确性难以描述的系统性失败。进一步,我们展示了这些评估分数也可被解释为损失,其梯度反映了逻辑强度、信息量和变量级敏感性。这通过共享的语义关联了评估与学习,表明评估方法既能诊断模型行为,也有助于阐明学习的语义结构。 ## 1 引言 现代预训练依赖于一个极其简单的学习信号:用于下一个Token预测的交叉熵损失。这一目标催生了具备广泛语言、事实和推理能力的模型,但乍看之下似乎存在局限性。虽然它为观察到的续写提供了局部、正向的监督,但许多更丰富的语义关系仍然未被显式表达。例如,在图1(https://arxiv.org/html/2609.13520#S1.F1)中,下一个Token监督可能告诉我们 *alcohol* 是通用陈述 *When driving, it is not safe to drink __* 的一个合理补全,该陈述表达了一个广泛适用的事实或规范性承诺。然而,该目标并未直接说明 *alcohol* 在矛盾语境 *When driving, it is safe to drink __* 中应是低概率的。它也未明确编码多个Token预测之间的关系:改写应保持相同的承诺,而承诺不相容事态的上下文则应引发不同的预测。这自然引出了一个问题:*为什么交叉熵是如此有效的学习信号?* 相关地,*能否开发出更丰富的学习信号来提升交叉熵预训练的鲁棒性?* (A) LM Token Predictions 针对语言模型的局部下一个Token决策示例 当驾驶时,喝酒 **a** 是不安全的 在驾驶时,喝酒 **b** 是安全的这一说法不成立 当驾驶时,喝酒 **c** 是安全的 在驾驶时,喝酒 **d** 是安全的这一说法成立 (C) 公式上的查询 $\mathcal{T}$ 基于约束的结构化概率查询评估 $\mathcal{T}_i$ 由 $P_{M_\theta}$ 加权 软满足度:$\mathbb{P}(\mathcal{T}_i; \mathcal{M}_\theta)$ 边缘概率:$\mathbb{P}(CLOSE | \mathcal{T}_i; \mathcal{M}_\theta)$ 梯度:$\nabla_\theta \mathbb{P}(\mathcal{T}_i; \mathcal{M}_\theta)$ (B) 声明式约束 $\mathcal{T}$ 指定任何模型 $\mathcal{M}(\cdot)$ 理想Token决策的布尔公式。 可能Token $\mathcal{T}_p$ 模型 $\mathcal{M}$ 应偏好局部的、真实的Token决策。 $\mathcal{M}(a) \land \mathcal{M}(b)$ 不可能Token $\mathcal{T}_n$ 模型 $\mathcal{M}$ 应不偏好非真实的、局部的Token决策。 $\neg \mathcal{M}(c) \land \neg \mathcal{M}(d)$ 改写对称性 $\mathcal{T}_s$ 涉及改写的Token决策应兼容。 $\mathcal{M}(a) \leftrightarrow \mathcal{M}(b) \land \mathcal{M}(c) \leftrightarrow \mathcal{M}(d)$ 不兼容性 $\mathcal{T}_m$ 矛盾的Token预测应相互区别且互斥。 $(\mathcal{M}(a) \land \neg \mathcal{M}(b)) \lor (\neg \mathcal{M}(a) \land \mathcal{M}(b))$ $\mathbb{P}(\mathcal{M}(\cdot)) \sim \mathbb{P}_{\mathcal{M}_\theta}(\cdot)$ 图1:我们的评估框架 **ModelLog** 的示意图,它将预训练语言模型(A)的局部下一个Token预测映射到表示预测事件的命题变量 $\mathcal{M}(\cdot)$(B)。这些变量上的符号约束指定了它们之间应成立的局部语义关系。评估随即变为对约束的概率推断(C):模型的Token概率 $\mathbb{P}_{\mathcal{M}_\theta}(\cdot)$ 为赋值 $\mathbb{P}(\mathcal{M}(\cdot))$ 提供了权重,满足度或边缘概率衡量了模型对期望语义结构的支持强度,而此类推断的梯度则提供了与学习的直接联系。 在本文中,我们**仅**通过预训练评估的视角来探讨这些广泛问题,特别关注如何**形式化**并精确测量预训练模型满足语义约束的程度。如图1(https://arxiv.org/html/2609.13520#S1.F1)所示,我们开发了一个名为 **ModelLog** 的框架,其中我们将评估目标表达为一个显式的声明式理论:一组逻辑公式,规定了模型的局部Token级预测之间理想应满足的关系。例如,为了表达 *alcohol* 与前缀 *When driving, it is not safe to drink __* 及其改写形式 *It is not true that when driving it is safe to drink __* 都兼容,我们使用逻辑变量如 $\mathcal{M}(a)$ 和 $\mathcal{M}(b)$ 来表示相应的预测事件。这些上下文之间的改写关系可以通过约束 $\mathcal{M}(a) \leftrightarrow \mathcal{M}(b)$ 来编码,要求两个预测事件保持一致。通过这种方式,声明式理论使我们能够从孤立的Token似然转向关于它们之间应保持的语义关系的显式陈述。关于模型行为的问题随后可以被表述为对这些理论本身的结构化查询。 我们聚焦于**概率查询**:给定模型的Token概率,我们询问模型将多少概率质量分配给满足特定理论约束的解释。这建立在统计关系学习(Getoor and Taskar, 2007; De Raedt et al., 2016)和神经符号建模(Marra et al., 2024; Feldstein et al., 2024)的工作基础之上,其中逻辑约束与概率权重相结合以推理结构化事件。通过这种方式,概率推断将评估从二元正确性提升到衡量模型分布对目标语义结构的支持强度。 本文的主要目标是勾勒 **ModelLog** 的技术轮廓,并展示此类框架如何既能阐明评估的语义,又能将这种语义与学习直接关联。因此,本文主要是方法论性质的,提供了形式化与实证结果的结合。在形式化方面,我们识别了在Token概率上进行语义推理时出现的两个可解释性挑战。首先,原始的下一个Token概率衡量了概率质量在竞争性续写间的分配情况,使得它们难以直接被解释为语义有效性的概率。因此,我们使用局部预测分布的信息来重新缩放它们,将语义事件概率视为模型有效“可行”续写区域中的成员资格(Holtzman et al., 2020; Hewitt et al., 2022)。其次,原始约束概率可能高估了模型能力,因为某些公式仅靠机会就很容易满足。因此,我们引入了**约束信息量**的概念,它考虑了偶然满足的情况,并被纳入我们的主要概率评估指标中。 由于语义满足度对模型概率是可微的,我们的评估分数也可被解释为损失。令人惊讶的是,我们展示了为评估引入的约束信息量,也直接出现在相应的学习梯度中。这为理解基于似然的下一个Token目标(我们在 **ModelLog** 中表明其可表示为最大信息量的合取公式)为何能提供强学习信号提供了一个形式化视角,并为系统地比较它们与其他候选目标提供了基础。 在实证方面,我们引入了 **ProbCT**(概率一致性测试),这是一组受先前一致性探测工作启发(Elazar et al., 2021; Kassner and Schütze, 2020)的诊断性测试。我们发现当前的预训练模型在这些任务上表现不佳,表明预训练并未可靠地诱导出我们约束所捕获的结构化语义关系。更重要的是,**ProbCT** 展示了声明式理论和概率查询如何能揭示仅从Token似然或准确性中难以发现的失败。这包括我们观察到的一个有趣的**反向缩放**(McKenzie et al., 2023)模式,即更大的模型系统性地比小模型更少满足某些约束。 #### 贡献 遵循*NLP研究新使命*特别专题,我们提出了 **ModelLog**,一个将语言模型评估与统计关系学习和概率逻辑技术相连接的新评估框架。我们的主要贡献是方法论性的:我们展示了声明式概率评估如何通过将评估数据视为组合式语义对象,来帮助为评估带来更多语义清晰度。我们通过在名为 **ProbCT** 的新诊断基准上的形式化结果和实证案例研究来阐述这种方法。 ## 2 相关工作 #### 语言模型评估 我们的工作与基于损失的语言模型评估相关,后者使用如困惑度(Jelinek, 1980; Goodman, 2001; Bengio et al., 2003; Brown et al., 2020; Lozhkov et al., 2025; Groeneveld et al., 2024; Magnusson et al., 2024)等量来评估模型;以及事后行为评估,后者在诊断性任务和基准上测试模型(Srivastava et al., 2023; Wang et al., 2018; Petroni et al., 2019; Richardson et al., 2020; Ribeiro et al., 2020; Liang et al., 2022,等等)。我们特别从使用一致性作为模型行为核心诊断的行为研究中汲取灵感(Elazar et al., 2021; Kassner and Schütze, 2020; Liu et al., 2025; Jang et al., 2022; Novikova et al., 2025)。**ModelLog** 介于这两种传统之间:它利用模型概率,同时针对可解释的语义能力。与两者不同的是,它评估多个预测上的丰富声明式约束,产生概率性、可微的测量,直接关联评估的语义与学习。 (A) Token预测 当驾驶时,喝酒 **a** 是不安全的 当驾驶时,喝酒 **c** 是安全的 (B) 约束 $\mathsf{F}$ “酒精”在一句话中是有效的Token补全,但在两句中则不是。 $\mathsf{F} = (\mathcal{M}(a) \land \neg \mathcal{M}(c)) \lor (\neg \mathcal{M}(a) \land \mathcal{M}(c))$ (C) 布尔语义 (D) 语言模型 $\mathcal{M}_\theta$ (E) 无信息先验 $\mathcal{M}_0$ $\mathcal{M}(a)$ $\mathcal{M}(c)$ $I \in \mathsf{I}(\mathsf{F})$ $S(I_j; \theta)$ uniform $I_1$ T T P $\theta$ $\mathbb{P}_\theta(\mathcal{M}(a)) \cdot \mathbb{P}_\theta(\mathcal{M}(c))$ 0.25 $I_2$ T F ✓ $\mathbb{P}_\theta(\mathcal{M}(a)) \cdot (1 - \mathbb{P}_\theta(\mathcal{M}(c)))$ 0.25 $I_3$ F T ✓ $(1 - \mathbb{P}_\theta(\mathcal{M}(a))) \cdot \mathbb{P}_\theta(\mathcal{M}(c))$ 0.25
相似文章
大规模语言模型的概率归因
本文提出了一种与模型无关的基于概率的令牌归因度量,利用贝叶斯规则反转下一个令牌的对数概率,捕捉模型对令牌序列的内部表示,并通过熵分析提高可解释性。
语言模型如何失败:承诺性与持续性推理失败的词元级特征
本文通过词元级不确定性信号,刻画了语言模型在推理中失败的两种不同过程——承诺性失败与持续性不确定性,并展示了其对自一致性及失败检测策略的启示。
下一个令牌预测何时有用?边际化、遍历性、混合可识别性、局部充分性、RAG、工具与编程
本文区分了语言建模中常被混淆的三个概率对象——完整条件语言过程、边际纯文本法则和模型诱导分布——并分析了下一个令牌预测有用的条件,将 RAG 和工具解释为条件充分性设备。
当可解码性不足时:语言模型中的逻辑有效性表示、行为分离与因果测试
本文研究了大型语言模型如何内部表示逻辑有效性,表明尽管行为表现不佳,有效性信息仍可从隐藏状态中解码,这表明表示、表达和因果使用具有不同的作用。
“不太可能”有多不可能?评估大型语言模型对言语概率的感知
本文对大型语言模型如何解释言语概率表达式进行了系统性的跨模型评估,发现它们能够忠实追踪人类基准,但存在偏差,尤其是在负面表达方面,这对人类与AI之间的不确定性交流有影响。