随机词汇演算的基础:语义下降与概率单形上的随机动力学

arXiv cs.CL 论文

摘要

本文开发了一种用于语言模型语义更新的随机词汇演算框架,定义了语言推导的概率支持有意义的序列表示状态的条件。实证实验验证了该框架在校准条件下的稳定性和覆盖性。

arXiv:2609.20207v1 公告类型:新 摘要:大型语言模型产生依赖于提示的单词概率,而科学系统需要对有意义的不确定状态进行更新,随着证据的到来。我们开发了一个可观察框架,用于确定语言推导的概率何时支持这种序列表示状态。理论上,我们定义了上下文语言的类型可测变换,构建了一个最小闭表示,并给出了语义更新唯一存在的必要和充分条件。我们约束了不可约的非闭性和累积误差,并在平均收缩下证明了概率单形上外部随机递归的存在性、唯一性和稳定性。这些结果定义了一种随机词汇演算,而无需将内部演算归因于语言模型。实证上,冻结实验测试了可观察的含义。原始提示条件概率未通过预设的不变性门控;经过特定提示校准后,一个共同的三状态表示通过了稳定性门控,并覆盖了30个未触及的八步路径中的28个,或在名义水平0.90下的0.933。因此,语言概率仅在声明的操作域内验证了闭性、稳定性和覆盖性时才支持随机状态。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:12

# 随机词汇演算基础:语义下降与概率单纯形上的随机动力学
来源:https://arxiv.org/html/2609.20207 (工作手稿,2026年7月)
###### 摘要
大型语言模型产生依赖于提示的词概率,而科学系统需要针对有意义状态的不确定性,这些状态可以在证据到达时更新。我们开发了一个可观察框架,用于确定源自语言的概率何时支持此类序贯状态表示。在理论上,我们定义了上下文语言的类型化可测变换,构建了一个最小闭表示,并给出了语义更新唯一存在的必要和充分条件。我们界定了不可约的非封闭性和累积误差,并在平均收缩条件下证明了概率单纯形上外部随机递归的存在性、唯一性和稳定性。这些结果定义了一个随机词汇演算,而无需将内部演算归因于语言模型。在实证方面,冻结实验测试了其可观察含义。原始的提示条件概率未能通过预设的不变性门控;经过针对特定提示的校准后,一个共同的三状态表示通过了稳定性门控,并覆盖了30条未触及的八步路径中的28条,或在名义水平0.90下达到0.933。因此,语言概率仅在已声明的操作域内经过验证的封闭性、稳定性和覆盖性的条件下,才支持随机状态。

## 1 问题
演算始于规定对象、允许的变换、可观察量,以及将局部变化与组合和累积联系起来的法则。自然语言同样有此需求。一个词的出现可以被替换、插入修饰语、否定某个子句、连接两个段落,或将一系列陈述重新排序。这些操作作用于上下文表达式,而非孤立的词典条目,且其顺序可能会改变含义。现有的语言演算主要形式化语法可推导性、类型化组合、指称或符号重写。离散演算提供了一般差分算子,但它不能决定哪些变换保留了语言信息、哪些上下文区分是重要的,或者语义表示何时在后续变化下保持封闭。我们着手解决这个缺失的层次。这一差距已从术语问题演变为操作问题。拟合的语言模型为词汇延续分配概率,而用户则推理更粗粒度的含义,如事实替代方案、风险取向、诊断、意图或置信水平。近期工作通过将语义等价的生成分组、要求模型提供置信度、校准候选词概率或训练语言校准响应来衡量不确定性[3 (https://arxiv.org/html/2609.20207#bib.bib3),20 (https://arxiv.org/html/2609.20207#bib.bib20),25 (https://arxiv.org/html/2609.20207#bib.bib25),26 (https://arxiv.org/html/2609.20207#bib.bib26),27 (https://arxiv.org/html/2609.20207#bib.bib27),35 (https://arxiv.org/html/2609.20207#bib.bib35)]。这些方法确立了源自语言的不确定性可以是有用的,但它们留下了一个先前的数学问题未解决:语言的概率值摘要何时能精确保留后续信息变换所需的所有区分?没有这种封闭性,连续的摘要不必然形成状态过程,即使每个摘要单独校准得很好。本文的基本对象是上下文语言。概率法则、模型输出和声明的语义状态都是词汇可观察量的例子。这个顺序很重要:演算不是由特定的语言模型、分词法、本体论或贝叶斯后验定义的。这些作为表示形式稍后进入,用以检验普遍法则。核心问题很简单。如果两个上下文被视为同一状态,是否每个相关的语言干预都必须以相同的方式影响它们?如果不是,则该状态丢弃了与变换相关的词汇信息。在该状态上的封闭递归是不合理的。这一障碍,以及消除它的规范表示,构成了该理论的组织原则。例如,假设两份市场报告都由状态概率 (0.6, 0.3, 0.1) 概括了风险偏好、混合和风险厌恶状态。在第一份报告中,乐观评估是由通货膨胀下降驱动的;在第二份报告中,是由企业盈利改善驱动的。附加相同的新观察结果——“通胀意外上升”——可能对第一份评估的影响远大于第二份。因此,相同的当前状态并不能决定下一个状态。仅使用这三个概率的递归忽略了更新所需的关键区分。上下文 c 在一个呈现中的证据 e 变换后的上下文 Tc 重新措辞或新证据 e 保留的状态 B(c) 语义概率下一个状态 B(Tc) 语义概率类型化词汇变换 T 表示 B 表示 B 状态更新 G_T 图 1:核心封闭性问题。上路径变换完整上下文,然后测量其保留的语义状态。当下图映射是表示独立时,下状态空间上的递归才是合法的,即 B(Tc) = G_T{B(c)}。保留声明信息的重新措辞应使状态保持稳定;真正的新证据可能使其移动,但若要支持自主的序贯建模,则必须通过保留状态实现。图1 (https://arxiv.org/html/2609.20207#S1.F1) 区分了两个常被混淆的操作。呈现更改在保留声明信息的同时改变了词语;证据更新则改变了信息本身。有用的语义状态应对前者稳定,对后者敏感。更强的是,如果要进行递归更新,其对每个允许变换的响应必须由保留状态决定,而非由表示已丢弃的词汇细节决定。为何这导致**随机词汇演算**?在已部署的系统中,证据及其呈现所依赖的语言变换都不是以固定的确定性序列到达的。报告、问题、限定和修正随时间到达;它们的顺序和内容是不确定的;并且每一个都可能改变对声明的语义状态的概率分布。例如,对于三种状态,演变的量是概率单纯形上的一个点 (p_1, p_2, p_3),而非单一响应。因此,连续的词汇变换在该单纯形上生成一条随机路径。将此路径称为随机状态过程,不仅仅是因为观察到其坐标移动。在已声明的变换下,相同的保留状态必须意味着相同的后继状态;否则,表面的递归仍然依赖于已被丢弃的词汇信息。一旦此封闭性条件成立,有限的词汇差异描述一步移动,上循环法则描述组合,收缩和扰动界决定近似误差是消散还是累积。这些是此处开发的随机词汇演算的组成部分。术语是有意选择离散和基于表示的。我们不首先对语言施加连续时间扩散、随机积分或伊藤公式。相反,我们从类型化的上下文变换推导出一个随机动力系统,并证明它何时下降到一个稳定的单纯形值递归。连续时间极限(在科学上合适时)仅在此基本封闭性问题解决之后才会出现。
### 1.1 贡献与主张边界
“演算”一词在语言学和逻辑学中使用已久。兰贝克演算形式化语法组合;λ演算支持形式语义;微分λ演算对计算项进行微分;布热佐夫斯基导数作用于形式语言;离散演算提供有限差分法则。早期作品也使用了“词的演算”、“词汇演算”和“语言演算”等短语。因此,我们并不声称引入了关于词的数学推理。焦点贡献是结构性和随机性的,而不仅仅是词汇性的。问题位于计算机科学中几个既定数学结构的交叉点:类型化语义规定合法的语言变换,部分映射类别表示并非在所有上下文中都定义的操作,行为等价性决定哪些上下文可以共享一个状态,概率内核描述随机演化。因此,确定性变换代数是必要的基础,但它不是本文的终点。我们的主要问题是上下文证据的随机到达何时在语义概率单纯形上诱导一个定义良好的随机过程。这需要一座现有词汇演算和一般随机系统通常不提供的桥梁:一个可测商必须保留足够的未来行为,以便随机变换能够下降、组合并在时间中保持稳定。该下降过程的存在性、因果唯一性、同步化和扰动结果将词汇基础转变为随机词汇演算,并将源自语言的不确定性置于基于状态的计算组合性理论内。最接近的现代工作流是余代数行为度量和纤维化证明技术[2 (https://arxiv.org/html/2609.20207#bib.bib2),7 (https://arxiv.org/html/2609.20207#bib.bib7)],用于部分计算的限制范畴[11 (https://arxiv.org/html/2609.20207#bib.bib11),12 (https://arxiv.org/html/20207#bib.bib12)],范畴概率和马尔可夫范畴[21 (https://arxiv.org/html/20207#bib.bib21),24 (https://arxiv.org/html/20207#bib.bib24)],以及对自然语言语义的新范畴论处理[9 (https://arxiv.org/html/20207#bib.bib9),13 (https://arxiv.org/html/20207#bib.bib13)]。这些理论在相当高的普遍性水平上解释了行为、部分性、随机组合和语言结构。它们本身并未指定上下文记录的哪些变换保留了统计信息、语言延续上的概率法则如何被粗化为应用状态,或者这种粗化失败如何通过交换缺陷暴露出来。本文占据的是这一接口,而非声称是这些文献的替代基础。因此,本文声称的贡献更为具体。我们阐述了一个随机词汇演算,其中:
1.  原始域由上下文词汇表达式组成;
2.  类型化变换是变化的方向;
3.  等价性是操作性的,并相对于声明的可观察量和干预措施;
4.  规范状态由未来的变换–观察行为构建;
5.  提议的语义表示仅在变换能通过它下降时才有效;
6.  随机下降的变换定义了一个单纯形值递归,具有明确的存在性和稳定性条件;以及
7.  对演算法则的违反是可测量的,而非被假设消除。
根据我们的文献检索,这种组合——特别是针对类型化部分可测语言变换的终态最小化和可测试的语义下降——尚未针对上下文自然语言发展出来。其组成部分——商、分解、随机迭代和有限差分论证——都是标准的。我们的贡献在于它们的词汇构造,以及由此产生的三个问题的分离:表示保留什么信息、允许的变换是否能通过它下降,以及下降的递归是否稳定。理论发展围绕三个主要结果组织。首先,行为签名给出了在声明类别中最小的封闭可观察表示。其次,精确下降等价于变换域的饱和以及表示纤维的保留;近似下降具有不可约的纤维直径误差。第三,一旦下降得以确立,标准的平均收缩论证产生唯一的因果随机递归,并给出下降误差的显式传播界。统计识别和有限样本恢复仅包含在内,以使可观察含义可测试;它们并未作为半参数估计的新通用理论提出。结果也不意味着拟合的语言模型字面上包含一个贝叶斯信念状态。阐述顺序遵循认证问题的顺序。第2节定义上下文变换、信息等价性和规范行为表示。第3节阐述语义下降、误差传播和有限示例。第4节在概率单纯形上构建随机词汇演算。第5节报告完成的有界验证,包括未通过的门控,第6节进行总结。附录包含范畴论基础、统计恢复结果以及与相关数学结构的扩展比较。
## 2 上下文变换系统与信息等价性
### 2.1 上下文词汇空间与变换
在询问语义状态是否稳定之前,我们必须说明什么在被改变,什么可以被观察。这对于语言来说,不像欧几里得空间中的向量那样是平凡的。替换结构化记录中的一个数字、重新排序两个句子以及插入否定词都是字符串操作,但它们在科学上的角色不同。第一个可能改变证据,第二个可能保留它,第三个可能反转含义。因此,我们将变换类型及其允许域作为数学对象的一部分。例如,考虑记录“温度为39摄氏度;氧饱和度正在下降。”将39替换为37改变了测量证据。颠倒两个子句的顺序可能保留相同的证据。在“正在下降”前插入“不”将第二个观察变为它的否定。尽管每个操作都编辑字符串,但在此示例中,只有重排序自然地被视为信息保留。明确了这些区别后,我们现在形式化上下文语言空间、其可观察输出以及作用于其上的类型化变换。令 \(\Sigma\) 为有限或可数词汇表,\(\Sigma^*\) 表示在连接下有限字符串的自由幺半群。允许的上下文空间 \(\mathcal{C} \subseteq \Sigma^*\) 配备有一个σ代数 \(\mathcal{A}\)。延续空间 \(\mathcal{W} \subseteq \Sigma^*\) 具有σ代数 \(\mathcal{G}\)。孤立的词类型通常不是足够的单位:在“强劲盈利”中出现的 *强劲* 与在“强劲通胀”中出现的不同。因此,我们取一个词汇出现为一个三元组 \((c, i, w_i)\),包含一个上下文、一个位置以及占据该位置的表达式。短语跨度和结构化证据记录通过允许 \(i\) 索引有限区间或类型化字段而包含在内。
###### 定义 2.1(上下文词汇系统).
一个上下文词汇系统是一个元组 \(\mathfrak{L} = (\Sigma, \mathcal{C}, \mathfrak{T}, \mathcal{O}, \simeq)\),其中 \(\mathfrak{T}\) 是上下文的类型化部分变换范畴,\(\mathcal{O}\) 是一族可测词汇可观测量,\(\simeq\) 是声明的信息

相似文章

HawkesLLM:智能体文本模拟中的语义不确定性传播

arXiv cs.CL

本文介绍了HawkesLLM,一个通过结合用于时间影响和记忆选择的多变量Hawkes过程与用于文本生成的语言模型,对多步骤智能体文本模拟中的语义不确定性传播进行建模的框架。在GDELT新闻级联案例研究上的评估表明,在紧凑的提示-记忆约束下,后期语义对齐得到了改善。