推断的生成过程多样性预测语言模型中的关联故障

arXiv cs.LG 论文

摘要

本文介绍了使用归一化压缩距离作为衡量语言模型的生成过程多样性的方法,证明其在预测跨基准关联故障方面优于语义相似性,并对多模型系统的安全性具有启示意义。

arXiv:2609.03422v1 宣告类型:新 摘要:多样性是集体系统中广泛观察到的因素,但其重要性取决于系统的属性和故障模式。对于由多个语言模型组成的系统,这一区分尤为重要。不同模型可能被视为独立组件,即使其行为和故障仍保持强关联。使用语义相似性对语言模型群体进行评估显示出有限的语义多样性,但这仅捕获了观测输出意义的差异。我们认为,更基本的模型多样性概念是生成过程多样性,即能够生成观测输出的过程之间的差异。借鉴算法信息论,我们使用原始模型输出之间的归一化压缩距离,经排列控制残差化处理,作为推断生成过程多样性的度量。在38个语言模型中,该度量识别出语义相似性遗漏的群体结构,并预测了十个互不相交的基准族中模型对之间在机会校正后的跨任务关联变异,超越了语义相似性和模型对能力。跨基准部分秩关联为$-0.216$,95%区间为$[-0.309,-0.122]$,且在所有十个基准上估计为负值。这些结果表明,生成过程多样性的增加与模型对中关联故障的减少相关,且这种关联不能归因于语义相似性或能力。推断的生成过程多样性为研究多模型系统在安全相关背景下的多样性提供了一种新颖且实用的方法。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:27

# 推断的生成过程多样性可预测语言模型间的关联性故障
来源:https://arxiv.org/html/2609.03422
Ross Tieman††脚注说明:同等贡献。Evan Markou11脚注说明:1同等贡献。隶属机构:计算学院隶属机构:澳大利亚国立大学
{ross.tieman,evan.markou}@anu.edu.au

###### 摘要
多样性是维持集体系统稳健运行中被广泛观察到的因素,但何种类型的多样性具有意义取决于系统的属性与故障模式。这一区分对于由多个语言模型组成的系统至关重要。不同的模型即使在其行为和故障仍保持高度相关时,也可能被视为独立的组件。使用语义相似性对语言模型群体进行评估表明其语义多样性有限,但这仅捕捉了观测输出的含义差异。我们认为,模型多样性更根本的概念是*生成过程多样性*,即能够生成观测输出的过程之间的差异。借鉴算法信息理论,我们使用原始模型输出的归一化压缩距离(在经排列控制残差处理后)作为推断生成过程多样性的度量。在38个语言模型上,该度量识别出语义相似性所遗漏的群体结构,并能在十个互不重叠的基准测试系列中,超越语义相似性和模型对能力,预测模型对在机会校正关联性故障上的跨任务变化。跨基准测试的偏序相关系数为−0.216−0.216,95%置信区间为[−0.309,−0.122][−0.309,−0.122],且该估计在所有十个基准测试系列中均为负值。这些结果表明,生成过程多样性的增加与模型对关联性故障的减少相关,且这种关联无法归因于语义相似性或能力。推断的生成过程多样性为在安全相关情境中研究多模型系统的多样性提供了一种新颖且实用的方法。

## 1引言
语言模型越来越多地被部署为更大系统的组件。集成方法聚合其预测,监督方案指派模型相互批评,多智能体架构将任务分配给多个模型实例。此类系统具有吸引力,因为组合模型可以提高集体性能和可靠性。互补的能力可以扩展系统的能力范围,而冗余组件则可在某个组件失效时保持功能[1 (https://arxiv.org/html/2609.03422#bib.bib46), 2 (https://arxiv.org/html/2609.03422#bib.bib47)]。然而,这两种益处都不是仅仅通过增加模型数量就能实现的。如果模型共享相同的弱点并重复相同的错误,增加一个投票者或审查者只是名义上增加了冗余,却没有增加另一道防线。关键在于组件之间的差异是否与系统的功能和故障模式相关。在智能体系统中,将多样性框架置于生成过程层面[3 (https://arxiv.org/html/2609.03422#bib.bib50)],促使我们对完整配置——模型、指令、记忆、工具、集成框架逻辑以及交互历史——而不仅仅是模型本身进行比较。
关于生态弹性和集体适应性的研究明确阐述了这一区分。功能多样性可以扩展集体可用的能力,而响应多样性——即对同一功能有贡献的组件对扰动的响应差异——才是使冗余能够缓冲集体功能免受故障影响的关键[4 (https://arxiv.org/html/2609.03422#bib.bib44), 5 (https://arxiv.org/html/2609.03422#bib.bib45), 6 (https://arxiv.org/html/2609.03422#bib.bib5)]。关于集体适应性的研究同样表明,异质的信息和策略可以改善问题解决能力,并在条件变化时保留替代响应,而同质化则可能导致集体收敛到相同的局部有效行为[7 (https://arxiv.org/html/2609.03422#bib.bib2), 8 (https://arxiv.org/html/2609.03422#bib.bib33)]。这些领域的观察和理论为理解多智能体系统稳健运行所需的特性提供了直观认识。这引出了一个问题:模型变异的哪个维度与冗余旨在缓解的故障模式相关?
当代语言模型在提供商、架构、规模、训练过程和接口上存在差异,但这些属性并不能确保行为的独立性。来自不同前沿实验室的模型选择相同错误答案的频率高于其各自错误分布所预期的频率[9 (https://arxiv.org/html/2609.03422#bib.bib8), 10 (https://arxiv.org/html/2609.03422#bib.bib34)]。人工蜂巢现象也表明,在模型群体的开放式响应中存在显著的语义相似性[11 (https://arxiv.org/html/2609.03422#bib.bib10)]。语义相似性捕捉的是输出表达的含义是否相似。它并不能确定模型是否共享相同的生成规律,或者是否会在另一个任务上犯相同的错误。模型可以通过不同的过程产生语义相似的答案,或者尽管共享过程层面的规律性却产生语义不同的答案。
我们引入*生成过程多样性*来区分这些问题。语言模型是一个随机过程,将提示和上下文映射到输出序列的分布上,通过添加到智能体框架中,可以扩展到动作-观测序列。生成过程多样性关注的是能够产生观测行为的过程之间的差异,而不是所得输出的某一选定属性的差异。由于专有模型的内部机制通常不可用,从其输出中推断过程层面的关系提供了一种实用的比较途径。虽然无法重建神经计算,但可以确定可观测序列是否包含关于其生成过程的比较信息,这些信息是语义相似性所遗漏的,并且能推广到安全相关的结果。
算法信息理论(AIT)通过共享描述长度激发了一种无特征的比较方法。我们使用对原始响应进行归一化压缩距离(NCD)来近似它,允许压缩器利用序列规律性,而无需首先将输出映射到语义表示中[12 (https://arxiv.org/html/2609.03422#bib.bib16), 13 (https://arxiv.org/html/2609.03422#bib.bib7)]。因为原始的NCD也反映了边际字节组成,所以我们使用匹配的排列控制进行残差处理,该控制保留字节频率但破坏顺序。由此产生的度量捕捉了超越边际输出统计的序列组织,并提供了推断生成过程多样性的估计。
我们使用任务迁移设计来评估该度量。我们专注于语言模型的输入-输出行为,没有额外的智能体框架或工具,作为生成过程多样性的初步测试。这提供了一个受控环境来评估多样性度量,然后再将其扩展到更复杂的智能体配置。多样性是通过38个语言模型对Infinity-Chat分类法[11 (https://arxiv.org/html/2609.03422#bib.bib10)]中100个开放式提示的重复响应来估计的。然后,我们测试这个独立推导出的群体几何结构是否能预测同一模型群体中模型对在十个互不重叠的封闭形式基准测试系列上关联性错误答案的跨任务变化,同时控制语义相似性和能力。该设计测试了从可观测模型行为推断出的过程层面变异是否能识别出在不同任务上失败更独立的模型对,而不仅仅是压缩距离和嵌入距离之间的相关性。
本工作有三个贡献:
1. 1\. 我们相对于系统功能定义了生成过程多样性,并使用排列控制残差化NCD来估计它。
2. 2\. 我们表明,推断的生成过程多样性揭示了与语义相似性相关但不冗余的群体结构。排列控制将序列特定成分从边际输出组成中分离出来,而这些成分与关联性故障具有相反的关系。
3. 3\. 我们证明了推断的生成过程多样性能够预测所评估模型对在关联性故障上的跨任务变化,且超越了语义相似性和能力。在交叉控制规范下,这种关联在所有十个基准测试系列中均为负值,跨基准测试平均值为−0.216−0.216,95%置信区间为[−0.309,−0.122][−0.309,−0.122]。实证结果是所评估模型群体内的成对跨任务预测。其方向和支持生成过程多样性作为有效冗余的潜在来源,为多模型系统的关联性故障潜力提供信息。

## 2相关工作
弹性研究区分了功能多样性和响应多样性。当执行相同功能的组件对扰动做出不同响应时,冗余可以保护系统[4 (https://arxiv.org/html/2609.03422#bib.bib44), 5 (https://arxiv.org/html/2609.03422#bib.bib45), 6 (https://arxiv.org/html/2609.03422#bib.bib5)]。应用于模型群体,这种观点警告说,组织标签并不必然意味着行为独立;来自不同提供商的模型仍可能高于特定对的随机概率选择相同的错误答案[9 (https://arxiv.org/html/2609.03422#bib.bib8), 10 (https://arxiv.org/html/2609.03422#bib.bib34)]。人工蜂巢现象启发了我们的语义基线,但语义相似性衡量的是共享的含义,而非共享的生成组织[11 (https://arxiv.org/html/2609.03422#bib.bib10)]。AIT提供了一种无特征的替代方案。归一化信息距离定义了理想的共享描述关系,而NCD通过压缩长度来近似它[12 (https://arxiv.org/html/2609.03422#bib.bib16), 13 (https://arxiv.org/html/2609.03422#bib.bib7)]。我们测试这种结构是否能预测超越语义距离和能力的关联性故障;附录E (https://arxiv.org/html/2609.03422#A5)提供了扩展讨论。

## 3测量生成过程多样性与关联性故障
### 3.1问题表述与压缩距离
令 $m_i, i \in \{1,...,M\}$ 为一个黑盒部署的模型配置,$x_{iqr}$ 为其对提示 $q$ 的第 $r$ 次响应。我们寻求一个成对统计量 $d(i,j)$,通过在匹配提示条件下生成的字符串来比较部署的配置。因为有限的观测无法识别唯一的机制,“推断的生成过程多样性”指的是部署配置之间源自输出的关系,而非恢复的神经计算。它可以反映由模型权重、后训练、提示、解码或其交互引入的持久规律性。
对于压缩长度 $C(\cdot)$ 和连接 $xy$,NCD 定义为:
$\operatorname{NCD}_C(x,y)=\frac{C(xy)-\min\{C(x),C(y)\}}{\max\{C(x),C(y)\}}$。(1)
这是组合两个有向压缩增量的族中的 $p=\infty$ 成员。令 $u_C=C(xy)-C(y)$, $v_C=C(xy)-C(x)$, $I_C=C(x)+C(y)-C(xy)$。
对于 $p\in\{1,2,\infty\}$,定义 $V_p^C(x,y)=\frac{\|(u_C,v_C)\|_p}{I_C+\|(u_C,v_C)\|_p}$。(2)
那么 $V_\infty^C$ 是 NCD,$V_1^C$ 是算法 Jaccard 距离的压缩类似物,而 $V_2^C$ 介于两者之间。NCD 保留较大的有向增量,而有限的 $p$ 也保留较小的增量。当两个方向上的分离(而非大的单侧差异)与结果相关时,这种额外的敏感性可能很有用。我们使用 NCD 作为主要度量,并使用 $V_1^C$ 和 $V_2^C$ 来测试结果是否依赖于这种聚合选择;附录B (https://arxiv.org/html/2609.03422#A2) 给出了完整构造及其理论特性。较低的值表示共享的可压缩结构更多。报告的距离使用通过 pypmd 库默认内存设置的 PPMd 变体 I [14 (https://arxiv.org/html/2609.03422#bib.bib15)]。响应是字面的 UTF-8 字节串。没有令牌聚类、语言模型符号化或其他学习表示进入压缩路径。
对于每个提示和无序模型对,我们首先对 $K=\min(R_i,R_j,50)$ 对位置配对的响应距离取平均值,然后对提示取等权重平均值。下面的排列残差化处理适用于族中的每个成员。

### 3.2响应语料库与排列残差
我们从对开放式 Infinity-Chat 提示的重复响应固定语料库中估计压缩和语义预测变量,这些响应独立于基准测试结果生成。附录A.1 (https://arxiv.org/html/2609.03422#A1.SS1) 给出了语料库组成、采样设置、分析的文本字段和过滤过程。
原始的 NCD 对边际字节频率和顺序都有响应。对于每个响应,我们生成 $P=20$ 个确定性随机字节排列。每个代理保留长度和精确的字节多重集,同时破坏原始顺序;由于 UTF-8 是按字节排列的,多字节字符不会作为单元保留。令 $d_{ijq}^{\mathrm{NCD}}$ 表示模型对 $(i,j)$ 在提示 $q$ 上的平均原始 NCD,令 $d_{ijq}^{\mathrm{perm}}$ 表示对排列后的响应应用相同的距离和聚合过程后对应的平均值。对于每个提示,我们对 $\binom{M}{2}$ 个无序模型对的原始距离及其排列控制进行回归,如下所示:
$(\widehat{\alpha}_q,\widehat{\beta}_q)=\argmin_{a,b} \sum_{1\leq i<j\leq M} (d_{ijq}^{\mathrm{NCD}} - (a + b\,d_{ijq}^{\mathrm{perm}}))^2$。(3)
残差 $\widehat{\epsilon}_{ijq} = d_{ijq}^{\mathrm{NCD}} - (\widehat{\alpha}_q + \widehat{\beta}_q\,d_{ijq}^{\mathrm{perm}})$ 消除了仅由边际字节组成驱动的变异。为了组合残差,我们首先对每个模型对的提示进行平均:$\bar{\epsilon}_{ij} = \frac{1}{Q}\sum_{q=1}^Q \widehat{\epsilon}_{ijq}$。成对的排列控制残差化 NCD 为 $\delta_{ij}^{\mathrm{NCD}} = \bar{\epsilon}_{ij}$。当排列控制解释了变异时,它可以防止边际字节频率与相关性混淆。

### 3.3语义相似性基线
我们将语义相似性度量作为概念上不同的基线。我们使用在通用句子嵌入语料库上微调的基于Transformer的嵌入模型,生成每个响应的768维向量。对于每个提示和模型对,我们计算平均嵌入之间的余弦距离。然后,我们对模型对取提示平均值,得到语义距离 $\delta_{ij}^{\mathrm{sem}}$。这捕捉了响应含义的共享性,但不涉及生成组织。

### 3.4模型能力控制
我们通过在涵盖不同难度和领域的十个基准测试系列上的平均准确率来控制模型能力。我们将每个模型的平均准确率(跨所有任务)与其伙伴的平均准确率进行平均,以形成成对能力控制 $\delta_{ij}^{\mathrm{cap}}$。这控制了模型对平均能力与其关联性故障相关性。

### 3.5跨任务关联性故障
对于每个基准测试系列 $b$ 和模型对 $(i,j)$,我们计算在 $T_b$ 个任务上观测到的与随机预期相比的关联性错误答案的超出部分。具体来说,令 $e_{i,t}$ 和 $e_{j,t}$ 为模型 $i$ 和 $j$ 在任务 $t$ 上的错误指标(1 表示错误,0 表示正确)。观测到的关联性故障为 $\phi_{ij}^b = \frac{1}{T_b} \sum_{t=1}^{T_b} e_{i,t} e_{j,t}$。每个任务的随机预期关联性故障为 $\pi_{i,t} \pi_{j,t}$,其中 $\pi_{i,t}$ 是模型 $i$ 在任务 $t$ 上的错误率。机会校正的关联性故障为 $\psi_{ij}^b = \phi_{ij}^b - \frac{1}{T_b} \sum_{t=1}^{T_b} \pi_{i,t} \pi_{j,t}$。该度量捕捉了模型对在特定基准测试系列中比从其个体错误率预期的更频繁地一起失败的程度。

### 3.6预测模型
为了测试推断的生成过程多样性是否预测跨任务关联性故障,我们使用线性混合效应模型。对于每个基准测试系列 $b$,我们建模:
$\psi_{ij}^b = \alpha_b + \beta_b^{\mathrm{NCD}} \delta_{ij}^{\mathrm{NCD}} + \beta_b^{\mathrm{sem}} \delta_{ij}^{\mathrm{sem}} + \beta_b^{\mathrm{cap}} \delta_{ij}^{\mathrm{cap}} + u_b + \epsilon_{ij}^b$。(4)
这里 $u_b$ 是基准测试系列随机效应,$\epsilon_{ij}^b$ 是残差。主要关注点是 $\beta_b^{\mathrm{NCD}}$,它表示在控制语义相似性和能力后,排列控制残差化 NCD 与机会校正关联性故障之间的偏相关。负的 $\beta_b^{\mathrm{NCD}}$ 表明更大的推断生成过程多样性与更少的关联性故障相关。

## 4结果
### 4.1生成过程多样性揭示群体结构
排列控制残差化 NCD ($\delta^{\mathrm{NCD}}$) 与语义距离 ($\delta^{\mathrm{sem}}$) 相关(成对斯皮尔曼 $\rho = 0.32$),但揭示了显著的额外结构(附录图1)。在语义距离高但 $\delta^{\mathrm{NCD}}$ 低的区域(右下象限),模型产生含义不同但共享深层生成规律性的响应。相反,在 $\delta^{\mathrm{NCD}}$ 高但语义距离低的区域(左上象限),模型产生含义相似但由不同过程生成的响应。这种区别表明生成过程多样性捕捉了语义相似性遗漏的变异维度。

### 4.2生成过程多样性预测关联性故障
在十个基准测试系列中,$\beta^{\mathrm{NCD}}$ 的估计值均为负值(图2,附录表1)。跨基准测试平均 $\beta^{\mathrm{NCD}}$ 为 -0.216,95% 置信区间为 [-0.309, -0.122]。这意味着在控制语义相似性和能力后,推断的生成过程多样性每增加一个标准差,机会校正的关联性故障平均减少约 0.216 个标准差。这种效应在所有基准测试系列中方向一致,表明结果对聚合选择具有稳健性。

### 4.3排列控制至关重要
当使用未经残差化的原始 NCD 时,关联性不一致且在许多基准测试系列中为正(附录表2)。排列控制通过移除边际字节组成的影响,将方向翻转为一致的负值。这证实了原始 NCD 中的正相关是由共享的字节统计驱动的,而与生成过程多样性无关。正确的信号仅在序列组织成分中可见。

## 5讨论
推断的生成过程多样性提供了一种超越组织标签或语义内容来量化模型差异的方法。其与关联性故障的负相关表明,在模型群体中增加此多样性可以提高系统可靠性。这支持了冗余需要在过程层面具有独立性的观点。
该度量具有实践优势:它需要的仅是原始响应,因此适用于黑盒模型。它为多模型系统的设计提供了一个可量化的指导:优化配置以增加生成过程多样性,而不仅仅是语义覆盖或平均能力。

## 局限性与未来工作
当前工作专注于输入-输出行为,未考虑带有工具或记忆的智能体配置。未来工作应测试该度量在智能体环境中的有效性。此外,该度量基于字节级压缩,可能对非文本模态不直接适用。最后,虽然我们控制了能力,但其他混杂因素(如训练数据重叠)值得进一步研究。

相似文章

多样性注入的位置至关重要:面向多样化生成的统一框架

arXiv cs.CL

本文提出了一个用于大型语言模型测试时多样化生成的统一框架,根据多样性注入的位置(表面级 vs. 规范级)对方法进行分类。它提出了规范级方法,首先生成多样化的中间规范,然后基于这些规范生成最终响应。在五个开放任务和四个骨干模型上,规范级注入在保持质量的同时提升了输出多样性。

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。

通过混合条件策略展示泛化失败

arXiv cs.AI

本文提出了一种方法,通过强化学习训练时构建可控泛化失败的语言模型,展示了训练成功与泛化在结构化方式下可能发生偏离。