多样性指标真的在衡量多样性吗?一种能力控制下LLM集成中多数投票增益的审计
摘要
本文审计了LLM集成的五个多样性指标,发现它们与多数投票增益的关联与模型能力高度纠缠,且在控制能力后不稳定。唯一稳健的信号是适度的残差成对共失败关联。
arXiv:2607.20768v1 公告类型:新
摘要:对LLM进行多数投票通常被认为能从多样性中获益,且多样性指标被用于选择要组合的模型。我们探究这五个指标是否衡量多样性,还是主要重新表达能力,通过在显式能力控制下,将它们作为在MMLU-Pro(TruthfulQA上29个)上30个LLM的31,900个子集上多数投票相对于最佳成员的增益的预测因子进行审计。得出三个发现。首先,潜在互补性普遍存在:100%的子集中oracle增益为正,但简单投票仅在9.98%的所有规范大小为3的子集中击败最强成员(保留最佳选择时为18.71%);合并的大小为2-4的比率为1.27%,部分反映了确定性偶数大小投票行为。其次,一个联合正确性代理(严格多样性)与1减去平均准确率几乎共线(大小3的Spearman rho = +0.991 / +0.988);原始多样性-增益关联与能力高度纠缠,并且除一个例外,在控制下不稳定。第三,三个线性列联表统计量在代数上不可分离;在能力控制后,经验上稳定的余项是一个适度的残差成对共失败关联,其中更多的共享错误对应更低的增益。这个方向是稳健的,但其幅度依赖于配置。将严格多样性、分歧和双重故障作为独立预测因子的联合原始空间线性回归在构造上是秩亏的。
查看缓存全文
缓存时间: 2026/07/24 05:17
# 多样性指标真的衡量多样性吗?LLM集成中多数投票增益的能力控制审计 来源:https://arxiv.org/html/2607.20768 ###### 摘要 多数投票在LLM中被广泛认为能从多样性中获益,并且多样性度量被用来选择要组合的模型。我们探究了五种这样的度量是否追踪多样性还是主要重新表述能力,通过对30个LLM在MMLU-Pro上(TruthfulQA上29个)的31,900个子集,在明确的能力控制下,将它们作为超过最佳成员的多数投票增益的预测因子进行审计。三个发现浮现。首先,潜在互补性普遍存在:100%的子集中oracle增益为正,但简单投票仅在9.98%的所有规范大小3子集中(18.71%使用留出最佳选择)击败最强成员;合并的大小2-4比例为1.27%,部分反映了确定性偶数大小投票行为。其次,一个联合正确性代理(严格多样性)与一减去平均准确率几乎共线(大小3 Spearman ρ=+0.991/+0.988);原始多样性-增益关联强烈与能力纠缠,且除一个例外,在控制下不稳定。第三,三个线性列联表统计量在代数上不可分离;在能力控制后,经验上稳定的剩余是一个适度的成对共失败关联,其中更多的共享错误对应更低的增益。这个方向是稳健的,但其幅度依赖于配置。将严格多样性、分歧和双故障作为独立预测因子的联合原始空间线性回归在构造上是秩亏的。 ## 1 引言 多数投票是集成学习中的经典聚合规则之一(Dietterich, 2000),其吸引力基于一个经典直觉:如果基预测器在不同输入上失败,即它们是*多样*的,那么投票可以胜过个别错误并超过任何单个成员(Kuncheva and Whitaker, 2003)。该规则在LLM实践中同样核心,从自一致性解码(Wang et al., 2023)到多智能体采样与投票(Li et al., 2024),并且一系列多样性度量被明确或隐含地用于推理应该组合哪些模型。两个事实使这一点对现代LLM变得复杂。LLM错误高度相关,并且更准确的模型如果有什么区别的话,是*更*相关的(Kim et al., 2025; Goel et al., 2025)。因此,近期工作通过自适应过滤(Cohen et al., 2026)、质量匹配池和共失败上限(Chen, 2026),或准确度调整的依赖度量(Ali, 2026)来平衡能力与多样性。我们以测量问题补充这些规定性和同期工作:*对于现代LLM池,在明确能力控制前后,五种与多样性相关的度量如何表现?* 我们通过将实现的多数投票增益(定义为投票准确率减去最佳个体成员的准确率)作为因变量,并在明确能力控制下审计五种与多样性相关的度量作为其预测因子来回答这个问题。击败可用的最强成员是一个刻意严格的标准。它不是唯一操作相关的基线:成本、延迟和模型选择不确定性在部署中都重要(Chen et al., 2024a)。但如果一个集成不能在准确率上超过其最强组成,那么仅凭多样性不能证明在准确率理由上的聚合合理,我们的留出选择分析处理了最强成员事先未知的情况。当引用多样性时,多数投票是被推理的经典规则;我们审计的是那个经典直觉,而不是学习到的聚合器、路由器或判断者。我们的发现是诊断性和令人沮丧的:几种常用的与多样性相关的统计量强烈与能力纠缠,最严重的是三个线性耦合的列联表统计量,即严格多样性、分歧和双故障。调整后,最方向稳定的剩余是适度的成对共失败关联,而其他剩余关联依赖于规格。我们的贡献是: 1. 1. 能力控制审计。我们审计了五种与多样性相关的度量作为多数投票增益的预测因子,覆盖30个现代LLM在MMLU-Pro上的31,900个子集,用29个模型在TruthfulQA上复现,在六种线性能力控制规格(最佳;最佳+均值;以及四种额外规格)下,同时进行非线性和匹配分析、模型级重采样稳健性分析,以及切片和阈值稳健性检查。 2. 2. 与能力纠缠。我们展示了几个成对多样性相关统计量与成员能力强烈纠缠;特别是,我们的联合正确性代理(“严格多样性”)与一减去平均准确率几乎共线(大小3 Spearman ρ=+0.991/+0.988),有助于解释为什么几个反直觉的原始多样性-增益关联在能力控制下减弱或变得规格依赖。 3. 3. 适度的剩余成对共失败轴,以及代数不可分离性。严格多样性、分歧和双故障在代数上不可分离(严格 = 分歧 + 双故障;1 - 平均准确率 = 双故障 + 1/2 分歧),因此均值能力的原始空间线性控制强制一个一维剩余轴(r = -1.000,斜率-1/2),并且三者的联合原始空间线性回归是秩亏的。那个*原始空间坍缩是代数性的*;*经验*发现是对应的秩空间成对共失败信号仍然与多数投票增益相关:更多共享错误对应更低增益。这个方向是稳健的,但其幅度是有条件的。 我们明确说明我们不声称什么。我们不声称多样性从未有帮助,任何单一统计量是唯一“正确”的,或者我们的剩余信号很大。这些声明是测量层面和关联性的,不是因果性的,并且它们的幅度依赖于切片和成员构成(第5.6节,局限性)。 ## 2 相关工作 ### 2.1 经典集成多样性。 集成方法经典地通过(加权)投票组合基预测器(Dietterich, 2000),多样性长期以来被视为关键成分和集成构建的明确目标(Brown et al., 2005)。集成增益反映成员准确率和分歧的直觉可追溯到神经网络集成的歧义分解(Krogh and Vedelsby, 1995)。集成剪枝工作明确优化分类器强度与散度之间的权衡(Zhang et al., 2006),并且统一理论警告不要在不管理偏差/方差/多样性权衡的情况下最大化多样性(Wood et al., 2023)。然而,测量多样性从来不是简单的:Kuncheva 和 Whitaker (2003) 通过成对列联表编目了多样性度量,并发现它们与集成准确率的关系在真实问题上微弱且不一致。他们的编目定义了分歧和双故障(他们的公式6-7),但没有定义 (b+c+d)/N 或 Jaccard 错误重叠;严格多样性是我们对联合正确性的补集的名字。我们在现代LLM集成中重新审视他们的问题,以实现的*超过最佳成员的增益*为目标,并进行明确的能力控制。 ### 2.2 LLM中的投票和自我一致性。 投票式聚合广泛用于LLM:自一致性解码采样多个推理路径并选择众数答案(Wang et al., 2023),通过通用自一致性扩展到自由形式生成(Chen et al., 2024b),并且多智能体研究报告随着实例化智能体数量增加,采样与投票带来的增益(Li et al., 2024; Du et al., 2024)。这些结果激励将多数投票作为研究对象,但它们主要涉及单模型自采样相对于其自身基线的增益,而不是当在*异构*池上投票时击败最强可用成员。Condorcet风格保证需要比有时陈述的条件更强的条件:仅分类器输出的独立性是不够的,还需要其错误的适当独立性(Vardeman and Morris, 2013)。在金融情感实验中,异构NLP/LLM投票仅产生边际改进,作者将其归因于不足的独立性(Lefort et al., 2024)。这是任务特定的预印本证据,不是关于LLM的一般定理。我们的问题是测量版本:当超过最佳成员的多数投票增益是目标时,与多样性相关的度量是否携带超出成员能力的信息? ### 2.3 相关错误和模型相似性。 Kim 等人 (2025) 展示了LLM错误是相关的,并且更强的模型更相关;Goel 等人 (2025) 发现更强的模型犯更相似的错误。这些工作记录了作为我们能力混杂因素基础的*经验模式*,其中准确模型达成一致并共同失败,但研究的是错误相关性本身,而不是多数投票增益,并且没有量化标准多样性度量重新表述能力的强度。我们的诊断建立在这个模式上,并使其对多样性度量的后果精确化。 ### 2.4 LLM集成选择、质量控制和聚合。 规定性工作设计了聚合和选择规则(Chen et al., 2025),包括排名/融合(Jiang et al., 2023; Si et al., 2023)、分层提议者-聚合器(Wang et al., 2025; Li et al., 2026)、焦点多样性剪枝(Tekin et al., 2024)、能力过滤(Cohen et al., 2026)、高阶聚合(Ai et al., 2026)、错误分布塑造(Baek et al., 2026),以及互补性或信息论选择(Zhang et al., 2026; Turkmen et al., 2026)。关于质量匹配、全成员共失败上限(Chen, 2026)和准确度调整依赖(Ali, 2026)的同期工作强化了将依赖性与能力分开的需求。我们的重点是指互补性和诊断性的:未加权的大小2-4多数子集、嵌套控制下的五种与多样性相关的度量,以及三个线性列联表统计量的代数不可分离性。 ## 3 预备知识 ### 3.1 列联表度量、两个恒等式和焦点多样性 对于一对模型在N个项目上,标准的2×2列联表(Kuncheva and Whitaker, 2003)通过每个模型是否正确将每个项目分配到一个单元格。我们选择五个度量来涵盖联合正确性、拆分错误、共享错误、归一化错误重叠和一个最近的LLM特定子集标准。该审计并非旨在成为经典多样性指数的详尽编目。特别是,Q统计量、相关系数和kappa是相同2×2单元格计数的函数,并且Kuncheva 和 Whitaker (2003) 报告这些成对度量强烈互相关;因此我们选择代表不同结构角色的代表,而不是近乎重复的度量。 我们审计四个列联表度量,通过成员对的平均扩展到大小为k的子集: - **严格多样性**(我们的术语;不是Kuncheva和Whitaker编目中的命名度量):SD = (b+c+d)/N,联合正确性的补集。 - **分歧**:(b+c)/N - **双故障(共失败)**:d/N - **平均成对Jaccard错误集相似性**:d/(b+c+d),标准Jaccard指数在模型错误集上,成对平均(当两个错误集都为空时为零)。成对比值的平均值接近但不等于和的合并比值(最大偏差0.089);我们在整个过程中保留成对均值定义。 两个精确恒等式框定了分析。 首先,严格 = 分歧 + 双故障,max|ε| < 1.9×10^{-16},其中ε是数值验证误差。因此,严格、分歧和双故障是线性相关的,无论成对还是成对平均后。在对级别,Jaccard是比值 double-fault/strict。然而,由于子集统计量平均成对Jaccard比值,它不由子集级别平均的双故障和严格度量代数决定(与它们的比值的最大观测偏差为0.089)。 第二,令平均准确率 = (2a+b+c)/(2N) 为对均值准确率,则 1 - 平均准确率 = 双故障 + 1/2 分歧,这是在成对平均到子集级别后保持的精确恒等式。在原始(未排序)度量空间中,任何包含成员均值准确率的线性残差化因此强制 双故障残差 = -1/2 分歧残差,精确地(Pearson r = -1,斜率-1/2)。这个恒等式在用于偏Spearman相关性的边际秩变换后不一定保持,因此表3中的控制幅度不一定对称。均值控制后的原始空间一维性因此是*代数性*的;对应的秩空间与多数投票增益的关联是否稳健是*经验性*的(第5.4节–第5.5节)。 此外,我们审计焦点多样性(Tekin et al., 2024, Eq. 10),一个子集级别度量,*不是*这个代数家族的成员。对于大小为k的模型子集,令 F_q 为成员相似文章
我们测量的是策略还是措辞?LLM数学推理中表面多样性与策略多样性之间的差距
本文引入了LLM数学推理中的策略多样性概念,表明表面多样性指标是不可靠的替代指标,而直接优化策略多样性仍是一个开放问题。
多未必佳:LLM观点多样性的关键因素是什么?
一项析因实验表明,角色细节并不会单调增加LLM观点多样性;不同的交互架构探索了互不重叠的观点区域;而温度缩放等低成本干预措施效果甚微。
采样更多,获得更少:校准是大语言模型多样性的瓶颈
本文引入了一种有效性-多样性框架,将大语言模型中的多样性崩溃归因于解码过程中的排序和形状校准偏差,并在 14 种语言模型上进行了验证。
随机采样在认知上是浅层的:大语言模型中温度变化与模型多样性之间的维度差距
本文研究了大语言模型(LLM)中的随机采样(自一致性)能否捕捉类似于多样化集成的跨问题结构。通过使用Marchenko–Pastur检验,作者发现,在单个模型内,随机变异最多产生一个显著维度,而24个模型的集成则产生四个,揭示了限制自一致性作为集成替代方案的维度差距。
LLM群体智慧:语言模型集成中的聚合与污染
本文研究了将多个LLM的概率估计进行聚合是否会产生群体智慧效应,发现学习型聚合器优于单个模型,并且训练截止期污染是此类评估中普遍存在的混淆因素。