随机采样在认知上是浅层的:大语言模型中温度变化与模型多样性之间的维度差距

arXiv cs.AI 论文

摘要

本文研究了大语言模型(LLM)中的随机采样(自一致性)能否捕捉类似于多样化集成的跨问题结构。通过使用Marchenko–Pastur检验,作者发现,在单个模型内,随机变异最多产生一个显著维度,而24个模型的集成则产生四个,揭示了限制自一致性作为集成替代方案的维度差距。

arXiv:2607.20464v1 公告类型:新 摘要:当语言模型在重复运行时给出不同答案时,这种变化是否揭示了它不知道的东西?自一致性通过多数投票将这种变化转化为每个问题的不确定性估计。但是,同样的变化是否揭示了跨问题结构——相关的问题一起翻转,就像多样化集成那样?我们在相同问题上比较了两种方案:一个模型在τ=1下运行100次,与24个LLM(大语言模型)组成的集成,每个模型在τ=0下运行一次。Marchenko–Pastur随机矩阵检验从两侧的信号中分离出采样噪声。在任何一个单一模型内部,跨五个系列和三个基准(MMLU、HellaSwag、GSM8K),最多只有一个维度高于噪声水平。而在集成中,四个特征值超过了噪声边缘,而匹配难度的伯努利零假设在500次蒙特卡洛抽样中最多产生一个。自一致性提供了准确的每个问题不确定性,但没有可检测的跨问题结构;只有多样化的集成才能揭示模型不知道的东西。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:00

# 1 引言 来源: https://arxiv.org/html/2607.20464 marginparsep 已被修改. topmargin 已被修改. marginparpush 已被修改. 页面布局违反了 ICML 样式。请勿更改页面布局,或引入 geometry、savetrees 或 fullpage 等会改变页面布局的宏包。我们无法可靠地撤销对样式的任意更改。请移除违规宏包或布局更改命令后重试。 随机采样在认知上是浅薄的:LLM 中温度变化与模型多样性之间的维度差距 Izhar Ali¹ ###### 摘要 当一个语言模型在多次运行时给出不同答案,这种变化是否揭示了它不知道的内容?自一致性通过多数投票将这种变化转化为每个问题的不确定性估计。但同样的变化能否揭示跨问题的结构——相关问题共同翻转,就像多样化的集成模型那样?我们在相同的问题上比较两种机制:一个模型在 τ=1 下运行 100 次,与一个由 24 个 LLM 组成的集成(每个在 τ=0 下运行一次)进行对比。使用 Marchenko–Pastur 随机矩阵检验区分信号与采样噪声。在任一单模型内部,跨五个模型系列和三个基准(MMLU、HellaSwag、GSM8K),最多只有一个维度高于噪声。而在集成中,有四个特征值超过噪声边界,而匹配难度的伯努利零假设在 500 次蒙特卡洛抽样中最多只产生一个。自一致性可以提供准确的逐问题不确定性估计,但无法检测到跨问题结构;只有多样化的集成才能揭示模型不知道什么。 ††footnotetext:¹ 罗文大学。通讯作者:Izhar Ali ([email protected])。第 2 届机器学习认知智能研讨会 (EIML@ICML 2026),韩国首尔。版权所有 2026 作者。自一致性 (Wang et al., 2023 (https://arxiv.org/html/2607.20464#bib.bib8)) 已成为 LLM 默认的低成本不确定性估计方法,其衍生方法将随机变化解读为模型已知信息的信号:答案重复置信度 (Kadavath et al., 2022 (https://arxiv.org/html/2607.20464#bib.bib21))、通过一致性标记幻觉 (Manakul et al., 2023 (https://arxiv.org/html/2607.20464#bib.bib22))、语义熵 (Farquhar et al., 2024 (https://arxiv.org/html/2607.20464#bib.bib7))。这种信号能否替代成本更高的深度集成方法 (Lakshminarayanan et al., 2017 (https://arxiv.org/html/2607.20464#bib.bib14)),取决于它携带何种信息。首先,随机样本可以通过平均独立噪声来估计每个问题的成功概率 p_i。其次,它们可以揭示跨问题结构:相关问题之间的相关性误差,就像多样化集成所做到的那样 (Kendall and Gal, 2017 (https://arxiv.org/html/2607.20464#bib.bib23); Hüllermeier and Waegeman, 2021 (https://arxiv.org/html/2607.20464#bib.bib24))。要替代集成模型,自一致性也需要具备第二种能力。跨模型的维度特性已有很好的刻画——单一因子可以解释 5000+ 模型上 79% 的方差 (Kipnis et al., 2025 (https://arxiv.org/html/2607.20464#bib.bib1)),因子分析在 60 个模型上得到 8 个维度 (Maimon et al., 2025 (https://arxiv.org/html/2607.20464#bib.bib2)),低维联合嵌入 (Yao et al., 2025 (https://arxiv.org/html/2607.20464#bib.bib3))——但这些都是对模型×基准分数矩阵的分析。在采样噪声零假设下,模型内部的维度尚未被测量。我们通过 Marchenko–Pastur 检验 (Marčenko and Pastur, 1967 (https://arxiv.org/html/2607.20464#bib.bib10)) 来分析运行×问题正确性矩阵,以填补这一空白。内部一个维度,外部四个维度:这就是“维度缺口”。 #### 贡献. 1. 1.我们定义了模型内部认知维度,即单个模型随机样本中结构化误差的独立方向数。 2. 2.实证发现,在五个 LLM 中(涵盖 MMLU、HellaSwag、GSM8K 思维链三个基准),每个模型的内部至多只有一个高于噪声的维度;而在 24 个多样化模型组成的集成上,MMLU 中有四个高于噪声的维度——这在 500 次匹配难度的伯努利零假设抽样中从未出现。 ## 2 方法 ### 2.1 模型内部随机探测 设 M 为语言模型,{q_1, …, q_N} 为 N 个问题。我们在温度 τ>0 下为每个问题生成 K 个随机补全。对于第 k 次运行和第 i 个问题,定义 c_ki = { 1 如果 M 在第 k 次运行中正确回答 q_i, 0 否则. } 这给出一个 K×N 的二进制矩阵 C。如果问题 i 的通过率 f_i = (1/K) ∑_k c_ki 落在 (ε, 1-ε) 区间内(ε=0.05),则将该问题视为“边界问题”。设 C_B 表示 C 限制到 N_b 个边界问题;只有这些问题对后续的相关性检验贡献非平凡方差。 ### 2.2 Marchenko–Pastur (MP) 零假设检验 我们使用随机矩阵零假设来检验 C_B 的列独立性。计算 C_B 的 N_b×N_b 相关矩阵 R(每个边界问题作为一个变量,每次运行作为一个观测),及其特征值 λ_1 ≥ … ≥ λ_{N_b}。在独立伯努利列的零假设下,R 的谱服从 Marchenko–Pastur 律 (Marčenko and Pastur, 1967 (https://arxiv.org/html/2607.20464#bib.bib10)),上界为 λ_+ = (1+√γ)^2,γ := N_b/K,且标准化后的最大特征值 z := (λ_1 - λ_+)/σ_TW 收敛于 Tracy–Widom F_1 (命题 A.2 (https://arxiv.org/html/2607.20464#A1.Thmtheorem2))。我们使用 z 作为主要零假设检验,并报告超过 λ_+ 的特征值数量 |{i: λ_i > λ_+}| 作为粗略总结;同时使用 Horn 平行分析 (Horn, 1965 (https://arxiv.org/html/2607.20464#bib.bib9)) 进行交叉验证 (附录 B.1 (https://arxiv.org/html/2607.20464#A2.SS1))。拒绝此零假设直接证明了结构化内部不确定性的存在:温度采样对每个提示注入独立噪声,因此跨问题协变需要一种它无法提供的耦合机制。如果每个问题独立翻转,则相关矩阵渐近于纯噪声——没有特征值能超过 λ_+ 超出 Tracy–Widom (TW) 波动的范围 (命题 A.2 (https://arxiv.org/html/2607.20464#A1.Thmtheorem2), 附录 A (https://arxiv.org/html/2607.20464#A1))。 ### 2.3 跨模型比较 我们将相同的 MP 检验应用于一个由 M 个模型组成的多样化集成,每个模型在 τ=0 下运行一次,以模型(而非运行)作为观测。我们将问题限制在模型出现分歧的问题上(既非全对也非全错)——这是 §2.1 (https://arxiv.org/html/2607.20464#S2.SS1) 中边界过滤器的跨模型类比。主要统计量是 MP 信号计数,并通过与独立伯努利零假设(每列的经验通过率与实际每问题通过率匹配,进行 500 次蒙特卡洛抽样;§3.3 (https://arxiv.org/html/2607.20464#S3.SS3))进行校准。为了与先前因子分析工作 (Kipnis et al., 2025 (https://arxiv.org/html/2607.20464#bib.bib1); Maimon et al., 2025 (https://arxiv.org/html/2607.20464#bib.bib2); Yao et al., 2025 (https://arxiv.org/html/2607.20464#bib.bib3); Wen et al., 2025 (https://arxiv.org/html/2607.20464#bib.bib12)) 的可比性,我们也报告香农有效秩 exp(H);它在任意异质率零假设下都会接近 M-1 上限,是一个可比性统计量,而非独立性检验 (附录 B.3 (https://arxiv.org/html/2607.20464#A2.SS3))。 ### 2.4 实验设置 #### 数据集. N=500 个 MMLU (Hendrycks et al., 2021 (https://arxiv.org/html/2607.20464#bib.bib15)) 问题(测试集拆分),覆盖 57 个学科。 #### 模型内部. 五个模型,每个问题在 τ=1.0 下进行 K=100 次随机补全:Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3、SmolLM2-1.7B-Instruct、Phi-3-mini-4k-Instruct、Meta-Llama-3-8B-Instruct。温度鲁棒性:在 Qwen2.5-7B 上,τ∈{0.5, 1.5},K=30,N=100。 #### 跨模型. N=500 个 MMLU 问题,每个模型在 τ=0 下运行 1 次,共 24 个指令微调模型,覆盖 11 个系列和 0.5B–22B 参数范围:Qwen (5)、Mistral (4)、Zephyr-7B、Phi (3)、SmolLM2-1.7B、OLMo-2-7B、Yi-1.5-6B、DeepSeek-7B、Granite-3.1-8B、Llama (4)、Gemma-2 (2)。 ## 3 结果 ### 3.1 模型内部:无高于噪声的结构 在单个模型内部,运行×问题正确性矩阵在统计上与独立伯努利抽样无法区分:最多只有一个特征值达到 MP 边界,且仅在 Tracy–Widom 采样噪声范围内。Qwen2.5-7B-Instruct (在 τ=1.0 下 71.2%;贪心解码 77.4%) 有 121/500 个边界问题;其余 379 个接近确定性。 #### MP 检验. 最大特征值低于 MP 噪声边界 (λ_1=4.17 vs. λ_+=4.41, γ=1.21):零个高于噪声的特征值 (图 1 (https://arxiv.org/html/2607.20464#S3.F1)a)。在某次通过中答对历史问题,无法预测同次通过中化学问题的正确性,也无法预测任何同主题问题(主题内和主题间的边界相关性均 ≈0)。Horn 平行分析也得出相同结论。d_within ≤ 1 的上限在 ε∈[0.01, 0.20] 范围内均成立 (图 A1 (https://arxiv.org/html/2607.20464#A2.F1))。 #### 跨五个系列的复制. 相同模式出现在 Mistral-7B、SmolLM2-1.7B、Phi-3-mini 和 Meta-Llama-3-8B 上 (K=100, τ=1.0;边界问题数量 121–403);SmolLM2 的 λ_max=9.05 触及 λ_+=9.04 但仍在 MP 采样噪声范围内 (TW z=+0.05;表 1 (https://arxiv.org/html/2607.20464#S3.T1))。五个系列,1.7B–8B 参数,没有一个具有 MP 显著信号。 ### 3.2 泛化:HellaSwag 和 GSM8K 该零结果并非 MMLU 特有的伪影。三个模型在 HellaSwag (Zellers et al., 2019 (https://arxiv.org/html/2607.20464#bib.bib18)) (N=200, K=50) 上,以及 Qwen2.5-7B 在 GSM8K 思维链 (Cobbe et al., 2021 (https://arxiv.org/html/2607.20464#bib.bib17)) (N=100, K=30) 上也均给出零信号特征值 (表 1 (https://arxiv.org/html/2607.20464#S3.T1))。HellaSwag 主题内和主题间相关性接近零 (|r|≤0.05):即使在数据集的 activity 分组下也不存在语义耦合。请参阅图注图 1:维度缺口。(a) 边界 MMLU 问题正确性相关矩阵的特征值谱 (Qwen2.5-7B, K=100, N_b=121)。没有特征值超过 MP 噪声边界 λ_+=4.41 (红色虚线)。(b) 相同度量比较:五个系列在三个任务上的 MP 信号计数均 ≤1,但 24 模型集成 (τ=0) 有 4 个,而 500 次匹配难度独立伯努利零假设抽样从未出现此情况。(c) Qwen2.5-7B 上的分裂半 p_i (r=0.994):连续样本是从固定逐问题伯努利分布中独立抽取的。表 1:三个基准上的 Marchenko–Pastur 检验。对于每个模型,边际 λ_+ − λ_max 非负或在 MP 噪声范围内 (SmolLM2 ≤1 信号维度)。TW z:λ_max 在零假设下超过 MP 边界的标准差数 (附录 A (https://arxiv.org/html/2607.20464#A1));在 K=100 时蒙特卡洛均值 ≈ -1.60。模型 | N_b | λ_+ | λ_max | 边际 | TW z *MMLU* (K=100, N=500) Qwen2.5-7B | 121 | 4.41 | 4.17 | +0.24 | -2.01 Mistral-7B-v0.3 | 283 | 7.19 | 6.85 | +0.34 | -2.37 SmolLM2-1.7B | 403 | 9.04 | 9.05 | -0.01 | +0.05 Phi-3-mini | 269 | 6.97 | 6.78 | +0.19 | -1.36 Meta-Llama-3-8B | 173 | 5.36 | 5.05 | +0.31 | -2.37 *HellaSwag* (K=50, N=200) Qwen2.5-7B | 15 | 2.40 | 2.21 | +0.18 | -1.15 Mistral-7B-v0.3 | 58 | 4.31 | 4.04 | +0.28 | -1.45 Meta-Llama-3-8B | 82 | 5.20 | 4.80 | +0.40 | -1.96 *GSM8K* (K=30, N=100) Qwen2.5-7B | 65 | 6.11 | 5.72 | +0.39 | -1.27 ### 3.3 跨模型:结构化的多维度分歧 24 模型正确性相关矩阵有四个特征值超过 MP 边界,500 次匹配难度独立伯努利抽样从未出现这一情况 (p ≤ 1/500)。模型准确率范围为 40.2–77.4%;在 459/500 (91.8%) 的问题上至少有一个模型持不同答案。平均成对 Pearson r=0.35 (范围 0.01–0.63),同系列模型对的相关性更高 (表 2 (https://arxiv.org/html/2607.20464#S3.T2);完整分布见图 A2 (https://arxiv.org/html/2607.20464#A5.F2))。 #### MP 计数 (主要). λ_{1..4} = 83.0, 43.1, 36.5, 34.6,而 λ_+ = 28.9。匹配难度零假设 (§2.3 (https://arxiv.org/html/2607.20464#S2.SS3);500 次抽样) 每次最多只产生一个信号特征值 (均值 0.028,最大值 1)。即使匹配了逐问题难度,独立伯努利分布也无法产生我们观察到的四个高于噪声的方向。 #### 香农有效秩 (与先前工作的连续性). 同一矩阵的 exp(H) ≈ 18.7,低于所有零假设抽样 (E[exp(H)] ≈ 22.3;p ≤ 1/500)。但 exp(H) 不能区分不同机制:模型内部和跨模型的香农有效秩值都位于接近上限的波段 (表 2 (https://arxiv.org/html/2607.20464#S3.T2);附录 B.3 (https://arxiv.org/html/2607.20464#A2.SS3))。表 2:500 个 MMLU 问题上的维度缺口。模型内部列报告了五个 MMLU 模型 (表 1 (https://arxiv.org/html/2607.20464#S3.T1)) 的范围。λ_max:正确性相关矩阵的最大特征值 (两侧)。MP 信号计数是主要统计量,能区分两种机制 (≤1 vs. 4);香农 exp(H) 在两边都接近其上界 (64–87% vs. 81%)。 ### 3.4 鲁棒性与下游影响 #### 温度鲁棒性. 在 τ=1.5 (K=30, N=100, Qwen2.5-7B) 时,d_within = 0。在 τ=0.5 时,只有 3 个边界问题——低于 MP 检验的数据下限,因此在此温度下无法得出任何结论。 #### 逐问题估计. Qwen2.5-7B 上的分裂半 p_i 相关性为 r=0.994 (图 1 (https://arxiv.org/html/2607.20464#S3.F1)c),校准差距低于 0.02:随机采样可以精确捕捉每个标量 p_i,但不携带任何跨问题信息。 #### 选择性预测. 两个同类模型以约 1/40 的成本超越了 100 样本的自一致性。任务是预测 Qwen2.5-7B 在 τ=0 下的答案是否正确,推理时无真实标签。操作化 SC_100 (100 个样本中与模态答案一致的样本比例) 达到 AUROC 0.712。Llama-3.1-8B + Gemma-2-9B,各

相似文章

分区、提示、聚合:语言模型中的统计自一致性

Hugging Face Daily Papers

本文提出了一个框架来测试LLM估计是否在不同子群体间遵循统计自一致性(全概率定理),发现了广泛的违反以及“宏观谬误”,即细粒度估计与人类数据的一致性更好。