当更多采样有害时:测试时缩放的模态上限与相关上限

arXiv cs.LG 论文

摘要

本文识别了推理模型测试时缩放中的“模态上限”和“相关上限”,表明在数十个样本之后,额外采样不会提高选择准确性,甚至可能有害,突显了生成正确回答与识别正确回答之间的可识别性差距。

arXiv:2606.28661v1 公告类型:new 摘要:人类过度思考;语言模型过度采样,额外的努力可能会让两者都得出更差的答案。推理系统通过多次采样(测试时缩放)来回答难题,采样越多,正确答案出现的频率就越高,因此覆盖率(至少有一次正确尝试的问题比例)上升,看起来像是进步。但部署的系统必须返回一个答案,而选择它(不知道哪次尝试是正确的)就是选择;选择是有上限的,超过某个点后,额外的采样只会让模型更确信一个错误的答案,即使每次采样都增加成本。覆盖率上升与选择停滞之间的差距,即可识别性差距,就是模型能够生成但无法选出的答案。所以真正的问题不是是否采样,而是采样多少,答案是:不多。对于选择答案,投票在几十次采样内就已经稳定,这就是模态上限;对于评估基准,更早达到,即相关上限。超过这个点,额外的采样消耗计算资源却毫无增益,甚至可能使答案更差。本文将这个界限转化为一个单一数值——有效采样数,任何采样运行都能揭示这个数值。瓶颈在于识别正确答案,而非生成正确答案。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:28

# 1 引言与路线图
来源:https://arxiv.org/html/2606.28661
当更多采样反而有害时:测试时扩展的模态天花板与相关天花板

Yong Yi Bay\* Kathleen A. Yearick\*

博士,伊利诺伊大学厄巴纳-香槟分校

††脚注:\*同等贡献。通信地址:{yongyibay, kallie.a.yearick}@gmail.com。

摘要

- 人们过度思考;语言模型过度采样,额外的努力反而可能让两者陷入*更差*的答案。推理系统通过多次采样(*测试时扩展*)来回答难题,采样次数越多,正确答案出现的频率就越高,因此*覆盖率*(至少一次正确的问题占比)会上升,看起来像是进步。但部署的系统必须返回一个答案,在不知道哪次正确的情况下选择,这是*选择*;选择存在上限,超过某个点后,额外的采样只会让模型更加确信一个错误的答案,即使每次采样都增加了成本。上升的覆盖率与停滞的选择之间的差距,即*可识别性差距*,是模型能够产生但无法选出的答案。因此,真正的问题不是是否采样,而是采样多少,答案是:不要太多。对于选择答案,投票在几十次采样内就已稳定,即*模态天花板*;对于评估基准,更早达到这点,即*相关天花板*。超过这些点,额外的采样只会消耗算力而无增益,甚至可能使答案更差。本文将这一截断点转化为一个单一数字,即*有效采样次数*,任何采样过程都能揭示它。瓶颈在于识别正确答案,而非生成它。

关键词测试时扩展⋅推理时计算⋅重复采样⋅pass@k⋅覆盖率⋅best-of-n⋅自一致性⋅有效样本量⋅设计效应⋅组内相关系数⋅相关天花板⋅模态天花板⋅可识别性差距

推理模型可以通过在推理时投入更多算力来增强,算力用于两个杠杆之一:更长的推理(让模型在回答前思考更久),或更多采样(对一个提示生成\(n\)个答案并合并)\[1 (https://arxiv.org/html/2606.28661#bib.bib1),2 (https://arxiv.org/html/2606.28661#bib.bib2),3 (https://arxiv.org/html/2606.28661#bib.bib3),4 (https://arxiv.org/html/2606.28661#bib.bib4)\]。这就是测试时扩展,它推动了推理系统的许多进展\[5 (https://arxiv.org/html/2606.28661#bib.bib5),6 (https://arxiv.org/html/2606.28661#bib.bib6),7 (https://arxiv.org/html/2606.28661#bib.bib7),8 (https://arxiv.org/html/2606.28661#bib.bib8)\];采样杠杆是本文的主题。其标志性曲线是*覆盖率*,即至少有一个样本正确的问题占比\[9 (https://arxiv.org/html/2606.28661#bib.bib9)\],它在\(n\)的几个数量级范围内上升\[2 (https://arxiv.org/html/2606.28661#bib.bib2)\],看起来是持续提升的能力。但这种解读过于乐观。部署的系统必须返回一个答案,由于无法验证哪个样本正确,它只能通过频率或学习到的分数来*选择*一个;选择存在上限,更多采样不会提升它,甚至可能降低它。因此,正确答案变得更容易达到,但并不更容易返回:测试时扩展的瓶颈不是生成正确答案,而是识别它。而且由于每次采样都消耗算力,关键问题是采样多少,下面的天花板用一个小型、目标相关的预算来回答(图1 (https://arxiv.org/html/2606.28661#S1.F1))。

参照图注图1:测试时采样的两个天花板。(a) 覆盖率、自一致性及其之间的可识别性差距。(b) 有效采样次数\(n_{\mathrm{eff}}\)与实际计数\(n\)的关系,以及相关天花板\(1/\rho\)。

**划分。**覆盖率和选择对相同的样本提出不同的问题,只有其中之一会持续改进。覆盖率询问*是否*有样本正确;一个能够识别正确样本的验证器会让覆盖率超越所有限制,达到模型所能达到的极限。选择在没有此类验证器的情况下必须决定一个答案,而多数投票会收敛到模型最常见的答案;在那些最常见答案错误的问题上,更多采样只会让错误答案更确定地胜出,因此选择会饱和于最常见答案正确的问题占比,甚至可能随着预算增长而下降。Brown et al. \[2 (https://arxiv.org/html/2606.28661#bib.bib2)\] 报告了这种模式,但没有给出机制,即“多数投票和奖励模型在几百个样本后趋于平稳,未能随样本预算完全扩展”。上升的覆盖率与停滞的选择之间的差距,是模型能解决但无法选出的问题集合,即*可识别性差距*:它能生成正确答案,但无法选择它(图2 (https://arxiv.org/html/2606.28661#S1.F2))。

参照图注图2:已生成但未选中。在一个难题上,正确答案出现在采样尝试中,因此覆盖率能找到它;但它不是最常见的答案,因此多数投票返回了一个自信的错误答案。

**第二个独立的天花板。**即使采样旨在估计的基准准确性,其价值也低于样本数量所暗示的,出于不同的原因。一个问题的\(n\)次尝试并非\(n\)次独立试验;它们是从一个提示中抽取的聚类,类似于调查中来自同一家庭的几个人之间的相似性。经典的校正是Kish \[10 (https://arxiv.org/html/2606.28661#bib.bib10)\] 的*设计效应*\(d_{\mathrm{eff}} = 1 + (n-1)\rho\),其中\(\rho\)是尝试之间的组内相关系数,因此\(n\)次相关抽取只值\(n/d_{\mathrm{eff}}\)次独立抽取\[11 (https://arxiv.org/html/2606.28661#bib.bib11)\]。对于测试时采样,这就是*有效采样次数*

\[
n_{\mathrm{eff}} = \frac{n}{1 + (n-1)\rho},\qquad n_{\mathrm{eff}} \longrightarrow \frac{1}{\rho} \quad \text{as } n\to\infty,
\] (1)

它饱和于一个硬性的*相关天花板*\(1/\rho\):没有预算能让\(n\)次相关尝试比\(1/\rho\)次独立尝试更有价值(第2.1节 (https://arxiv.org/html/2606.28661#S2.SS1))。这个天花板控制估计,而非选择;两者在全文中保持分离。可识别性差距在第4.3节 (https://arxiv.org/html/2606.28661#S4.SS3) 中测量。

**什么不是新的。**设计效应和有效样本量并非本文新创;它们是Kish \[10 (https://arxiv.org/html/2606.28661#bib.bib10)\] 和Cochran \[11 (https://arxiv.org/html/2606.28661#bib.bib11)\] 的概念,而对相关选民的孔多塞定理的修正更古老\[12 (https://arxiv.org/html/2606.28661#bib.bib12),13 (https://arxiv.org/html/2606.28661#bib.bib13)\]。近期有三项工作将同一工具应用于语言模型输出,但对象不同:Kohli \[14 (https://arxiv.org/html/2606.28661#bib.bib14)\] 测量评估中*不同评判模型*小组的有效投票,Goel et al. \[15 (https://arxiv.org/html/2606.28661#bib.bib15)\] 量化*跨模型*的误差相关性,而Nitarach \[16 (https://arxiv.org/html/2606.28661#bib.bib16)\] 在一份竞赛报告中追踪混合模型间多数投票的有效样本量。没有一项将单模型测试时扩展视为聚类采样、分离估计天花板和不同的选择天花板、推导模态答案天花板及其反扩展,或联系到调查采样文献。在覆盖率方面,Schaeffer et al. \[17 (https://arxiv.org/html/2606.28661#bib.bib17)\] 和Kazdan et al. \[18 (https://arxiv.org/html/2606.28661#bib.bib18)\] 通过*每个问题*难度的重尾分布解释覆盖率的幂律形状,Levi \[19 (https://arxiv.org/html/2606.28661#bib.bib19)\] 通过记忆化假设得到幂律;他们都假设尝试在给定问题下条件独立,即下面模型中\(\rho_w=0\)的情况,本文的分析从该情况恢复了相同形式的幂律。本文的贡献在于提供了一个视角,将名义样本计数混淆的三个量分开:问题间难度差异\(\rho_b\)(限制基准估计并塑造覆盖率的形状)、问题内依赖性(测量结果接近零)、以及答案分布的集中度(将选择限制在模态命中率\(\pi_{\mathrm{mode}}\)并使其反扩展),所有分析都基于已发布的日志。

本文是一个可引用的推导,而非新算法。第2节 (https://arxiv.org/html/2606.28661#S2) 将测试时采样设置为聚类采样,并划定精确声明的范围。第3节 (https://arxiv.org/html/2606.28661#S3) 推导有效采样次数、相关天花板以及单个样本的边际价值。第4节 (https://arxiv.org/html/2606.28661#S4) 分离覆盖率与选择,解释它们之间的可识别性差距,并在独立采样日志\[2 (https://arxiv.org/html/2606.28661#bib.bib2)\] 和依赖性采样日志\[20 (https://arxiv.org/html/2606.28661#bib.bib20)\] 上进行测量。第5节 (https://arxiv.org/html/2606.28661#S5) 分解问题内和问题间相关性,给出算力分配规则、\(\rho\)的估计器以及总结表。

## 2 测试时采样就是聚类采样

整个论点建立在一个重新框架上:一个问题及其重复尝试构成一个聚类,而非每次都独立抽取。本节精确说明对应关系,并划定后续声明的精确范围。

固定一个提示\(q\),从一个模型以固定解码配置(每次相同的采样设置)抽取\(n\)个回应\(o_1, \dots, o_n\)。一个验证器(自动检查每个答案正确与否的打分器)为每个回应打分,得到二元成功指示变量

\[
Y_i = \mathbf{1}\{\, o_i \text{ 对 } q \text{ 正确} \,\} \in \{0,1\},\qquad i=1,\dots,n.
\] (2)

记\(s = \mathbb{P}[Y_i = 1]\)为单次尝试的成功概率,\(K = \sum_{i=1}^n Y_i\)为正确次数。测试时扩展的三个标志性数量是\((Y_1,\dots,Y_n)\)的函数:

\[
\underbrace{\mathrm{pass}@n = \mathbb{P}[K \geq 1]}_{\text{覆盖率}},\qquad \underbrace{\hat{p} = K/n}_{\text{成功率}},\qquad \underbrace{\mathbf{1}\{K > n/2\}}_{\text{多数投票}}.
\] (3)

Best-of-\(n\)(抽取\(n\)个答案并返回学习奖励模型打分最高的一个)\[21 (https://arxiv.org/html/2606.28661#bib.bib21)\]、加权投票和自一致性(返回样本最常一致的答案)都从采样分布中读取,因此是相同抽取的函数。

**独立性基线**假设\(Y_1,\dots,Y_n\)是独立同分布的伯努利(\(s\))变量,每个是一枚以概率\(s\)正确的硬币。那么\(\mathrm{pass}@n = 1 - (1-s)^n\),\(\operatorname{Var}(\hat{p}) = s(1-s)/n\),并且当\(s > \frac12\)时,多数投票以概率趋向于1正确,随着\(n \to \infty\)\[9 (https://arxiv.org/html/2606.28661#bib.bib9)\]。本文的分析保留边际\(s\),用可交换性替代独立性。

**可交换的尝试。**对一个问题的尝试是可交换的:重新标记它们不会改变联合分布,因此只有成功次数重要,而不是具体哪些成功。根据de Finetti定理\[22 (https://arxiv.org/html/2606.28661#bib.bib22)\],一个无限可交换的二元序列(即新会话原则上可以扩展到任意多次尝试)是独立同分布序列的混合,

\[
Y_i \mid \theta \sim \text{i.i.d. Bernoulli}(\theta),\qquad \theta \sim G \text{ on } [0,1],
\] (4)

其中\(G\)是某个混合分布(这些隐藏成功率在问题间的分布),均值\(\mathbb{E}[\theta] = s\)。换句话说,模型的行为如同每个新会话首先为问题抽取一个隐藏成功率\(\theta\),然后该会话中的每次尝试是一枚独立的\(\theta\)加权硬币:好的会话进入强推理区域(大\(\theta\)),差的会话进入弱区域(小\(\theta\))。总结依赖性的单一数字是*组内相关系数*\(\rho\),即同一问题上的两次尝试共同变化的强度,这是聚类二元数据的标准度量:

\[
\rho = \operatorname{Corr}(Y_i, Y_j) = \frac{\operatorname{Var}(\theta)}{s(1-s)} \in [0,1],\qquad i \neq j.
\] (5)

该表示迫使\(\operatorname{Var}(\theta) \ge 0\),因此\(\rho \ge 0\):可交换的尝试是非负相关的。独立性对应\(\rho = 0\)(\(G\)在\(s\)处退化);\(\rho=1\)是完全崩溃,即会话要么全对要么全错。公式 (5) 是从潜在率\(\theta\)的分散度到驱动设计效应的组内相关系数的桥梁。这里的\(\rho\)是*正确性*的相关性;而答案*字符串*的集中度(控制选择)是另一个量,在第4.2节 (https://arxiv.org/html/2606.28661#S4.SS2) 中引入。图3 (https://arxiv.org/html/2606.28661#S2.F3) 列出了对应关系。

| 抽样框架 | 聚类 | 聚类内抽取 | 校正 |
|----------|------|------------|------|
| 人口调查 | 家庭 | \(m\)个成员 | \(d_{\mathrm{eff}} = 1 + (m-1)\rho\) → \(m \mapsto m/d_{\mathrm{eff}}\) |
| 基准测试 | 问题\(q\) | \(n\)次尝试\(o_i\) | \(d_{\mathrm{eff}} = 1 + (n-1)\rho\) → \(n \mapsto n_{\mathrm{eff}}\) |
| 调查 | | 测试时扩展 | |

**图3:调查与测试时的对应关系。** *上*:调查中,一个家庭的\(m\)个成员通过\(d_{\mathrm{eff}} = 1 + (m-1)\rho\)映射。*下*:测试时采样中,一个问题\(n\)次尝试通过\(d_{\mathrm{eff}} = 1 + (n-1)\rho\)映射到\(n_{\mathrm{eff}}\)。

### 2.1 精确声明的范围

一个经典声明的强度取决于其命名的假设,而这里的主要假设比看起来弱。承重假设是*可交换性*:对问题的尝试是无序的,这赋予它们共同的成功率\(s\)和共同的两两相关\(\rho\),使得\(d_{\mathrm{eff}} = 1 + (n-1)\rho\)和天花板\(1/\rho\)精确成立。这几乎不依赖于相关性对每对都*相同*。命题1 (https://arxiv.org/html/2606.28661#Thmproposition1) 的方差恒等式仅需要共同的\(s\):对于任何两两相关模式,它都成立,其中\(\rho\)理解为*平均*两两相关\(\bar{\rho} = \frac{1}{n(n-1)} \sum_{i \neq j} \operatorname{Corr}(Y_i, Y_j)\),因此\(d_{\mathrm{eff}} = 1 + (n-1)\bar{\rho}\),天花板为\(1/\bar{\rho}\)。实际采样偏离等相关性(共享长前缀的尝试比早期分叉的尝试更相似);那么\(1/\rho\)只是理解为\(1/\bar{\rho}\),即第3.2节 (https://arxiv.org/html/2606.28661#S3.SS2) 中估计量的平均。

相似文章

模型能力主导:AIMO 3推理时优化的经验启示

Hugging Face Daily Papers

本论文分析了AIMO 3的推理时优化技术,发现模型能力优于提示工程和多样化采样策略。研究表明高温度采样已经能够最大程度地去相关化误差,为基于提示的改进留下了很少余地,并识别出单个模型pass@20与多数投票共识之间存在6分的选择损失差距。

测试时计算是否触及天花板?

Reddit r/AI_Agents

本文探讨了AI模型在测试时计算扩展带来的收益是否正在减弱,这可能表明当前扩展范式正面临上限。

TEMPO:为大推理模型扩展测试时训练

Hugging Face Daily Papers

TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。