最佳采样温度何时随预算增加?Pass@k的充分条件
摘要
本文提供了为什么pass@k的最佳采样温度随预算增加而上升的理论解释,推导了充分条件,并在没有模型训练或查询的情况下分析了经验模式。
查看缓存全文
缓存时间: 2026/08/18 10:23
# 最佳采样温度何时随预算上升?pass@k的充分条件
来源:https://arxiv.org/html/2608.14665 (2026年7月)
###### 摘要
最大化pass@k的最佳温度通常在小采样预算时较低,在大采样预算时较高。这一模式从Codex到近期的多采样推理研究中均有报告。这不是pass@k的代数性质:正如Slocum等人\[12 (https://arxiv.org/html/2608.14665#bib.bib12)\]所观察到的,对于某个固定任务,最大化温度与k无关。基于该固定任务观察以及先前的定性难/易任务解释,我们给出了该总体模式的形式化总体充分条件。
对于任务X,令 \(p_t(X)\) 为温度t下的一次采样成功概率,并定义条件对数成功响应函数 \(m_t(u) = \mathbb{E}[\dot{p}_t(X) \mid p_t(X)=u]/u\)。如果 \(m_t(u)\) 随当前成功概率非增,则pass@k的标准化温度导数随k非减。因此,导数的符号在各预算间嵌套;若每个温度-性能曲线严格单峰,则其唯一最大化器随k非减。该证明将机制识别为指向低成功任务的单调似然比幂倾斜。
我们推导了闭式双层相图(包括上升和下降区间),并表明边际温度导数允许精确的 \(\mathrm{Beta}(2,k)\) 核表示,其核集中在约 \(1/k\) 的一次采样成功上。将该尺度解释为任务层面的定位,还需要在零附近有规则且非零的密度-响应因子。带符号矩表示提供了诊断形状限制,而附录简短地记录了现有多配置分配公式的精确离散细化。
本文未训练任何语言模型,也未使用模型查询作为实验测量:其贡献是对已建立的经验现象的条件理论,其假设可在未来工作中验证。
## 1 引言
采样温度在语言模型推理中调解了熟悉的质量-探索权衡。对于pass@k,只需在k次尝试中有一个被接受的补全。经验上,表现最佳的温度通常随尝试次数增加而升高。Codex研究明确报告,在某个模型中,pass@1的最佳温度约为0.2,pass@100的最佳温度约为0.8,并绘制了跨预算的上升上包络线\[2 (https://arxiv.org/html/2608.14665#bib.bib2)\]。后续研究在不同模型和任务上重现了小预算低温度和大预算高温的定性模式\[5 (https://arxiv.org/html/2608.14665#bib.bib5), 3 (https://arxiv.org/html/2608.14665#bib.bib3)\]。近期工作还发现,不同温度解决不同的问题子集,且温度组合可以优于单一温度\[15 (https://arxiv.org/html/2608.14665#bib.bib15)\]。
标准解释是更大的预算奖励多样性。该直觉有用但在定义总体pass@k的条件独立模型下不完整。对于固定任务,pass@k是其一次采样成功概率的严格递增变换。因此,最大化固定任务的温度不能随k移动。Slocum等人\[12 (https://arxiv.org/html/2608.14665#bib.bib12)\]明确陈述了这一观察,并给出了相邻直觉:低成功任务在大预算下获得更大的边际收益。
基准层面最优值的移动需要跨任务的异质温度响应,或违反条件独立采样、固定解码方案或完美验证。本文提出一个狭窄的问题:
> 在何种任务层面响应条件下,pass@k预算增长时,总体最优温度必须弱向上移动?
答案使用了条件对数成功响应。在温度t下,任务按当前一次采样成功 \(p_t\) 排序。如果升温对较低成功任务具有弱更大的比例收益,则pass@k边际随k增长而单调偏向更高温度。这种移动不在原始导数幅度中,而在标准化导数中,其加权法则由单调似然比排序。此区分防止了常见但错误的主张,即 \(\partial_t \operatorname{pass}@k\) 本身必须随k增长。
## 2 总体 pass@k
令 \(X \sim \mu\) 表示基准任务,令 \(I=[\underline{t}, \overline{t}]\) 为紧温度区间,令 \(p_t(X) = \Pr\{\text{一个补全被接受} \mid X,t\}\)。条件于 \((X,t)\),k个补全独立同分布,且验证器对二元成功事件是完美的。记 \(q_t = 1-p_t\)。总体pass@k为
\[ A_k(t) = \mathbb{E}[1 - q_t(X)^k]. \tag{1} \]
这是由通常的无偏有限样本pass@k估计量估计的总体目标\[2 (https://arxiv.org/html/2608.14665#bib.bib2)\]。对于微分结果,固定一个内部操作点t。假设 \(s \mapsto p_s(X)\) 在t的邻域内几乎处处可微,\(\mathbb{E}\|\dot{p}_t(X)\| < \infty\),微分可通过期望进行,且 \(p_t(X) \in (0,1)\) 几乎处处成立。
## 3 嵌套导数符号定理
定义 \(\eta_t(X) = \dot{p}_t(X)/p_t(X)\) 为任务X在温度t下的对数导数。对于 \(u>0\),定义条件对数成功响应
\[ m_t(u) = \frac{\mathbb{E}[\dot{p}_t(X) \mid P=u]}{u}. \tag{3} \]
当 \(\eta_t\) 可积时,这等于 \(\mathbb{E}[\eta_t(X) \mid P=u]\),而所示定义在 \(\dot{p}_t\) 的所述可积性下是良定义的。
令 \(Z_{k,t} = \mathbb{E}[P(1-P)^{k-1}]\),并在 \(Z_{k,t}>0\) 时,在任务上定义概率律 \(\nu_{k,t}\) 为
\[ \frac{\mathrm{d}\nu_{k,t}}{\mathrm{d}\mu}(X) = \frac{p_t(X) q_t(X)^{k-1}}{Z_{k,t}}. \tag{4} \]
方程(2)–(4)意味着
\[ A_k'(t) = k Z_{k,t} \mathbb{E}_{\nu_{k,t}}[m_t(P)]. \tag{5} \]
###### 假设 3.1(递减条件对数成功响应)
在每个适用站立微分假设的内部t,\(m_t(u)\) 在 \(p_t(X)\) 的支撑上关于u非增。
这是一个困难任务受益条件:在当前操作点,升温对较低成功任务具有更大的比例响应,或更小的比例损失。它是对可观察任务层面响应的限制,而非pass@k的结果。
###### 引理 3.2(预算诱导似然比倾斜)
对于整数 \(\ell > k\),
\[ \frac{\mathrm{d}\nu_{\ell,t}}{\mathrm{d}\nu_{k,t}}(P) = \frac{(1-P)^{\ell-k}}{\mathbb{E}_{\nu_{k,t}}[(1-P)^{\ell-k}]}. \]
似然比关于P非增;因此 \(\nu_{\ell,t}\) 在单调似然比序下偏向较低一次采样成功。
###### 定理 3.3(嵌套温度导数符号)
在任何满足站立微分假设和假设3.1的内部t,对于整数 \(\ell > k \geq 1\),
\[ \mathbb{E}_{\nu_{\ell,t}}[m_t(P)] \geq \mathbb{E}_{\nu_{k,t}}[m_t(P)]. \tag{6} \]
因此,
\[ A_k'(t) \geq 0 \implies A_{\ell}'(t) \geq 0. \tag{7} \]
对于相邻预算,标准化分数的精确增量为
\[ \mathbb{E}_{\nu_{k+1,t}}m_t - \mathbb{E}_{\nu_{k,t}}m_t = \frac{\operatorname{Cov}_{\nu_{k,t}}(m_t(P), 1-P)}{\mathbb{E}_{\nu_{k,t}}[1-P]} \geq 0. \tag{8} \]
###### 定义 3.5(严格导数单峰性)
区间I上的可微函数f是严格单峰的,如果它有唯一最大化器 \(t^\star\),对于 \(t < t^\star\) 有 \(f'(t)>0\),对于 \(t > t^\star\) 有 \(f'(t)<0\)(在边界处使用单侧导数)。
###### 推论 3.6(预算单调最优温度)
假设在每个内部 \(t \in I\) 处站立微分假设和假设3.1成立,且每个 \(A_k\) 严格单峰并有唯一最大化器 \(t_k\)。则对于 \(\ell > k\) 有 \(t_\ell \geq t_k\)。
## 4 边际决策的 Beta 核表示
假设 \(P = p_t(X)\) 在 \((0,1)\) 上有密度 \(f_t\)。将(2)条件于P给出
\[ A_k'(t) = k \int_0^1 u(1-u)^{k-1} m_t(u) f_t(u) \, du. \]
密度 \(Z_k \sim \mathrm{Beta}(2,k)\) 为 \(k(k+1)u(1-u)^{k-1}\),因此
\[ A_k'(t) = \frac{1}{k+1} \mathbb{E}\left[ m_t(Z_k) f_t(Z_k) \right]. \tag{9} \]
该核本身对 \(k>1\) 有众数 \(1/k\),均值 \(2/(k+2)\),并集中在约 \(1/k\) 的一次采样成功概率上。方程(9)将密度-响应因子 \(h_t(u) = m_t(u) f_t(u)\) 与该核求平均。
## 5 精确双层相图
考虑质量 \(\pi \in (0,1)\) 的易层和质量 \(1-\pi\) 的难层,具有仿射温度响应
\[ p_E(t) = e^{-at}, \quad p_H(t) = h + bt, \tag{10} \]
其中 \(a,b > 0\),且在I上两个概率均保持在 \((0,1)\) 内。令 \(A = 1-e\),\(B = 1-h\),和 \(C = \frac{\pi a}{(1-\pi)b}\)。总体失败概率为
\[ F_k(t) = 1 - A_k(t) = \pi(A+at)^k + (1-\pi)(B-bt)^k. \]
###### 命题 5.1(闭式优化器和相边界)
对于 \(k=1\),当 \(C>1\) 时最大化器为 \(\underline{t}\),当 \(C<1\) 时为 \(\overline{t}\),当 \(C=1\) 时为所有 \(t \in I\)。
对于 \(k>1\),\(A_k\) 严格凹且有唯一最大化器
\[ t_k = \operatorname{clip}_I\left( \frac{B - r_k A}{b + r_k a} \right), \quad r_k = C^{1/(k-1)}. \tag{12} \]
若 \(C>1\),序列 \((t_k)\) 非减;若 \(C<1\),则非增;若 \(C=1\),则对于 \(k>1\) 为常数。在任何情况下,
\[ \lim_{k \to \infty} t_k = \operatorname{clip}_I\left( \frac{B-A}{a+b} \right), \tag{13} \]
即两层具有相等一次采样成功的温度,裁剪至I。相似文章
当更多采样有害时:测试时缩放的模态上限与相关上限
本文识别了推理模型测试时缩放中的“模态上限”和“相关上限”,表明在数十个样本之后,额外采样不会提高选择准确性,甚至可能有害,突显了生成正确回答与识别正确回答之间的可识别性差距。
无需妥协的遗忘:固定预算下流式KV-Cache驱逐的Nexus采样
介绍了Nexus Sampling,一种无需训练的KV-cache驱逐方法,采用加权蓄水池采样代替确定性top-k选择,在固定内存预算下提升了长上下文LLM推理性能,在80%驱逐率下达到与密集注意力相匹配的性能。
Prof-K: Probabilistic One-Pass Filtering for Efficient Top-k Selection
Prof-K is a probabilistic one-pass filtering algorithm for fast, scalable top-k selection with correctness guarantees, achieving 1.5x–10x speedups over PyTorch topk and RadiK, especially in large-scale small-k regimes.
在困难处采样:通过熵引导的幂采样增强基础模型推理
本文提出熵引导幂采样(EGPS),一种无需训练和验证器的采样方法,提高了幂采样在增强基础语言模型推理中的效率。与标准Metropolis-Hastings采样相比,EGPS在MATH500、HumanEval和GPQA等基准测试上达到最佳或并列最佳准确率,同时实现高达12.6倍的加速。
快速硅采样的条件优越性
本研究评估了硅采样方法,表明快速模式在效率和保真度上优于慢速模式,同时强调了其在准确表达观点方差方面的局限性。