利用双种子比较在大型语言模型中实现概率采样的互去偏
摘要
本文介绍了双种子比较(DSC)方法,该方法通过使用两个独立种子来中和系统性偏差,实现大型语言模型 (LLMs) 中的无偏概率采样,实验结果表明与现有方法相比有显著改进。
查看缓存全文
缓存时间: 2026/08/28 09:22
# 基于双种子比较的大语言模型概率采样互去偏差方法
来源:https://arxiv.org/html/2608.26161
郭子豪¹,吕宏涛¹,张超利²,尹来国¹,刘磊¹,徐永辉¹,崔立真¹
¹ 山东大学软件学院,中国
² 浙江师范大学计算机科学与技术学院,中国
\{zihaog, lgyin\}@mail.sdu.edu.cn, \{lht, l.liu, xuyonghui, clz\}@sdu.edu.cn, [email protected]
###### 摘要
尽管大语言模型在推理与决策方面展现出卓越能力,高保真概率采样仍是一个持续存在的挑战。当生成随机变量时,大语言模型始终表现出系统性偏差,扭曲目标概率分布。现有方法通常依赖于模型自生成的单一种子,这继承了模型特有的偏见。为克服此缺陷,我们引入双种子比较协议,这是一种透明、无需工具的方案,通过利用两个独立的大语言模型生成种子来中和偏差。DSC 比较两个种子的字符级序数值以构建比特序列,将该序列转换并归一化为伪均匀变量,再通过逆累积分布函数将变量映射至目标分布。实证结果表明,在96%的评估设置中,DSC 显著优于现有方法。除直接采样外,基于 DSC 比较算子的任务适配变体,可提升多项选择题生成与属性约束文本到图像提示中的分布控制能力。
---
## 1 引言
大语言模型在基于智能体的模拟和合成数据生成中日益重要的作用,已将严谨的概率采样从理论基准提升为严格的运营要求。实证证据证实,大语言模型在基本随机任务中存在系统性失败,其随机数生成无法通过标准统计测试套件。关键的是,这种缺陷是执行层面的而非知识层面的:模型能够准确描述目标分布并推导最优混合策略,却无法以随机方式执行。这种在不同模型规模下持续存在的“认知-行为差距”凸显了自回归生成的根本结构限制。
鉴于此结构限制,现有方法主要寻求绕过而非解决它。主流策略将随机过程完全外部化,或提示大语言模型调用 numpy.random 等外部库,或将模拟外包至代码执行环境。这反映了大语言模型推理研究中的一个反复出现的模式:当模型在算术上遇到困难时,自然的反应是将计算卸载到外部工具。然而,正如近期文献强调数学计算是核心认知能力而非可卸载的外围任务,我们认为随机采样同样需要类似审视。如果大语言模型必须调用外部伪随机数生成器脚本才能抽取基本均匀变量,则其仅记住了概率词汇,底层功能能力依然缺失,根本生成限制被掩盖而非解决。
> **图 1**:基于大语言模型的连续采样方法概述。
> (上)标准直接提示无法捕捉连续密度,导致与目标分布 \( \mathcal{N}(0,1) \) 产生严重结构偏离。
> (中)单种子方法传播了大语言模型固有的字符级偏差,导致采样分布偏斜。
> (下)提出的双种子比较流程。详见第4节。图示为使用 Qwen3.5-27B 获得的实证分布。
为绕过对外部环境的依赖,另一条更内在的研究路线试图直接从大语言模型自身产生的输出中提取随机性。具体而言,**字符串思维种子**指导模型生成随机字符串作为熵源,并自主提取类别样本。虽然 SSoT 在一定程度上缓解了上述问题,但存在两个显著局限:首先,它完全依赖初始字符串作为无偏字符源,然而如图1所示,该假设在实践中不成立。在使用 SSoT 从指数分布采样时,即使这些字符串本应作为独立种子,模型仍反复生成具有相同前缀的字符串。由于 SSoT 直接将这些字符串映射为样本,重复的文本模式导致相关且有偏的输出,进而扭曲实证样本分布。我们在第3.2节揭示了此字符级偏差。其次,其自主提取逻辑功能如同黑箱,使得种子到样本的映射根本上不透明。
我们通过引入**双种子比较**填补这些空白。DSC 并非将单个大语言模型生成的字符串视为无偏字符源,而是提示模型生成两个独立字符串并逐位比较其字符。如图1底部所示,只要两个生成的字符串提供独立种子,每个位置的序数比较即可产生由其相对排序驱动的随机二元结果,而非模型绝对字符偏好。生成的比较比特序列被归一化为伪均匀变量,再通过逆累积分布函数映射至目标连续分布。此端到端过程在单次推理调用中完成,并生成可完全审计的中间步骤轨迹。
我们的贡献如下:
- 我们实证表明大语言模型生成的随机字符串存在系统性字符级偏差,确立了单种子熵源在概率采样中的根本不可靠性。
- 我们提出 DSC,这是一种基于提示的方法,使大语言模型能通过透明的多阶段算术流水线,在无外部工具的情况下从概率分布采样。
- 在五个模型和五种分布的评估中,DSC 在25个条件中有24个达到了最低 KS 统计量。除分布采样外,DSC 还提升了多项选择题答案位置控制与属性约束提示生成中的分布保真度。
## 2 相关工作
大语言模型无法产生高质量随机输出的问题已在日益广泛的任务中被记录。早期控制评估揭示了均匀整数生成、掷骰子和抛硬币中与目标分布的系统性偏差——例如 GPT-4 为维持均匀性表象而牺牲独立性。后续工作扩大了范围:在石头剪刀布游戏中评估20个大语言模型,发现其与均匀混合策略均衡存在系统性偏差。消融实验表明,模型规模扩展和温度调整均未能消除更广泛的随机性缺陷。应用完整的 NIST 随机性测试套件发现,表现最佳的大语言模型通过了不到三分之一的测试,而 Python 伪随机生成器通过率超过87%。
这些失败可追溯至自回归生成过程的结构性质。大语言模型在数字上下文中的输出概率校准不良,偏差受词项身份、呈现顺序和语料库频率驱动。更重要的是,缺陷是执行层面的而非知识层面的:模型能准确描述目标分布却无法从中采样,游戏智能体能推导正确混合策略但无法以随机方式执行。
近期研究探索了缓解大语言模型采样失败的不同方案:通过赋予模型代码执行访问权限,将随机化和计算委托给可执行代码;或使用有偏抛硬币序列作为上下文证据,测试大语言模型预测概率是否以贝叶斯方式更新。这些结果阐明了大语言模型通过工具使用或上下文证据能恢复的能力,但未直接提供内在采样机制。
更内在的方法是**字符串思维种子**,它首先提示大语言模型生成随机字符串以积累足够熵,然后通过操作字符串提取随机性以推导最终类别样本,从而在遵循特定约束的同时保持输出多样性。SSoT 提供了总变差距离随字符串长度指数下降的理论保证,且实证上使推理模型在离散基准上接近伪随机生成器保真度。然而,字符串到样本映射的中间步骤仍不透明且不可信。
当前文献的普遍局限是其几乎完全聚焦于离散任务。近期诊断工作将评估扩展到连续领域,审计了11个模型在15种多样分布上的表现。其发现凸显了严重缺陷:在独立无状态请求下,11个模型中有10个在所有测试分布上失败。然而,现有方法均未为此关键设置提供构造性解决方案。我们通过引入 DSC 弥补了这一差距,将两个大语言模型生成的字符串转换为 \([0,1)\) 上的伪均匀变量,再通过分位数函数映射至目标连续分布。
## 3 预备知识
### 3.1 分布保真度统计检验
我们通过比较大语言模型生成样本的实证分布与目标分布来评估其分布保真度。对于通过独立无状态查询从模型生成的一组样本,我们定义经验累积分布函数为:
\[ F_n(x) = \frac{1}{n}\sum_{i=1}^{n}\mathbf{1}[x_i \leq x] \]
随后使用两种拟合优度量化 \( F_n \) 与 \( F_0 \) 的差异。
#### 柯尔莫哥洛夫-斯米尔诺夫检验
KS 统计量衡量与目标 CDF 的最大偏差:
\[ D_n = \sup_x \bigl| F_n(x) - F_0(x) \bigr| \]
较小的 \( D_n \) 表示更接近目标分布,\( D_n = 0 \) 对应精确匹配。我们直接报告 \( D_n \) 作为主要保真度指标,而非将其转换为 p 值,因为我们的目标是量化并比较不同方法的分布偏差幅度。相比之下,KS 检验的 p 值回答二元假设检验问题,且随样本量增长敏感度增加,即使微小偏差也可能导致拒绝,而无法清晰指示哪种方法更接近目标。
#### 瓦瑟斯坦距离
一阶瓦瑟斯坦距离为:
\[ W_1 = \int_{-\infty}^{\infty} \bigl| F_n(x) - F_0(x) \bigr| \, \mathrm{d}x \]
与基于最大点态偏差评估保真度的 \( D_n \) 不同,\( W_1 \) 在整个分布支撑上积分差异。它对系统性低幅度偏差更敏感,而这些偏差被 \( D_n \) 本质忽略。同样,较低的 \( W_1 \) 反映更贴近目标分布,\( W_1 = 0 \) 严格表示实证与目标分布精确匹配。
#### 卡方检验
对于离散采样任务,我们额外使用卡方拟合优度检验测量实证类别频率是否匹配目标概率。令离散结果空间为 \( \mathcal{Y} = \{1,\ldots,J\} \),目标概率为 \( \pi_1,\ldots,\pi_J \)。给定 \( n \) 个生成样本,令 \( O_j \) 为类别 \( j \) 的观测计数,\( E_j = n\pi_j \) 为其在目标分布下的期望计数。卡方统计量定义为:
\[ \chi^2 = \sum_{j=1}^{J} \frac{(O_j - E_j)^2}{E_j} \]
较小的 \( \chi^2 \) 值表示...相似文章
Semantic DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型
本文从偏差-方差角度对扩散语言模型进行了理论分析,识别了掩码扩散与均匀扩散核之间的权衡。提出了SemDLM+,通过添加全局转移和语义频率惩罚来克服语义盆地问题,在LM1B和OpenWebText基准上实现了有竞争力的生成质量。
大型语言模型黑盒不确定性估计方法的系统性评估
本文对4种模型和4种数据集设置下的24种黑盒不确定性估计方法进行了系统性回顾和基准测试,发现没有任何单一方法占主导地位,但结合多种不确定性信号的混合方法表现出色。
DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.
通过语义感知偏差估计衡量 Large Audio Language Models 中的公平性
本文介绍一种语义感知混合效应回归框架,用于衡量 Large Audio Language Models 中的公平性,通过控制语义变化和说话人身份,以获得更稳健和可解释的偏差估计。
通过采样引导与扩展LLMs的方案
本文提出了一个基于采样算法(如Sequential Monte Carlo和Replica Exchange)引导和扩展大型语言模型的理论框架,旨在无需外部监督即可提升生成质量。