思维链熵作为可靠性信号:一项预注册复现研究
摘要
本预注册复现研究验证了思维链熵轨迹的形状能够预测大语言模型的答案正确性,而总熵下降在不同设置下不一致,并探索了最终步骤熵作为改进指标。
查看缓存全文
缓存时间: 2026/09/18 08:58
# 思维链熵值作为可靠性信号:一项预注册复现研究
来源:https://arxiv.org/html/2609.19606
###### 摘要
本实证研究是对Zhao于2026年报告的解离现象的独立复现。大型语言模型思维链熵值轨迹的形态能预测最终答案是否正确,而其总熵值下降幅度则不具备预测能力。这一解离现象值得复现,因为其幅度指标部分仅基于单次300题运行(使用单一模型与固定随机种子),而形态指标则在两项基准测试中全量运行,并在第二代模型家族中得到报告。本研究在OSF平台于任何验证性运行前完成注册,复现工作覆盖完整的GSM8K与MATH-500基准测试集,包含四个开源权重模型,其中包含原研究未测试的推理蒸馏型模型。形态信号得以复现,幅度信号则因设置而异。在基准模型上,单调链与非单调链的准确率差距在GSM8K中为+9.6个百分点,在MATH-500中为+27.5个百分点;而总熵值下降与正确性的秩相关系数在GSM8K中为-0.018,在MATH-500中为+0.414。在推理蒸馏模型上,二值化形态信号仅在约百分之一的链中触发,样本量不足以评估预注册对比,但分级违规计数在此模型上仍具预测性。在探索性分析中,仅最终步骤熵值在所有8个模型-基准组合中,其ROC曲线下面积均优于二值化形态标志,其中6-7个组合的风险-覆盖面积也优于原报告指标(取决于未明确说明的积分范围)。本研究贡献包括:在七项预设协议差异下,以完整测试集规模复现形态信号;绘制幅度信号成立与失效的条件图谱;测量四项原研究未报告的协议依赖性。
## 1 引言
思维链提示可提升语言模型在多步问题上的准确性(Wei等人,2022),但也使错误更难识别,因为错误链与正确链同样流畅。因此,无需采样大量完整链即可检测不可靠推理的方法具有实用价值,其中最经济的方法利用常规解码已产出的度量。Zhao(2026)提出了此类方法之一:在单条链的每个推理步骤边界处采样少量短补全序列,从每个补全中提取最终答案,并记录该答案分布的香农熵。得到的逐步熵值轨迹通过两种方式总结:一是二值标志,表示熵值是否在容差范围内每一步都下降(称为"形态");二是标量值,表示从首步到末步的总降幅(称为"幅度")。报告结果呈现解离现象:形态指标预测正确性而幅度指标不预测,且关键信号在于熵值是否每步下降,而非总降幅大小。该主张值得复现有三方面原因:其成本低廉,每问题约1,500 token(对比40链自洽方法的约12,000 token),易于生产采用;两个指标基于的证据强度不同(形态指标在n=300、两项基准全量及第二代模型家族中报告,幅度指标仅在GSM8K 300题、单一模型与种子下报告);原研究自身跨三个随机种子的鲁棒性测试显示准确率差距分别为+8.3、+13.8和+5.2个百分点,远低于头条数据的+21.9,表明头条数字可能不够稳定。
本研究是针对该发现的预注册复现,扩展至原研究未测试的推理蒸馏模型。四个开源权重模型在完整GSM8K和MATH-500测试集上运行,分析计划于OSF预注册且代码冻结公开。预注册假设涵盖形态效应、幅度零假设、分级违规计数信号、方法在推理蒸馏模型上的表现以及学习型假阳性过滤器。本研究提出三项贡献:一是复现本身——形态信号在三项标准指令调优模型与两项基准上,以七项指定协议差异下的全测试集规模得到确认,这使验证结论更侧重于鲁棒性而非流程一致性;二是解离现象的分解——违规部分在所有单元中复现,标量连贯性部分仅在匹配原研究条件的单元中复现,在六个原研究未报告连贯性数据的条件下未满足预注册标准;三是协议依赖性度量——参考链令牌预算、分段规则、步骤上限和结果定义均改变测量结果,其影响量在本研究报告但原研究未报告。
未发现针对该发现的独立复现研究。2026年9月5日对Semantic Scholar引文图谱、OpenAlex、arXiv元数据及开放网络的检索显示,六篇引用Zhao(2026)的论文均未复现该研究,而是将熵值动态应用于推理路由(Xia等人,2026)、令牌级失败特征(Thoria等人,2026)和可满足性任务链结构(Sourav和Balwani,2026)。未发现复制报告、复现代码或注册复制研究,唯一疑似复现的网络结果实为Zhao本人对Mistral的跨模型验证。因此本研究声明:在该日期通过这些途径未发现复现研究。
两项邻近研究影响对本结果的解读:Zhu等人(2026)在Zhao预印本发布六周前提出基于令牌级熵值的轨迹级不稳定分数,基于相同直觉(熵值时间演化比其聚合值包含更多信息),而Zhao论文未引用该工作,故形态优先于幅度的框架缺少最近前驱;Song等人(2026)在相同两项基准上报告概率质量与排序质量分离,排序增益需依赖强前缀安全基线未吸收的结构感知证据。这正是第6.1节从对立面探讨的区分——排序统计量与原研究风险-覆盖统计量对"形态是否优于标量"得出不同结论。
## 2 原始发现
Zhao的协议以温度0.1生成每题一条思维链(上限512令牌),通过匹配正则表达式"Step [0-9]+:"分段(无标记时回退至双换行或句子分割),然后在每个累积步骤前缀处,以温度0.7采样m=5条补全序列(上限150令牌)。从每条补全提取最终答案,前缀k处经验答案分布的香农熵记为H_k。当每一步的H_{k+1}不超过H_k+ε(ε固定为0.01纳特)时,链被称为ε-单调链,标量连贯性定义为C=H_0−H_N。
报告结果分为两组(此区分对复现比较至关重要):在300题GSM8K子集上,使用Qwen2.5-7B-Instruct模型时,单调链准确率达68.8%,非单调链为46.8%,差距+21.9个百分点(比值比2.50,Fisher精确检验p=0.0005),而标量连贯性与正确性的Spearman ρ=-0.059(p=0.31)。该试点实验是幅度零假设的唯一测量点。在全量测试中(n=1319),GSM8K上单调链准确率93.2% vs 非单调链81.7%,差距+11.5个百分点(单调链覆盖率68.1%);MATH-500上(n=500)63.7% vs 30.4%,差距+33.3个百分点(覆盖率27.0%),违规计数Spearman ρ分别为-0.198和-0.381。对Mistral-7B-Instruct-v0.3的跨模型验证(n=300)显示72.3% vs 37.6%,比值比4.33。由于全量测试数据与本研究设计匹配,第4节全程使用该数据比较。若以试点实验的+21.9点差距为目标会夸大两研究差异(因原研究在同子集上的三随机种子测试平均差距仅+9.1点)。
另有两项相关结果:ε消融实验显示ε≤0.10时单调率恒为0.737(论文归因于非单调链的熵值跃迁普遍超过0.20纳特);前缀分析显示仅使用前两个熵值跃迁可恢复+21.9点差距中的+16.7点(76%),且轨迹成本降至60%。
## 3 方法
### 3.1 协议
实验框架实现上述协议:为每题生成一条参考链,分割为累积前缀,在每个前缀处以温度0.7采样m=5条补全序列(上限150令牌),从每条补全提取最终答案,计算答案分布的香农熵(纳特单位)。从轨迹中派生ε=0.01的二值单调性标志、违规计数、连贯性幅度C,以及最终答案置信度(定义为末前缀处答案分布的自洽性)。正确性通过对比末前缀处多数票答案与标准答案判定。答案提取方式依数据集而异:GSM8K取补全序列末尾数字(去除货币符号、千位分隔符及末尾.0),MATH-500取标准MATH归一化下的末尾带框表达式(无带框表达式时取末尾数字)。熵值以纳特计算(对数底数影响均匀缩放,不改变单调性检验与秩相关性的结果)。
### 3.2 模型与数据集
四个开源权重模型在固定Hugging Face修订版下运行,均通过vLLM 0.28.0使用bfloat16精度于单卡NVIDIA A40执行。刻意保持各模型精度一致,避免量化因素混淆推理蒸馏模型与标准模型的比较。模型家族描述见Qwen Team (2024)、Jiang等人 (2023)、Grattafiori等人 (2024)和DeepSeek-AI (2025)的论文,但需说明Mistral报告涵盖基础模型及v0.1指令版,而本研究使用v0.3指令权重(无配套论文)。
数据集采用完整集:GSM8K测试集(Cobbe等人,2021,n=1319)与MATH-500(Hendrycks等人,2021的MATH基准中由Lightman等人,2023抽取的500题子集,n=500)。产生8个模型-数据集组合单元与7,276条目标记录。本研究采用普查而非抽样,消除抽样决策影响,使比较更精确,但不排除统计不确定性。所有区间均基于问题级自助法计算,量化单次解码运行下的项目间变异,不预测重运行的波动范围。未提供功效分析,报告区间以展示实际达到的精度。
### 3.3 与原始协议的差异
七个参数与Zhao设定不同,另有一项差异无法归类。每项差异均明确声明,因无声差异的复现无法被正确解读。后两项差异在模型组运行后确认,属定义层面而非实现层面。参考链温度差异具有实质影响,源于实现决策而非设计选择:本框架以采样补全序列相同的温度生成参考链(顾虑高温度采样链可能更长、更难收敛、更易达到令牌上限)。第7章直接检验长度与截断路径未发现证据,但收敛路径仍开放——其直接影响幅度测量,故视为局限性而非中性差异。后两项差异为定义而非参数:Zhao的提取方法为匹配补全末尾整数与小数的正则表达式,未提及带框表达式路径(包括MATH-500运行),而本研究提取MATH归一化下的末尾带框表达式。这可能影响MATH-500准确率差距(本研究50.5% vs 原研究39.4%),且无法从文本解决。正确性目标定义差异更关键:本研究评分末前缀五个样本的多数票答案(与计算末熵值的样本相同),而原研究自判基线的措辞暗示评分参考链自身答案。因原研究未提供代码,此两点无法通过实现验证,第6.1节测量了这种耦合对依赖结果的影响。分段规则与步骤上限为本研究预先设定的选择(空白行分段注册为主方案,因系统提示要求模型每步独占一行,且标记正则可能在无标记模型类别中失效;该推理前半部分未通过第5.2节验证,故规则作为注册选择但不视为提示忠实解读);上限8单位旨在控制成本(40单位链需41个前缀与约205条补全)。全程使用的系统提示为:"请逐步解决问题。每个推理步骤单独一行。最后给出最终答案。"(Zhao的提示描述仅为"思维链系统提示")相似文章
Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models
This paper tests entropy-based pruning for chain-of-thought compression across models and tasks, finding it offers no advantage over random pruning, and that low-entropy token retention only helps on math benchmarks due to numeric tokens. It provides causal evidence that reasoning information is distributed across the full chain rather than concentrated in a few identifiable tokens.
小型语言模型知道自己不知道什么吗?
本文评估了小型语言模型中基于熵的置信度信号,发现 semantic entropy 提供了一种可行的方法,通过选择性地路由到更大的模型,可将准确性提高多达50个百分点。
微调提升了语言模型的信息传递能力
本文引入冠层熵(CE⋆)来衡量语言模型中生成空间的有效大小,并发现微调将不确定性重新组织为更具信息量和语义意义的输出,使熵率与语义多样性之间的相关性几乎增加了两倍。
@BetaTomorrow: #DeepManifoldInterpretation 论文:《语言模型的熵校准》 作者:Steven Cao, Gregory Valiant, 等人…
该论文《语言模型的熵校准》将熵的上升解释为自回归生成中可达路径的扩散增加,提出由于重尾数据,扩展的效益有限,并建议一种路径感知的解码替代方案。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。