硬决策层:Transformers中承诺推理的证据
摘要
本文识别了Transformer语言模型中的硬决策层(HDL),即在推理过程中答案选项排名突然稳定的架构特性,并证明其对微调具有不变性,且在多个模型和数据集上一致。
arXiv:2607.21613v1 公告类型: cross
摘要:我们研究了基于Transformer的语言模型在多项选择题回答中如何以及在哪里做出预测承诺。我们识别了_硬决策层_(HDL),这是一种自然的架构特性,推理过程中答案选项排名会突然稳定。在四个语言模型(Qwen、Llama、Granite、Mistral)和四个基准数据集上的实证验证表明,HDL在没有学习路由策略的情况下一致出现。我们还证明HDL对微调具有不变性。我们的结果揭示了HDL处显著的准确率提升:最高达+0.61(Qwen在CommonsenseQA上),之后性能趋于稳定。对标签格式和问题复杂性的系统性消融实验证实了该现象是模型架构的基础特性。这些发现为Transformer推理提供了机制性见解,并提出了高效推理和模型引导的机会。重现本文所需的所有代码和结果可在https://github.com/Mystic-Slice/hard-decision-layer获取。
查看缓存全文
缓存时间: 2026/07/27 07:41
# 硬决策层:Transformers中承诺推理的证据 来源:https://arxiv.org/html/2607.21613 Ashwath Vaithinathan Aravindan 南加州大学 洛杉矶,加利福尼亚州 90007,美国 vaithina@usc\.edu &Mayank Kejriwal 信息科学研究所 4676 Admiralty Way \#1001,洛杉矶,加利福尼亚州 90292,美国 kejriwal@isi\.edu ###### 摘要 我们研究了基于 transformer 的语言模型在多项选择问答中何时以及如何做出预测。我们识别出*硬决策层*(HDL),这是一种自然的架构属性,其中答案选项排名在推理过程中突然稳定。跨四个语言模型(Qwen、Llama、Granite、Mistral)和四个基准数据集的实证验证表明,HDL 无需学习路由策略即可一致出现。我们还表明 HDL 对微调具有不变性。我们的结果揭示了 HDL 处显著的准确率提升:最高可达 +0.61(Qwen 在 CommonsenseQA 上),此后性能趋于稳定。对标签格式和问题复杂性的系统消融证实该现象是模型架构的根本特性。这些发现为 transformer 推理提供了机制性见解,并指明了高效推理和模型引导的机会。重现本工作所需的所有代码和结果可在 https://github.com/Mystic-Slice/hard-decision-layer 获取。# 硬决策层:Transformers中承诺推理的证据 Ashwath Vaithinathan Aravindan 南加州大学 洛杉矶,加利福尼亚州 90007,美国 vaithina@usc\.edu Mayank Kejriwal 信息科学研究所 4676 Admiralty Way \#1001,洛杉矶,加利福尼亚州 90292,美国 kejriwal@isi\.edu 参见图注 图 1:Qwen 模型各个 transformer 层中答案选项 token 的平均排名。每条线代表四个答案选项之一,平均排名在 QASC 数据集的所有问题上按每个层计算。每条排名线周围的淡色区域表示整个数据集中排名的标准差。根据我们的定义,*硬决策层*(HDL)在第 25 层被识别。在此层之后,平均排名一直稳定到最后一层。## 1 引言 理解基于 transformer 的语言模型在何处以及如何做出预测,对于机制可解释性 Bereska and Gavves (2024 (https://arxiv.org/html/2607.21613#bib.bib29)) 和计算效率都至关重要。近期工作表明,模型动态分配计算深度:信息流经残差流 Elhage et al. (2021 (https://arxiv.org/html/2607.21613#bib.bib10)),并由注意力和前馈网络迭代精炼 Geva et al. (2022 (https://arxiv.org/html/2607.21613#bib.bib27)),早期层执行词汇过滤,后期层精炼候选 Gupta et al. (2025 (https://arxiv.org/html/2607.21613#bib.bib3))。一个关键见解是模型预测在网络中途稳定 Lioubashevski et al. (2024 (https://arxiv.org/html/2607.21613#bib.bib28)),这激发了对模型何时以及如何做出最终决策的研究。理解逐层决策的现有方法分为两类:通过学习的路由策略动态识别何时提前退出的方法 Din et al. (2024 (https://arxiv.org/html/2607.21613#bib.bib22)),以及事后层剪枝的静态分析 Fan et al. (2024 (https://arxiv.org/html/2607.21613#bib.bib26))。然而,两者都没有描述模型如何内在地组织其推理。缺失的是对是否存在一种自然的架构属性支配预测稳定时机(独立于学习的路由机制或事后修改)的理解。我们在多项选择问答(MCQA)Hendrycks et al. (2021 (https://arxiv.org/html/2607.21613#bib.bib30)) 的背景下研究这个问题,这是一个受控设定,将离散推理与开放生成隔离。我们发现 transformer 模型中会出现一个固定的*硬决策层*(HDL),超过该层,答案选项的相对排名保持稳定。HDL 代表了模型如何组织其推理的一种自然、静态属性,在不同数据集和模型架构中一致。我们做出以下关键贡献:(i) 我们识别并描述了*硬决策层*(HDL),这是 transformer 模型中的一种自然架构属性,在多项选择推理中答案选项排名稳定,无需学习的路由策略即可出现。(ii) 通过一项全面的实验研究,我们证明 HDL 对模型微调(通过 LoRA)具有不变性,并且对选项数量具有鲁棒性,确认它反映了一种内在的架构属性而非训练伪影。(iii) 通过在四个语言模型和四个数据集上的系统评估,我们还表明 HDL 的显著性关键取决于选项标签表示,字母和阿拉伯数字标签产生的决策边界比罗马数字更清晰。## 2 相关工作 理解 LLM 如何处理和生成预测对于机制可解释性和计算效率都至关重要。我们的工作通过检查变压器中的逐层决策,特别是通过多项选择问答(MCQA)的视角,弥合了这两个领域。### 2.1 机制可解释性 机制可解释性旨在理解 transformer 预测背后的内部计算 Bereska and Gavves (2024 (https://arxiv.org/html/2607.21613#bib.bib29))。信息流经*残差流* Elhage et al. (2021 (https://arxiv.org/html/2607.21613#bib.bib10)),由注意力和前馈网络(FFN)在各层之间迭代精炼。基于投影的技术,如*logit 透镜* nostalgebraist (2020 (https://arxiv.org/html/2607.21613#bib.bib17)) 和*调谐透镜* Belrose et al. (2023 (https://arxiv.org/html/2607.21613#bib.bib23)),能够“窥视”中间预测。补充方法如激活修补和因果追踪 Meng et al. (2022 (https://arxiv.org/html/2607.21613#bib.bib21)) 识别因果组件和事实关联 Hewitt and Manning (2019 (https://arxiv.org/html/2607.21613#bib.bib13)); Havi et al. (2023 (https://arxiv.org/html/2607.21613#bib.bib18)); Dar et al. (2023 (https://arxiv.org/html/2607.21613#bib.bib19))。在 transformer 中,前馈层充当键值记忆 Geva et al. (2022 (https://arxiv.org/html/2607.21613#bib.bib27), 2021 (https://arxiv.org/html/2607.21613#bib.bib20)),促进概念以影响输出。早期层执行词汇过滤,后期层精炼候选 Gupta et al. (2025 (https://arxiv.org/html/2607.21613#bib.bib3))。值得注意的是,模型动态分配计算深度:事实序列开头的 token 使用更多层进行决策,而自然跟随的 token 使用更少的层,这表明模型根据任务上下文自组织推理。### 2.2 Token 饱和现象 模型预测在网络中途稳定,激发了早期退出研究。Din et al. (2024 (https://arxiv.org/html/2607.21613#bib.bib22)) 使用线性变换来缩短中间计算,在 GPT-2 上实现了 13.8% 的层节省,尽管这需要在每个层进行动态决策。更结构化的方法表明,token 排名饱和在不同架构中遵循可预测的顺序 Lioubashevski et al. (2024 (https://arxiv.org/html/2607.21613#bib.bib28)),暗示了原则性的决策进展和自然边界。Fan et al. (2024 (https://arxiv.org/html/2607.21613#bib.bib26)) 进一步证明并非所有层都同等重要,在 Llama2 和 OPT 等大型模型中实现了高达 17.8% 的层剪枝比率。### 2.3 使用 LLM 进行多项选择问答和文本分类 MCQA 基准已成为评估语言模型的标准 Hendrycks et al. (2021 (https://arxiv.org/html/2607.21613#bib.bib30)),提供了一个平衡的评估框架,避免了开放生成的复杂性,同时探索模型能力。通过上下文学习(ICL)使用大型语言模型(LLM)作为分类器由 Brown et al. (2020 (https://arxiv.org/html/2607.21613#bib.bib6)) 建立,他们证明了 GPT-3(175B 参数)可以通过在提示中条件于少量标记示例并将下一个预测 token 读取为类别标签来执行情感分析、自然语言推理和主题分类,而无需任何梯度更新。然而,这种单 token 预测范式被 Zhao et al. (2021 (https://arxiv.org/html/2607.21613#bib.bib7)) 证明存在系统偏差:模型在候选标签 token 上的概率分布受到多数标签偏差(偏向于在示例中出现最多的类别)、近因偏差(偏向于最后一个示例的标签)和常见 token 偏差(偏向于预训练中更频繁的标签词)的扭曲。他们提出的修复方法,*上下文校准*,通过输入一个无内容的输入(例如,“N/A”)并在标签 logit 上学习一个仿射变换来估计这些偏差,恢复高达 30 个百分点的准确率。我们的核心研究问题是:现代 LLM 在 MCQA 任务中如何做出他们的答案选择?这项研究也扩展到使用 LLM 的分类任务。我们通过识别一个固定的*硬决策层*(HDL)——答案选项排名超过该层保持稳定的层——来解决这个问题。与依赖动态早期退出策略或事后层剪枝的先前工作不同,HDL 作为 transformer 推理的自然静态属性出现,无需学习路由机制。我们证明这一现象在模型架构和评估数据集间一致泛化。这些发现揭示了 transformer 根据架构和任务特征固有地组织其推理,为推理过程中如何利用深度提供了机制性见解。## 3 方法 ### 3.1 预备知识 #### 3.1.1 Logit 透镜 Logit 透镜是一种技术,其中来自 transformer 模型的中间层表示被投影到词汇空间,允许我们观察模型在每个层“预测”什么输出。这项技术使我们能够追踪模型的预测如何在各层之间演变,并识别推理过程中的关键决策点。令 M\\mathcal\{M\} 表示一个基于 transformer 的大型语言模型,具有 L L 层、隐藏维度 d d 和词汇表 V\\mathcal\{V\},大小为 \|V\|=V\|\\mathcal\{V\}\|=V。给定一个包含 T T 个 token 的输入序列 x=\(x1,x2,...,xT\)\\bm\{x\}=\(x\_\{1\},x\_\{2\},\\dots,x\_\{T\}\),其中 xt∈Vx\_\{t\}\\in\\mathcal\{V\},嵌入层产生初始表示 h\(0\)∈RT×d\\bm\{h\}^\{\(0\)\}\\in\\mathbb\{R\}^\{T\\times d\}。每个 transformer 块 ℓ∈\{1,...,L\}\\ell\\in\\\{1,\\dots,L\\\} 更新残差流为: h\(l\)=fl\(h\(l−1\)\),\\bm\{h\}^\{\(\\ell\)\}=f\_\{\\ell\}\\\!\\bigl\(\\bm\{h\}^\{\(\\ell\-1\)\}\\bigr\), (1) 其中 flf\_\{\\ell\} 封装了多头自注意力后跟位置前馈网络,并应用残差连接和层归一化,具体取决于模型的特定架构。我们针对每个 ℓ\\ell 捕获 h\(l\)\\bm\{h\}^\{\(\\ell\)\},在单次前向传播期间存储输出张量,并禁用梯度计算。为了解释中间表示,我们使用模型的解嵌入头将每个层的残差流投影到词汇空间。对于位置 T T 处的 token,我们首先从层 ℓ\\ell 提取隐藏状态向量 ht\(l\)∈Rd\\bm\{h\}\_\{t\}^\{\(\\ell\)\}\\in\\mathbb\{R\}^\{d\}。由于解嵌入矩阵 WU∈RV×d\\bm\{W\}\_\{U\}\\in\\mathbb\{R\}^\{V\\times d\} 被训练作用于最终层归一化输出,我们在投影前应用模型的最终层归一化函数 LNfinal\(⋅\)\\text\{LN\}\_\{\\text\{final\}\}\(\\cdot\): h^t\(l\)=LNfinal\(ht\(l\)\)。\\hat\{\\bm\{h\}\}\_\{t\}^\{\(\\ell\)\}=\\text\{LN\}\_\{\\text\{final\}\}\\\!\\bigl\(\\bm\{h\}\_\{t\}^\{\(\\ell\)\}\\bigr\)。 (2) 那么在层 ℓ\\ell 和位置 t t 处词汇表上的 logit 向量为: zt\(l\)=WUh^t\(l\)\+bU,\\bm\{z\}^\{\(\\ell\)\}\_\{t\}=\\bm\{W\}\_\{U\}\\,\\hat\{\\bm\{h\}\}\_\{t\}^\{\(\\ell\)\}\+\\bm\{b\}\_\{U\}, (3) 其中 bU∈RV\\bm\{b\}\_\{U\}\\in\\mathbb\{R\}^\{V\} 是偏置项(如果存在)。对于每个层,我们记录答案选项 token 集合 S=\{A,B,C,D,...\}S=\\\{A,B,C,D,\.\.\.\\\} 的 logit,产生对 \{\(v,zt,v\(l\)\):v∈S\}\\bigl\\\{\\\!\\bigl\(v,\\,z^\{\(\\ell\)\}\_\{t,v\}\\bigr\):v\\in\\mathcal\{S\}\\bigr\\\}。 #### 3.1.2 Logit 透镜提取与分析 为了研究模型如何跨层得出答案,我们应用 Logit 透镜提取逐层 logit,从而提取答案选项的 token 排名,以响应提示111我们在附录A (https://arxiv.org/html/2607.21613#A1) 的图3 (https://arxiv.org/html/2607.21613#A1.F3) 中重现了一个标准的多项选择提示模板,展示了我们实验中使用的结构化格式。。对于每个层,我们记录答案选项 token 的 logit 并对其进行排名,以确定模型在该深度的偏好。这些逐层排名允许我们计算每个层的准确率,并追踪模型的答案如何在网络中演变,为内部推理过程提供机制性见解。现在我们形式化分析中使用的排名和准确率计算。对于一个具有四个答案选项(由词汇 token v1,v2,v3,v4∈Vv\_\{1\},v\_\{2\},v\_\{3\},v\_\{4\}\\in\\mathcal\{V\} 表示)的问题 s s,我们使用 Logit 透镜过程在每个层 ℓ\\ell 提取 logit。在层 ℓ\\ell 和位置 T T(序列中答案 token 的位置)处,令 zT\(l\)\\bm\{z\}^\{\(\\ell\)\}\_\{T\} 表示词汇表上的完整 logit 向量,如公式 (3) 中所定义。我们提取对应四个答案选项 token 的 logit 为: zl=\(zT,v1\(l\),zT,v2\(l\),zT,v3\(l\),zT,v4\(l\)\),\\mathbf\{z\}\_\{\\ell\}=\\bigl\(z^\{\(\\ell\)\}\_\{T,v\_\{1\}\},z^\{\(\\ell\)\}\_\{T,v\_\{2\}\},z^\{\(\\ell\)\}\_\{T,v\_\{3\}\},z^\{\(\\ell\)\}\_\{T,v\_\{4\}\}\\bigr\), (4) 其中 zT,vi\(l\)z^\{\(\\ell\)\}\_\{T,v\_\{i\}\} 是 zT\(l\)\\bm\{z\}^\{\(\\ell\)\}\_\{T\} 的 vi v\_\{i\} 分量。我们通过降序排序这些 logit 来计算排名: rankl\(vi\)=argsortdescending\(zl\)\(vi\),\\text\{rank\}\_\{\\ell\}\(v\_\{i\}\)=\\text\{argsort\}\_\{\\text\{descending\}\}\(\\mathbf\{z\}\_\{\\ell\}\)\(v\_\{i\}\), (5) 其中 rankl\(vi\)∈\{1,2,3,4\}\\text\{rank\}\_\{\\ell\}\(v\_\{i\}\)\\in\\\{1,2,3,4\\\} 表示选项 token vi v\_\{i\} 在层 ℓ\\ell 排序后的 logit 中的位置,排名 1 表示最高 logit。为了聚合数据集上的逐层排名,我们根据 token 在最终输出层的排名对其进行分组。令 D\\mathcal\{D\} 表示所有问题的集合,对于每个问题 s∈Ds\\in\\mathcal\{D\},令 output\_rank\(s,vi\)\\text\{output\\\_rank\}\(s,v\_\{i\}\) 表示 token vi v\_\{i\} 的输出选项排名(在最终层排名中的位置)。令 Ik\(s,vi\):=1\[output\_rank\(s,vi\)=k\]I\_\{k\}\(s,v\_\{i\}\):=\\mathds\{1\}\[\\text\{output\\\_rank\}\(s,v\_\{i\}\)=k\],其中 1\[⋅\]\\mathds\{1\}\[\\cdot\] 是指示函数,是指示 token vi v\_\{i\} 在问题 s s 中达到排名 k k 的指示符。输出选项排名为 k k 的 token 在层 ℓ\\ell 的平均排名计算为: rank ̄l\(k\)=1\|D\|∑s∈D∑i=14rankl\(vi\)⋅Ik\(s相似文章
Transformer中隐式演绎推理的缩放特性
本研究探讨了带有双向掩码的深度Transformer如何实现与显式思维链方法相媲美的隐式演绎推理。研究表明,算法对齐的模型能够在多种图拓扑结构和问题宽度上扩展推理能力。
思维的谱几何:相变、指令反转、Token级动力学与Transformers推理中的完美正确性预测
对11个大型语言模型的全面谱分析,揭示了Transformers在推理与事实回忆过程中隐层激活空间中的相变现象,发现了七个基本现象,包括谱压缩、指令微调反转以及仅基于谱特性的完美正确性预测(AUC=1.0)。
Transformer线性表示高度结构化的世界模型
本文证明,在数独求解轨迹上训练的Transformer构建了由领域约束组织的结构化世界模型,并识别出一个稀疏、单语义的电路,负责裸单决策规则。该工作为Transformer在组合任务上的推理提供了完全可解释的算法描述。
Transformer学习Mestre-Nagao启发式方法
本文训练了一个两层Transformer编码器,利用Frobenius迹将有理椭圆曲线按秩分类,准确率超过99%。机械可解释性揭示该模型学习了Mestre-Nagao启发式方法,并将注意力集中在素数位置上,表明Transformer能够学习数论算法。
我们正撞墙:试图强迫 Transformer 执行真正的逻辑 [D]
作者对行业依赖提示词工程和扩展规模来解决基于 Transformer 的大语言模型(LLM)逻辑推理缺陷表示沮丧,认为这些概率模型从根本上缺乏确定性逻辑的架构。