不透明串行深度的操作化(3分钟阅读)
摘要
本文档操作化了一种称为“不透明串行深度”的度量,以量化AI模型中的未语言化串行认知,提出基于自然语言的节点作为可解释的瓶颈,以增强对潜在推理的监督。
思维链(CoT)是监督AI模型的宝贵工具。然而,一些架构转变可能会显著降低CoT的可监控性。本研究探讨模型能够执行多少未语言化的串行认知。
查看缓存全文
缓存时间: 2026/09/11 14:13
# 不透明串行深度的可操作化定义
来源:https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial
当前,思维链(CoT)是监督AI模型的重要工具。(https://arxiv.org/pdf/2507.11473)
然而,某些架构变化可能会显著降低CoT的可监控性(https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a0ed93f9b4a6a65994235d8_Loss_of_Oversight%20(7).pdf)。我们最近提出(https://www.redwoodresearch.org/blog/proposal-for-tracking-architecture-on-monitorability),AI公司应透明地分享其架构允许潜在推理和通信的程度信息。为支持这一提案,本文档定义了一种可操作化的度量标准,用作模型可执行未表达化串行认知量的代理指标。我们的度量是“不透明串行深度”概念的一个具体实例,该概念最初由GDM的一篇近期论文定义(Brown-Cohen等人,2026 (https://arxiv.org/abs/2603.09786))。为了衡量计算的不透明串行深度,Brown-Cohen等人提出测量计算图中不经过某种“可解释瓶颈”的最长路径。核心在于,如果将CoT token视为“可解释的”,而将transformer隐藏状态视为“不可解释的”,那么**标准transformer的不透明串行深度与其层数成正比**。[1](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fn91nxxs0jjng)
本文档的主要贡献是为“可解释瓶颈”制定一个特定标准。大致而言,我们希望将满足以下条件的节点视为“可解释瓶颈”:它们输出文本(而非潜在状态),并且是从预训练先验初始化而来的。为使这一概念更精确,我们定义了计算图中**自然语言根节点(NL根节点)**的概念。[2](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fndnn8891jq66)
为了使模型计算图中的一组节点被计为NL根节点,我们需要满足以下条件:
- **自然语言初始化:** 模型已从预训练先验初始化,在该节点处产生“自然语言”输出。(我们对自然语言有一个非常宽泛的概念,包括“代码”、“JSON”和“图像块”等对象,并允许从具有混乱CoT的模型进行蒸馏。)
- **输出空间不扩展:** 这些节点的唯一输出是那些意义直接由该预训练先验初始化的token。(排除例如抽象CoT (https://arxiv.org/abs/2604.22709)、COCONUT (https://arxiv.org/abs/2412.06769)、全带宽transformer (https://arxiv.org/abs/2608.08888)和token叠加 (https://arxiv.org/abs/2505.15778)。)
- **不得修改模型以将token解释为不同类型的数据:** 不得直接修改模型,使其以与预训练先验完全无关的方式使用这些token。(此条款不应排除自然的训练方法。它主要是为了排除上述要点中的技术漏洞,例如通过将其激活编码和解码为自然语言token,将潜在推理模型(https://arxiv.org/abs/2608.08888)转变为表面上以自然语言进行推理的模型。)[3](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fnulzq7hot8p)
我们将在下文(https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#Definition_of_natural_language_rooted_nodes)详细阐述这些标准。重要的是,**所有正常的后训练形式都可以使用而不会阻止节点成为NL根节点**,包括提示、蒸馏和强化学习(RL)。(即使使用激进的长度惩罚或CoT监督,即使这些后训练形式使CoT在实际中难以理解。)
根据这个NL根节点的定义,我们将对应的不透明串行深度概念称为**“自然语言根节点”分离深度(NLS深度)**。除了定义这个术语外,我们还论证了它能够追踪令人担忧的架构变化(https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#NLS_depth_tracks_concerning_architecture_changes),讨论了如何将NLS深度应用于许多示例架构(见附录A (https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#Appendix_A__Applying_NLS_depth_to_plausible_architectures)),并讨论了一些替代的不透明串行深度操作化定义(见附录B (https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#Appendix_B__Sensible_alternative_operationalizations))。
跟踪AI系统的NLS深度并非替代跟踪可监控性或无CoT能力;它是一个重要的补充。NLS深度具有一些其他测量方式所不具备的优势。特别是:
- NLS深度是一个相对清晰且易于量化的概念,[4](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fnma4wc2lhi8)而如何量化或测量可监控性尚不清楚(例如,应在什么任务上进行测量,应使用什么引出策略)。
- NLS深度可以在训练开始前,仅根据AI系统的架构、训练方案和预期部署时配置来确定。这使其更易于用于决定训练哪些模型。
为实现这些特性,NLS深度对某些后训练选择不敏感,而这些选择实际上可能导致模型具有显著更多或更少的可解释CoT。然而,我们认为NLS深度是模型可执行不透明串行认知量的一个良好(尽管不完美的)代理指标[5](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fncjy8uqofjzg),我们认为这对于可监控性高度相关(https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#Appendix_C__Systems_with_high_opaque_serial_reasoning_capabilities_are_likely_less_monitorable)。NLS深度能很好地(https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#NLS_depth_tracks_concerning_architecture_changes)将当前自然语言CoT范式(即使经过大规模扩展)中的架构与特别令人担忧的架构区分开来,例如全带宽transformer (https://arxiv.org/pdf/2608.08888)(可以在整个上下文窗口中递归地使用不透明状态)的放大版本。总体而言,我们认为跟踪AI系统的NLS深度将非常有价值。
在定义NLS深度之前,我们必须定义计算图中的“**自然语言根**”(NL根)节点是什么——这些将作为我们不透明串行深度定义中的“可解释瓶颈”。Brown-Cohen等人提出了两个不同的候选方向来定义什么构成可解释的信息瓶颈。我们的NL根节点概念类似于第二个方向(在其附录A.2 (https://arxiv.org/pdf/2603.09786#page=17)中提出),并具有类似的动机:
> *直观地说,LLM思维链可解释的关键原因是我们训练LLM来预测自然语言,为LLM提供了“自然语言先验”。因此,模型在思维链中token的语义应该模仿人类赋予这些token的语义,因为这对于预测人类生成的文本是有用的。*
*受此基本论点启发,我们提出两个标准,共同表明中间节点应被视为可解释的:*
*1. 自然语言先验:中间表示直接被优化以(1)模仿人类撰写的文本(例如,通过预训练或监督微调),或(2)对人类看起来不错(例如,RLHF (Ziegler等人,2019))。*
*2. 对其他激励的优化有限:除了自然语言先验之外,存在相对较弱的训练激励(理想情况下没有)。直接与自然语言先验相悖的激励比与之正交的激励更糟。*
我们选择了一个具体、相当宽松版本的第二个标准。我们设计此度量的目的是跟踪当前CoT范式与特别令人担忧的架构变化之间的差异,而不是试图在当前范式中画出更难定义的关于何种类型和程度的RL应将推理从不可解释翻转为可解释的界限。
为了使一组节点被计为NL根节点,我们要求:
- **自然语言初始化。**
- **输出空间不扩展。**
- **不得修改模型以将token解释为不同类型的数据。**
我们还强调一个由这些条件隐含但非常重要,值得单独说明的属性:**NL根节点中的token不应被视为连续的中间状态并通过其进行反向传播以训练模型权重。** 我们现在将详细阐述这四个属性。
**自然语言初始化:** 模型应已从预训练先验初始化以模仿人类可理解的媒体,“NL根节点”最初表示来自该先验的样本。“人类可理解的媒体”不仅包括文本,还包括代码、JSON文件、图像或音频(但请注意,多模态CoT问题稍多;见下文讨论(https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#NLS_depth_for_non_general_purpose_models))。这确实使“自然语言根”成为了一个稍显不当的术语。我们还推定假设“人类可理解的媒体”包括NL根节点自身的所有输出,以允许例如从其他模型进行蒸馏。[6](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fn5ngd6k1173i)(注意,这意味着“人类可理解的媒体”在某些情况下最终可能难以理解,如果模型的CoT变得非常难以理解的话。)如果实践中公开NLS深度信息,我们建议AI公司标注他们是否以及如何在其蒸馏过程中使用高NLS深度模型,因为从高NLS深度模型蒸馏低NLS深度模型时,低NLS深度模型可能会继承一些危险性。[7](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fny5x3b6j6ek)
**输出空间不扩展:** 这些节点仅表示来自输出空间的token,其中几乎[8](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fn94tws5aunog)所有token都已从预训练先验初始化,*或者*具有单独确定的、人类可理解的含义,例如 , , , \。这旨在排除诸如COCONUT (https://arxiv.org/abs/2412.06769)、抽象CoT (https://arxiv.org/abs/2604.22709)、全带宽transformer (https://arxiv.org/abs/2608.08888)和token叠加 (https://arxiv.org/abs/2505.15778)等技术。所有这些技术都将通过扩展输出空间来实现。[9](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fnt5s7e9k1bo)
**不得修改模型以将token解释为不同类型的数据:** 我们不仅要求“自然语言根节点”继续在相同的输出空间上运行,我们还指定该输出空间仍需大致按与模型在预训练中使用的相同格式(对于正常transformer来说就是“继续一段文本序列”)被解释为自然语言。也就是说,如果模型架构已被修改,以至于我们应预期节点的输出被解释为与其训练模仿的人类可理解媒体完全不同的数据类型,则该节点不被视为自然语言根节点。(正常的训练方法如RL或提示蒸馏可能会改变模型使用其输出的方式,但不包括在此定义中,因为它们不会可预见地导致token被用作某种其他底层数据类型的代理编码。[10](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fnkyd43h2xcm)我们这里关注的是直接改变架构的方法,或直接训练导致token成为某种其他数据类型的代理的方法。)
以下是此条款旨在明确排除的一些示例:
1. 优化NL根节点的输出以模仿(或以其他方式非常强烈地优化模型以编码关于)AI模型的不透明状态的信息。(我们可以将其操作化为非NL根的状态。)这包括被强烈优化以最优编码关于激活信息的自然语言自编码器(NLA)(https://transformer-circuits.pub/2026/nla/)。
2. 采样多个token,将它们的嵌入相加,然后将组合结果反馈到模型中。这将被视为改变了数据类型,因为多个不同token嵌入的和是模型在预训练中从未遇到过的一种输入类型,并且在自然语言中没有明确的类似物。[11](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fn2jtivf0w5qa)因此,该输出将不被计为NL根节点。[12](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fnwrp4a7qwdda)
**不得将token视为连续中间状态并通过其进行反向传播以训练模型权重:** 对于当前的CoT模型,每次前向传播都以不可微的采样步骤结束。因此,在进行强化学习或监督微调时,梯度永远不会从一个传递的输入层通过到前一个传递的输出层。为了使某物被计为NL根节点,我们要求相同的特性(没有梯度从后续节点通过该节点反向传播以在训练中更新模型权重)。我们没有指定模型如何精确采样token,但要求采样操作本身同样被视为不可微的(直接从token概率计算损失的算法,如策略梯度算法,是允许的)。鉴于上述标准,这个标准可能是多余的。[13](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fnquqhrcto23)然而,我们仍然认为值得单独提及此标准,因为通过表示进行反向传播似乎是一种特别可能使其变得难以监控的方式。其担忧在于,通过NL根节点进行反向传播将导致节点表示发生变化,这些变化可能与任何人类可理解的语义不对应。这与RL(或例如进化算法)有很大不同,后者搜索主要发生在源自预训练的分布内。同样的限制也适用于其他并非完全反向传播,但也同样将节点视为连续的并搜索其局部微小变化以优化其对前面层有用性的算法。此外,在计算图中对NL根节点*之前不久*的一个节点进行反向传播可能导致其不再成为NL根节点。对于实际的NLS深度计算来说,这很少重要,但对于蒸馏可能重要。详见脚注。[14](https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#fn13xjmr3faitr)
关于如何裁定某物是否计为NL根节点的详细示例,请参见附录A (https://blog.redwoodresearch.org/p/an-operationalization-of-opaque-serial#Appendix_A__Applying_NLS_depth_to_plausible_architectures)。
相似文章
开放权重掩码内省:衡量语言模型能报告自身计算的程度
本文提出了开放权重掩码内省(OWMI),一个用于测试语言模型是否能报告其内部计算的框架,发现开放权重模型不具备此类能力,这挑战了对AI监督实践的假设。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
Bypass Observation: 一种非侵入式层级语义提取架构的概念设计
本文提出Bypass Observation,一种非侵入式架构,用于从大型语言模型中提取中间语义信息,以提高可解释性和安全审计。
OpenAI的Astra使用"循环深度"进行静默推理
OpenAI推出Astra,一款利用循环深度实现静默内部推理的AI模型。
强大而精炼:提取与表征前沿模型中隐藏的思维链
本文介绍了一种方法,通过自定义工具API提取和表征前沿语言模型中隐藏的思维链推理,揭示了如GPT-6 Astra等模型在外部化和压缩推理步骤方面的系统性差异。