循环语言模型中的操作原型自省:过程质量探针、可执行分支与读出控制边界
摘要
本文研究了一个冻结的循环变换器能否读取自身计算质量(预答案预测达到AUROC 0.797)以及外部干预能否改善结果,发现所有测试的冻结干预均未产生验证的能力增益,这一特性称为操作原型自省。
arXiv:2607.18553v1 发布类型:新
摘要:语言模型能否读取正在进行的计算的质量,外部干预能否将该读出转化为更好的结果?我们在一个冻结的2.6B循环变换器Ouro-RLTT上测试了这两个问题。在GSM8K上,一个严格的预答案探针排除了答案区域和金标准值,却预测了最终成功:隐藏状态加上长度和对数概率捷径达到了AUROC 0.797,而仅使用捷径为0.731(增量+0.066;任务聚类95%置信区间[+0.021, +0.112];170个任务,680个候选)。低容量探针也能读取角色专有属性:任务不相交分支存活率达到0.9697 oracle保留率,内容排名达到0.6310宏观top-1,生成分支正确性达到AUROC 0.7755。一个非循环控制复制了候选质量读出,因此并非每个信号都需要循环。
我们在Ouro的192槽循环缓存上构建了分支/携带/剪枝机制,包括分支特定的缓存谱系和一个位精确的残差捕获拼接,仅重新计算受影响的尾部,节省高达88%的每分支层传递。没有冻结干预产生验证的能力增益。定向引导是一个已知的负面结果;一个四任务匹配采样比较消除了冻结分叉增益的证据,但无法估计一般缺陷;终端选择仍未解决且统计效力不足;有界LoRA改变了表面行为但没有提高净可达性。一个双零审计不支持最简单的跨度错位解释。
我们将这种可读取但尚不可用的属性称为操作原型自省。模型并未参考我们的探针:我们读取其隐藏轨迹,而我们的干预未能将这些读出转化为验证的能力。预答案结果仅限于一个领域。支撑值在适用时使用源项不相交划分和反对称化评估。
查看缓存全文
缓存时间: 2026/07/22 08:22
# 结果概览 来源:https://arxiv.org/html/2607.18553 **科学论文·论文 1/2** 2026年7月 **循环语言模型中的操作性原始内省** 过程质量读取、可执行分支以及读出–控制边界 **Jan Kirin** 论文1为科学论文。论文2包含双重陷阱审计、五项修正、综合演示及可复用工具;arXiv:2604.09870(v2)的勘误仍为正式更正记录。本论文使用更正后的协议与数值。 **致谢。** 衷心感谢Jonathan Williams提供Ouro-RLTT权重,该权重作为本研究的主要实验骨干;没有它们,本文报告的RLTT结果将不会存在。 **摘要** 语言模型能否读取自身正在进行的计算的质量?外部干预能否将该读取转化为更好的结果?我们在一个冻结的2.6B循环变压器Ouro-RLTT中检验了这两个问题。第一个答案成立。在GSM8K上,一个严格的答案前探针排除了答案区域和gold值,却成功预测了最终结果:隐藏状态加上长度和对数概率捷径达到AUROC 0.797,而单独使用捷径仅为0.731(增量+0.066;任务聚类的95%置信区间[+0.021, +0.112];170个任务,680个候选)。低容量读取器还能从冻结轨迹中读取角色专用属性:任务无关分支存活率达到0.9697的预言机保留率(其中第47层通道承担因果载荷);内容排名达到0.6310的宏观top-1;生成分支正确性达到AUROC 0.7755。非循环对照组复现了同一类候选质量读取,因此递归并非每个可读信号的必需条件。 第二个答案则更有限。我们在Ouro的192槽循环缓存上构建了可执行的分支/携带/剪枝机制,包括分支专用缓存谱系以及一个比特精确的残差捕获拼接,仅重新计算受影响的尾部,节省每分支多达88%的层传递。通过这一基底,测试的所有冻结干预均未产生经过验证的能力增益。定向引导是已确定的阴性结果。一个涉及四项任务的匹配采样分支比较仅是一个有界筛:它排除了冻结分叉增益的证据,但无法估计一般性缺陷。终端选择仍未解决且统计功效不足;生成正确性尚未被证明能支持可靠的强制选择。一个有界的300步LoRA改变了表面行为,却未提高净可达性。一个秩校正的双零几何审计不支持最简单的一维跨度错位解释;更广泛的子空间错配尚未测试。 我们将这种可读但尚不可用的属性称为**操作性原始内省**。模型并未咨询我们的探针:我们读取了它的隐藏轨迹,而我们的干预未能将这些读取转化为经过验证的能力。主要的、统计功效充足的答案前结果目前仅限于单个领域。所有当前承担因果关系的数值均使用源项目无关的分割,并对成对评分器使用反对称化评估;更正历史及完整审计协议见配套方法论文。 **一个读·预测·执行** 四个循环轮次;仅选定位置 循环1 2 4 3 6 4 7 循环2 2 4 3 6 4 7 循环3 2 4 3 6 4 7 循环4 2 4 3 6 4 7 偏好 内容 存活 生成正确性 答案前成功 **答案前协议** 提示 + 推理 答案排除 严格截断 0.50 0.60 0.70 0.80 AUROC 随机水平 0.50 组合 隐藏状态 → 隐藏 + 捷径 +0.066 0.731 捷径 0.797 隐藏状态 0.745 配对Δ AUROC · 95% CI [+0.021, +0.112] 170个任务 / 680个候选 · 任务聚类 可读 ✓ 答案前预测 ✓ 分支存活 ✓ 候选正确性 冻结行为 – 引导 已确定的阴性 ∼ 分支筛 有界? 终端选择 未解决 ∘ 有界LoRA 无净可达性增益 **视觉摘要。读取、预测、执行。** Ouro的循环状态支持多种可读的过程质量信号,包括一个严格的答案前增量。行为证据被有意分离:引导是已确定的阴性,分支比较是有界的,终端选择未解决,有界LoRA改变表面行为但未提高净可达性。 一个能够读取自身正在进行的计算质量的模型,原则上可以据此行动——在不确定处分支,在失败处剪枝,在自信处承诺。我们在一个冻结的2.6B循环变压器(Ouro-RLTT)中检验了这一命题的两半,发现了第一个命题的明确证据,而针对第二个命题测试的所有冻结干预均未产生经过验证的能力增益。 **可读。** 在模型生成答案之前,其中间状态已能预测该答案是否正确。在GSM8K上,一个严格的答案前探针——在代码中截断以排除答案区域和gold值——在长度和对数概率捷径之外增加了统计显著的信息(AUROC 0.797,含隐藏特征;单独捷径为0.731;增量+0.066,95% CI [+0.021, +0.112],基于配对任务聚类bootstrap,170个任务;无单一任务驱动该效应)。可读信号并非单个标量,而是分解为角色专用读取信息,低级读取器可从冻结状态恢复这些信息,而实时分支脚手架则将其消耗:分支存活率在任务无关分割下达到0.9697的预言机保留率(所读取的第47层通道承担因果载荷——消融后保留率降至0.0417),内容排名在任务无关分割下达0.6310宏观top-1,生成分支正确性达AUROC 0.7755。 **不可行动。** 随后我们构建了可作用于此类信号的机制:跨Ouro的192槽循环缓存的自回归分支专用KV缓存携带,通过一个六级正确性阶梯验证(独立分支缓存、批量等价性、保留谱系的剪枝/重排,以及一个显示所携带缓存承担因果载荷的阴性对照),同时结合一个**比特精确的尾部重算拼接**,最多可减少88%的每分支计算量,同时逐词符匹配完整重算。分支分叉和前缀共享在标准KV缓存中已得到充分确立(PagedAttention、RadixAttention、SpecInfer树形注意力),KV跨循环深度递归模型的递归步重用也已成熟(Geiping et al., 2025; Zhu et al., 2025);但我们尚未发现(§7.3)将分支专用携带与残差捕获尾部拼接相结合,从而在循环×层缓存上按比特精确重建一个在计算中途受扰分支的方案。 通过这一机制,我们测试的所有冻结干预均未产生经过验证的能力增益:定向引导是已确定的阴性结果;分支级别和选择性干预在测试条件下未确立能力增益。有界的四项任务分支筛选排除了冻结分叉增益的证据,但无法估计一般性缺陷。终端选择仍未解决,因为干净的评估统计功效不足。跨七种方法的定向引导仅产生无符号效应,读出方向、经验成功方向和习得控制方向相互接近正交。一旦消除K匹配采样的混杂因素,确定性分支注入不产生可达性增益。生成分支正确性可解码至AUROC 0.78,但尚未被证明能支持可靠的强制选择。有界的300步LoRA改变了分支多样性和解析率,却未改变结果可达性。我们测试了最简洁的几何解释——可写注入跨度和结果方向错位——但一个秩校正的双零审计并不支持它:边界仍是经验的,其机制尚未解决。 我们将这种可读但不可用的属性称为**操作性原始内省**,严格区别于自我报告内省文献,且不涉及意识、自我觉知或自主控制。读取器读取的是隐藏轨迹,而非文本;其中两个是前瞻性的——读取尚未解决的计算:答案前探针,以及一个预测飞行中分支是否仍包含正确延续的分支存活率读取器。我们对于负面结果是谁的失败也保持精确。模型并未咨询自身状态:**我们**读取它们,而**我们**测试的干预未能从我们所读取的内容中确立能力增益。模型本身是否在内部使用过程质量信息未在此测试,也未声称。读取与行动之间的差距是本文的结果,这使得训练时集成——一个从未被训练将可读过程质量方向与可写控制方向对齐的模型——成为最直接的下一步假设,而非更巧妙的冻结干预。 **全文校正数字。** 本文中每个承担因果关系的当前量化声明均在经过审计的协议下报告——源项目无关分割,带零交叉完整性检查,以及成对评分器的反对称化评估(§3.7);来源不完整的历史或诊断性数值(例如§3.6的数学迁移原始数据)被明确标记,且不承担因果关系。该协议背后的审计发现并更正了本项目中的五个扭曲数字——四个被高估,一个低于随机水平;其中三个出现在先前发表的论文中,已在arXiv:2604.09870的勘误中正式更正——其完整剖析是配套方法论文的主题。在更正协议下,关系偏好信号真实但温和(逐点0.565对比0.542;配对Δ +0.023,95% CI [+0.013, +0.033]);一个声称推理微调**安装**了可读信号的论断无法复现并被撤回;一个非循环SFT变压器在任务无关分割下读取候选质量达到0.568,因此此类读取不需要递归。局限性明确:答案前结果依赖于单个统计功效充足的领域(另外两个候选在预检时被测试并拒绝)。在控制侧,定向引导是已确定的阴性;有界分支筛排除了增益证据但未估计一般性缺陷;终端选择在干净但统计功效不足的评估下仍未解决。 **如何阅读本文** 这是四个月工作的完整记录,支持三种阅读深度。 * **单一结果**——严格的答案前发现——见第5节和图2;阅读时间十分钟的读者应阅读这些内容以及证据状态图(§10.2)。 * **主要论点**——可读但不可控——见第5、6和8节,综合分析见第10节。 * **完整记录**——角色专用读取器、可执行基底、已测试但未获支持的几何解释以及转为诊断的被弃机制——为全文;其编写方式使得每个阴性结果和每次撤回都可审计,因此比纯结果论文更长。评估完整性协议(§3.7)支配每个承担因果关系的当前量化声明;历史性和诊断性数值被明确标记,完整审计剖析推迟至配套方法论文。交叉引用双向指向,以便任何章节均可直接进入。 **第一部分:设置** ## 1. 引言 标准变压器对每个词符位置仅通过其层堆栈处理一次:中间激活存在,但特定位置的状态不会被重新访问——模型继续前进前,在固定位置没有重复精化的原生轨迹。循环——或通用——变压器通过重复应用相同层,在多次迭代中精化隐藏状态后再解码,放松了这一限制。这产生了一个单遍模型所不具备的东西:一个内部**轨迹**,即模型在通往答案的过程中所经过的一系列中间计算状态。Ouro-RLTT——我们研究的冻结2.6B循环变压器——在每个生成步骤中跨四次循环迭代和四十八层暴露了这样的轨迹。该轨迹的存在使得一个在单遍模型中更难以提出的问题变得具体:**这些中间状态是否携带关于模型自身正在进行的计算质量的可读信息——如果是,该信息能否被转化为更好的结果?** 具体而言,在Ouro-RLTT发出答案之前,其循环状态是否已编码了当前进行的计算可能成功的程度、多个候选延续中哪个更可取、或者某个分支是否值得追究?如果该信息存在且可从外部读取,那么建立在其上的干预——引导、分支、选择——能否实际改善冻结模型产生的结果?本文对第一个问题肯定回答,并发现我们测试的所有冻结干预对于第二个问题均未产生经过验证的能力增益——定向引导是已确定的阴性,有界分支筛排除了增益证据但未估计一般性缺陷,终端选择在干净但统计功效不足的评估下仍未解决。这些答案之间的差距是本文的主题;在下文中我们用简写“是且否”来表示这一更完整的陈述。 我们对第二个问题的措辞经过深思熟虑,因为其诱人版本是错误的。我们不问**模型**是否使用自身信号;模型并未咨询任何事物,也不知道我们探针的存在。我们问**我们**能否使用它——一个模型状态的**外部读取者**能否通过任何冻结干预将其读取的内容转化为能力。这是本文回答的问题,第8节使这一区别明确。 一个范围说明应在此处而非埋于后文,因为它限制了结果应如何被阅读。我们研究一个循环模型,但我们并未发现循环是使过程质量信息可读的原因。一个传统的非循环SFT变压器支持同一类读取(§4.6),而我们探测的偏好信号在Ouro未经训练的基模型中已存在(§3.5)。循环提供的是**轨迹**——一个中间状态的内部序列,在每个位置无需消耗输出词符即可获得——以及迭代深度,使得注入的分支能够跨递归步骤真正分化(§7.6)。读取是训练过的变压器的特性;分支基底则是递归发挥独特作用之处。 ### 1.1 与语言模型内省工作的关系 关于语言模型能否内省的研究正在快速增长,有必要在一开始就说明我们的问题与该文献所问的问题有何不同,因为我们借用了其词汇却做出了一个蓄意更弱的声称。主流范式通过**自我报告**来操作化内省。Binder等人(2024)将内省定义为获取源于模型内部状态而非训练数据的知识,并通过微调模型预测自身行为来测试,认为成功意味着对内部表示的特权访问。Lindsey(2026)引入了概念注入设置——将已知道概念的引导向量注入残差流,然后询问模型是否注意到注入的“想法”及其内容——并报告称最强能力的模型以中等率检测到此类注入,且假阳性近乎为零。
相似文章
@askalphaxiv: 另一项关于循环Transformer的酷研究。他们提出一个问题:“我们能否直接在推理时循环一个冻结的、现成的检查点…
本研究介绍了一种技术,通过使用阻尼Runge-Kutta子步骤,在推理时循环冻结的、现成的Transformer检查点,将Transformer层视为残差ODE中的欧拉步骤。这无需微调、架构更改或新权重即可增加额外的潜在计算,在MMLU-Pro、GPQA和ARC等知识任务上显示出收益。
开放权重掩码内省:衡量语言模型能报告自身计算的程度
本文提出了开放权重掩码内省(OWMI),一个用于测试语言模型是否能报告其内部计算的框架,发现开放权重模型不具备此类能力,这挑战了对AI监督实践的假设。
循环Transformer中的自适应深度:诊断学习到的停止门与轨迹读出
本文通过将轨迹形成与退出读出分离,研究循环Transformer中的自适应深度,表明固定先验深度监督通常优于联合训练的门控,而自适应计算性能差更多源于诱导的轨迹而非门控表达能力。
Looped语言模型改进组合工具调用
Looped语言模型通过利用循环计算来增强组合工具调用,在多步任务中提高准确性,同时自适应推理优化了性能和计算成本之间的平衡。研究表明,这些模型对于可靠的智能体系统很有前景。
编码智能体提前思考
本文研究了编码智能体中的语言模型如何在迭代编辑过程中内部表示不断演变的程序。作者发现,线性探针可以从残差流中解码程序属性(例如解析、测试通过率),并且令人惊讶的是,这些表示在代理实际进行编辑之前就能预测未来结果,揭示了一个“潜在编程视野”。