面向量化模拟回写与可解释程序执行的符号神经CPU
摘要
本文提出了一种迹监督的符号神经CPU架构,结合循环控制、显式操作路由器和掩码寄存器回写,实现了可审计、可解释的程序执行,并通过量化模拟回写保留了符号操作路径。
arXiv:2607.10021v1 Announce Type: new
摘要:神经网络可以学习算法性的输入输出映射,但信任一个学习型执行器需要的不仅仅是正确的最终答案,因为产生该答案的状态转换通常是隐藏的。为了使这些转换可见,我们引入了一种迹监督的符号神经CPU,这是一种分解式学习执行架构,结合了循环控制、基于固定可微算术逻辑单元库的显式操作路由器、目标掩码寄存器回写、完整轨迹监督以及匹配定点回放。该模型在每一步都公开所选操作、源寄存器和目标寄存器、寄存器轨迹、内存信号以及回写语义。在主要的16位宽基准测试中,非量化执行器精确复现了参考执行,而八位量化模拟执行器则保留了包含1000条指令程序的符号操作路径。当同一执行过程与匹配定点回放进行评估时,残余数值漂移消失,这表明该漂移源于连续语义与低精度参考语义之间的不匹配,而非执行失败。我们比较了循环、Transformer、时序卷积、时序图启发式以及状态空间控制器,消融实验表明,操作门监督对于可检查的执行路径是必要的。隐藏操作码的内存压力任务揭示了延迟状态使用和时间绑定方面的剩余限制。我们还通过值记忆、混合自适应漏泄积分点火控制器、基于行为克隆和演员-评论家强化学习训练的候选约束符号控制,以及RV32I基础整数语义桥扩展了接口。这些结果共同建立了一个用于可解释、低精度和可控神经执行的可迹验证框架。
查看缓存全文
缓存时间: 2026/07/14 04:18
# 一种用于量化模拟写回与可解释程序执行的符号化神经CPU 来源:https://arxiv.org/html/2607.10021 Jose Luis Lima de Jesus Silva 通讯作者. Emailmailto:[email protected] (https://arxiv.org/html/2607.10021v1/mailto:[email protected]) 巴伊亚联邦大学地球物理系,萨尔瓦多,BA 40170-115,巴西 巴伊亚联邦大学人工智能在地球物理中的应用研究组(GAIA),萨尔瓦多,BA 40170-115,巴西 ###### 摘要 神经网络可以学习算法性的输入-输出映射,然而学习型执行器仍然难以被信任,因为其内部状态转换通常是隐藏的。我们引入了一个轨迹监督的符号化神经CPU,这是一种分解式的学习型执行架构,结合了循环控制、一个固定的可微运算-逻辑单元组上的显式操作路由器、目标屏蔽寄存器写回、完整的轨迹监督以及匹配的定点回放。由此产生的执行过程可以通过所选操作、源寄存器和目标寄存器、寄存器轨迹、内存信号以及写回语义进行审计。在主要的16宽基准测试中,非量化执行器精确复现了参考执行,而八位量化模拟执行器则在包含1000条指令的程序中保持了符号化操作路径。残余的数值漂移在匹配的定点回放下消失,这识别出连续精度与低精度参考语义之间的不匹配,而非执行失败。架构比较涵盖了循环控制器、Transformer控制器、时序卷积控制器、时序图启发式控制器以及状态空间控制器。消融实验表明,操作门监督对于可检查的执行路径是必要的,而隐藏操作码的内存压力任务则暴露了当前延迟状态使用和时间绑定的局限性。我们进一步通过值记忆、混合自适应漏积分点火控制器、通过行为克隆和演员-评论家强化学习训练得到的候选约束符号化控制,以及一个RV32I基础整数语义桥来扩展该接口。这些结果共同建立了一个用于可解释、低精度和可控神经执行的轨迹可验证框架。 ## 1 引言 现代计算机并不仅仅根据最终输出进行评判。它们是可审计的转换系统,其中指令选择操作,操作作用于可寻址的状态,由此产生的轨迹可以逐步进行检查。这种控制、算术和内存之间的分离是存储程序计算观点的核心,在这种观点中,变量可以通过改变从中读取值和向其写入值的地址来进行操作[53 (https://arxiv.org/html/2607.10021#bib.bib1),58 (https://arxiv.org/html/2607.10021#bib.bib2),14 (https://arxiv.org/html/2607.10021#bib.bib10)]。 现代神经网络走上了不同的道路。它们从数据中学习连续的输入-输出映射,并且通常根据任务级准确性进行评估,即使任务本身需要算法流程。因此,困难不在于神经模型能否近似程序的输入-输出行为,而在于它能否展现出足够忠实于计算审计的执行过程。这个问题塑造了学习、记忆和推理边界上的长期工作。 循环神经网络(RNN)引入了可训练的隐藏状态用于序列处理,而长短期记忆网络(LSTM)则提高了循环模型在长时间间隔内保留信息的能力[20 (https://arxiv.org/html/2607.10021#bib.bib17),12 (https://arxiv.org/html/2607.10021#bib.bib38),15 (https://arxiv.org/html/2607.10021#bib.bib29)]。序列到序列模型、注意力机制和指针式架构进一步表明,神经网络可以学习灵活的对齐、检索和结构化序列操作形式[50 (https://arxiv.org/html/2607.10021#bib.bib39),2 (https://arxiv.org/html/2607.10021#bib.bib40),57 (https://arxiv.org/html/2607.10021#bib.bib41)]。这些新发展使得神经系统在处理时间上扩展的输入方面越来越强大,但存储的信息通常仍然嵌入在隐藏激活或学习参数中,而不是表示为显式可检查的机器状态。 记忆增强神经网络使得这种计算机类比更加直接。神经图灵机(NTM)和可微神经计算机(DNC)将神经控制器与一个外部记忆矩阵耦合,通过可微寻址进行读写操作[13 (https://arxiv.org/html/2607.10021#bib.bib9),14 (https://arxiv.org/html/2607.10021#bib.bib10)]。DNC增加了内容查找、时间链接和动态分配,使学习系统能够回答合成推理问题、遍历图、推断最短路径以及执行类似规划的块操作[14 (https://arxiv.org/html/2607.10021#bib.bib10)]。相关的记忆网络和端到端记忆网络架构也展示了将学习型控制器与可寻址存储分离,用于推理事实和序列的价值[59 (https://arxiv.org/html/2607.10021#bib.bib42),49 (https://arxiv.org/html/2607.10021#bib.bib43)]。最近,Transformer注意力被解释为一种受限的、无状态的DNC式记忆访问形式,其中键和值构成一次写入记忆,多头注意力实现并行的基于内容的读取[55 (https://arxiv.org/html/2607.10021#bib.bib11),52 (https://arxiv.org/html/2607.10021#bib.bib30)]。这些结果确立了外部或注意力介导的记忆作为神经计算中的核心机制。然而,它们并未提供寄存器级的审计,以显示选择了哪个符号化操作、更新了哪个状态变量,以及中间执行路径是否与参考机器匹配。 神经算法推理解决了一个互补的问题:神经网络能否模仿经典算法的执行。CLRS算法推理基准测试是一套受Cormen、Leiserson、Rivest和Stein教科书传统启发的算法任务,评估模型在排序、搜索、图、字符串和动态规划问题上的表现,通常使用中间算法状态的监督而非仅最终答案[8 (https://arxiv.org/html/2607.10021#bib.bib44),56 (https://arxiv.org/html/2607.10021#bib.bib45),32 (https://arxiv.org/html/2607.10021#bib.bib31)]。开放式神经算法推理扩展了这一设置,允许模型在推理时查阅训练实例,将示例转化为推理的辅助记忆[32 (https://arxiv.org/html/2607.10021#bib.bib31)]。最近关于Transformer-NAR混合体、热带注意力、对偶-原始神经推理器、循环Transformer模拟以及背包式中间监督的研究进一步表明,架构偏差和中间状态监督可以改善图、组合和动态规划任务上的神经推理[5 (https://arxiv.org/html/2607.10021#bib.bib47),18 (https://arxiv.org/html/2607.10021#bib.bib48),19 (https://arxiv.org/html/2607.10021#bib.bib49),33 (https://arxiv.org/html/2607.10021#bib.bib50),42 (https://arxiv.org/html/2607.10021#bib.bib51)]。这一文献与轨迹监督执行类似,因为它将中间计算视为学习的对象。然而,其中间状态通常是图或任务特定的算法状态。它们并非由寄存器、目标屏蔽、操作门和低精度写回组成的机器状态。 第二个相关线索研究神经程序和神经符号执行。在神经程序学习中,神经模型由符号程序、逻辑程序或黑盒应用程序编程接口(API)组成,学习需要将监督传播通过、围绕或跨越这个符号组件[48 (https://arxiv.org/html/2607.10021#bib.bib32)]。这些方法之所以强大,是因为程序可以强制精确结构,而神经组件处理感知、不确定性或不完整输入。这里研究的设置不同。目标不是将神经模型附加到外部执行器,而是学习执行器本身,同时保持其可审计性。在这种设置中,操作分布、硬操作选择、寄存器轨迹和低精度算术并非隐藏的实现细节,因为它们正是被评估的对象。关于代码模拟和可微程序合成的相关工作同样将逐步执行视为一个要求严格的推理问题,但通常评估代码类行为、潜在程序搜索或学习的符号原语,而非具有匹配定点回放的寄存器级操作路径[30 (https://arxiv.org/html/2607.10021#bib.bib52),35 (https://arxiv.org/html/2607.10021#bib.bib53)]。 对状态级评估的相同需求出现在基于大型语言模型(LLM)的记忆增强智能体的大规模应用中。持久化LLM智能体越来越依赖外部记忆库,但最近的研究表明,记忆并非被动存储。因此,构建、检索和利用形成一个耦合的循环,下游错误应反馈到记忆修复中[34 (https://arxiv.org/html/2607.10021#bib.bib33)]。对记忆增强智能体的持续学习研究同样表明,外部记忆并不能消除干扰。实际上,它将瓶颈从参数覆盖转移到了记忆表示、检索和上下文竞争[21 (https://arxiv.org/html/2607.10021#bib.bib34)]。这些观察支持一个普遍原则:记忆增强计算不应仅根据最终响应的正确性来评估。这意味着我们还应该考虑存储、检索和更新的状态是否支持预期的计算。我们在受控的寄存器机器轨迹层面研究这一原则,其中相关状态是寄存器文件和可选的外部记忆,而非会话记忆库。 设备端的执行施加了额外的约束。量化感知训练(QAT)、混合精度搜索和硬件感知压缩表明,在部署到受限硬件之前,神经模型通常需要在显式预算(内存、位宽、延迟和计算成本)下进行评估[24 (https://arxiv.org/html/2607.10021#bib.bib6),28 (https://arxiv.org/html/2607.10021#bib.bib7),54 (https://arxiv.org/html/2607.10021#bib.bib35)]。此外,能量感知推理研究同样强调,当计算受功率和延迟限制时,仅靠准确性是不够的[23 (https://arxiv.org/html/2607.10021#bib.bib36)]。模拟内存内训练更进一步,研究了当计算映射到非理想存储设备时,哪些学习算法仍然可行[43 (https://arxiv.org/html/2607.10021#bib.bib37)]。因此,这些面向硬件的工作推动了低精度和成本感知的评估,但它们通常优化神经推理工作负载。相比之下,它们并未测试当算术运算在带有量化模拟写回的定点网格上投影而非仅使用全整数推理时,学习型符号执行器是否保持逐步的机器轨迹。最近关于全整数部署和重缩放感知训练的工作使得这一区别尤为重要,因为低精度算术可能引入在仅浮点评估中不可见的部署成本和行为[38 (https://arxiv.org/html/2607.10021#bib.bib54)]。硬件环境也在变化,例如神经形态多核处理器如Loihi,展示了具有片上学习的可编程、事件驱动基底,而定性的神经形态系统如NeuroScale则使用本地、事件驱动的同步来保持可重复的尖峰时序而无需全局屏障[10 (https://arxiv.org/html/2607.10021#bib.bib21),31 (https://arxiv.org/html/2607.10021#bib.bib55)]。在更概念性的层面上,最近关于神经计算机的研究将学习运行时视为一种新兴的机器形式,其中计算、记忆和I/O统一在模型状态中,同时强调稳定执行和符号控制仍然是开放问题[61 (https://arxiv.org/html/2607.10021#bib.bib56)]。在处理器接口层面,基于RISC-V的SNN加速器如FeNN表明,可编程指令集兼容平台正在被适应于脉冲神经工作负载[1 (https://arxiv.org/html/2607.10021#bib.bib57)]。结合模拟内存内训练和全整数部署工作,这些系统指向真实的神经计算模块,其中低精度算术、记忆状态和可编程控制需要在状态转换层面而非仅基准准确性上进行验证[43 (https://arxiv.org/html/2607.10021#bib.bib37),38 (https://arxiv.org/html/2607.10021#bib.bib54)]。然而,它们并未为学习的符号执行提供审计追踪。这一差距推动了本工作的核心方向。如果学习型执行器要成为控制器、协处理器或设备端运行时,其操作选择、寄存器写入、记忆效应和低精度回放语义必须在硬件部署之前可见。 因此,我们开发了一个可检查的执行接口,其中模拟阶段符号神经执行器的操作门、目标屏蔽、寄存器轨迹和匹配定点回放可以与参考机器进行比较。目标是使未来系统在转换层面上可检查。因此,当前模型并非作为物理处理器实现呈现。主要实验研究了在受控条件下符号执行和匹配定点回放。作为标准ISA的桥梁,我们进一步测试了相同设计原则是否可以附加到RV32I基础整数语义基底上。这个RV32I实验是一个语义桥梁和学习控制诊断实验,并非官方的RISC-V合规性、特权执行、ABI/运行时支持或硬件执行。 缺少的正是神经算法行为与可部署执行之间的审计层,即一个受控环境,其中学习系统必须暴露所选操作、更新的寄存器、完整的中间轨迹以及低精度算术的影响。我们通过开发一个可检查的执行接口来填补这一空白。因此,我们用轨迹监督的符号神经执行器实例化该接口。模型接收寄存器机器指令,并通过一组命名的连续算术和逻辑运算学习更新归一化寄存器状态。其转换被训练为符号状态机的可微近似: `\mathcal{T}: \mathcal{S} \times \mathcal{I} \rightarrow \mathcal{S},` (1) 但评估是在计算机通常被审计的层面进行的,考虑最终状态、完整寄存器轨迹、操作门一致性、确定性硬执行、匹配定点回放行为以及无量纲代理能量和延迟。我们通过生成对连续寄存器向量在[0,1](宽度为8、16或32)上的受控指令序列以及精确参考轨迹(包括初始状态和执行步骤)来构建这一环境。
相似文章
NANQ:面向模拟存内计算的噪声底感知混合精度非均匀量化
本文提出了NANQ,一种面向模拟存内计算(CIM)系统的噪声底感知混合精度非均匀量化框架,它根据硬件噪声特性调整量化精度,并在低位宽约束下提高模型精度。
具有可处理不确定性量化的结构保持神经替代模型
本文提出了针对偏微分方程的结构保持神经替代模型,该模型集成了Gaussian process regression以提供可处理的不确定性量化,从而能够实现具有闭式误差估计的实时仿真。
面向分布式并行AI程序验证的定向神经符号随机执行
本文提出了DNSSE,一种混合框架,结合了基于LLM的调度预测、符号约束求解和覆盖引导的随机变异,用于验证分布式并行AI程序。它在现实基准上检测到的并发缺陷数量是基线的2.9倍,并将分支覆盖率从68.6%提高到91.6%。
NSRAM: 硅芯片上的人工神经元
本文讨论了NSRAM,一种新型的硅芯片上的人工神经元,旨在通过模仿生物神经元,大幅提高AI的能效,解决数据中心GPU高能耗的问题。
一种新型并行QCNN架构,具有高效的经典可模拟性
本文提出了一种新型并行量子卷积神经网络(QCNN)架构,能够高效地经典模拟大规模QCNN,并在128量子比特模型上展示了MNIST二分类的训练过程。