Learn-by-Wire 训练控制治理:压力下实现稳定与高效的受限自主训练
摘要
本文介绍了 LBW-Guard,一个位于 AdamW 优化器之上的受限自主训练控制治理层,用于监测遥测数据并在训练过程中施加受限控制,展示了在压力条件下困惑度的改善和训练速度的提升。
arXiv:2605.19008v1 公告类型:新
摘要:现代语言模型训练越来越容易受到不稳定性、降级运行和计算资源浪费的影响,尤其是在激进的学习率、规模扩展和运行时压力条件下。本文介绍了 Learn-by-Wire Guard(LBW-Guard),一个位于 AdamW 优化器之上的受限自主训练控制治理层。LBW-Guard 并非替代优化器更新规则,而是观察训练遥测数据、解读不稳定敏感区域,并在保持固定训练目标的同时,对优化器执行施加受限控制。
我们使用 WikiText-103 数据集,在以 Qwen2.5 为核心的压力与鲁棒性测试套件中评估了 LBW-Guard,以 Qwen2.5-7B 作为实证锚点,并与 Qwen2.5-3B 和 Qwen2.5-14B 进行模型规模对比,同时进行了学习率压力测试、梯度裁剪基线比较以及无 LoRA 的 TinyLlama-1B 全参数合理性检查。在 7B 参考设置下,LBW-Guard 将最终困惑度从 13.21 降至 10.74,提升了 18.7%,同时端到端时间从 392.54 秒缩短至 357.02 秒,实现了 1.10 倍的加速。在更强的学习率压力下,AdamW 在 LR=3e-3 时的最终困惑度退化至 1885.24,在 LR=1e-3 时为 659.76,而 LBW-Guard 仍可训练,分别达到 11.57 和 10.33。梯度裁剪基线未能复现此效果。
这些结果支持一个有限范围的系统结论:对稳定性敏感的 LLM 训练可以从优化器上方的治理平面中获益。LBW-Guard 提供了证据,表明在压力下,受限运行时控制可以保留有效计算,同时与优化器替换和局部梯度抑制保持区别。
查看缓存全文
缓存时间: 2026/05/20 08:27
# 有界自主训练在压力下的稳定性与效率:基于线控的训练控制治理 来源:https://arxiv.org/html/2605.19008 ## 线控训练控制治理:压力下有界自主训练的稳定性与效率 ###### 摘要 现代语言模型训练日益面临不稳定、运行退化及算力浪费的问题,尤其是在激进的学习率、规模及运行时压力条件下。本文介绍了Learn-by-Wire Guard (LBW-Guard),这是一个运行在AdamW之上的有界自主训练控制治理层。LBW-Guard并非取代优化器更新规则,而是观测训练遥测数据、解读不稳定敏感区间,并对优化器执行施加有界控制,同时保持固定的训练目标。 我们在以Qwen2.5为核心的应力与鲁棒性测试套件中评估了LBW-Guard,使用WikiText-103数据集,以Qwen2.5-7B作为经验锚点,并与Qwen2.5-3B和Qwen2.5-14B进行模型规模比较,同时进行了学习率压力测试、梯度裁剪基线测试以及无LoRA的TinyLlama-1B全参数健全性检查。在7B参考设置中,LBW-Guard将最终困惑度从13.21降低至10.74,提升了18.7%,同时将端到端时间从392.54秒缩短至357.02秒,实现了1.10倍的加速。在更强的学习率压力下,当时,AdamW的最终困惑度退化为1885.24,当时为659.76;而LBW-Guard在对应条件下仍可训练,分别达到11.57和10.33。梯度裁剪基线无法复现此效果。 这些结果支持一个范围性的系统结论:对稳定性敏感的LLM训练可以从优化器上方的治理层面获益。LBW-Guard提供了证据表明,有界运行时控制可以在压力下保持生产性计算,同时与优化器替换和局部梯度抑制保持区别。 预印本版本准备提交至arXiv,2026年5月。 关键词:大规模语言模型;训练控制治理;线控;AdamW;训练稳定性;有界自主控制;损失尖峰;计算效率;机器学习系统 ## 1 引言 现代模型训练日益昂贵、脆弱,且在不同模型规模下操作困难。不稳定性并非前沿训练独有:中小型规模训练工作负载在激进的学习率、更长的预算、更宽的训练模块或不利的批处理与序列条件下也可能表现出脆弱的轨迹。规模变化带来的是操作和经济后果。随着模型大小、训练时长和基础设施复杂性的增加,一次失败或严重退化的运行会消耗更多加速器时间、延迟实验、增加恢复负担[9, 6, 3]。 历史上,对训练困难的主要应对方式一直是以优化器为中心的。诸如Adam的自适应方法、AdamW等改进方法以及Adafactor等内存高效方法使现代深度学习成为现实[10, 11, 19]。然而,当训练成为一个脆弱的运行时过程时,以优化器为中心的抽象是不完整的。训练不稳定性在前馈网络、循环网络和自适应优化中早有研究,其中梯度流病理、梯度爆炸或消失、初始化不良以及不收敛可能损害学习[5, 14, 17]。 大规模模型的报告揭示了这些问题的操作成本。PaLM报告了重复的损失尖峰以及通过检查点回滚和跳过批次进行的缓解;OPT报告了通过降低学习率并从早期检查点重启来处理发散;GLM-130B报告了围绕损失尖峰和发散的工程挑战[3, 22, 21]。数据中心研究进一步表明,LLM开发与硬件故障、调度复杂性和恢复工程纠缠在一起[7]。Jiang等[8]从生产平台分析了428次大规模LLM训练失败,并报告此类失败浪费资源和时间。 本文认为,LLM训练应被同时理解为一个优化过程和一个运行时控制问题。优化器计算参数更新,但单凭它们并未提供一个用于在训练期间检测、解读和响应不稳定运行条件的治理层。当训练运行变得漫长、昂贵且脆弱时,这一区别变得重要:核心问题不仅是优化器能否在稳定条件下降低损失,而且是训练过程在出现不稳定性时是否仍能保持生产性。 我们通过Learn-by-Wire Guard (LBW-Guard) 具体化了这一观点,它是在AdamW之上的有界自主训练控制治理层。类似于航空领域的线控飞行系统,线控训练根据运行时条件调节执行,同时保持底层执行器不变。本文中,AdamW作为优化器保持不变;LBW-Guard提供了所需的感知、状态解读、有界控制姿态、执行接口和遥测能力,以在压力下指导优化器执行。 本文的贡献有五点:(i) 我们引入了训练控制治理作为优化器执行之上的一个系统层;(ii) 我们在组件控制级别上详细说明了LBW-Guard;(iii) 我们通过以Qwen2.5-7B为中心的应力与鲁棒性测试套件进行了评估,包括3B和14B模型规模比较;(iv) 我们测试了所观察到的效果是否可以归结为普通的梯度裁剪;以及(v) 我们通过无LoRA的TinyLlama-1B健全性检查提供了初步证据,表明该效果在结构上不依赖于LoRA。 ## 2 相关工作 大规模神经网络训练传统上以优化器为核心学习抽象。随机优化方法及其自适应变体提供了计算机制,模型参数据此响应梯度信息进行更新。Adam、AdamW、Adafactor、AdEMAMix及相关方法改进了更新计算、自适应缩放、内存效率和正则化行为[10, 11, 19, 1, 4, 13]。最近的优化器基准测试工作进一步表明,在LLM训练中,优化器性能必须在控制变量(模型大小、批大小、训练时长和优化机制)下进行评估[18]。本文建立在该优化器基础之上,但并不提出新的更新规则。相反,LBW-Guard在AdamW执行之上引入了一个有界训练控制治理层。AdamW仍负责参数更新,而LBW-Guard监控训练状态、解读不稳定性并施加对优化器执行的有界控制。 第二类工作研究训练不稳定性和稳定化。经典神经网络训练研究探讨了梯度爆炸和消失、信号传播不良、初始化敏感性以及循环网络不稳定性[5, 14, 17]。更近期的工作分析了自适应优化中的收敛失败和病态行为,包括Adam类方法可能无法收敛或表现不稳定的条件[17]。其他稳定化方法通过诸如梯度裁剪、归一化策略、架构修改或无归一化训练等机制来解决不稳定性[2]。这些方法很重要,因为它们减少了模型或优化器管道内特定的不稳定性来源。然而,它们通常是局部干预:它们修改梯度、架构、归一化行为或优化器动态。LBW-Guard处理的是不同抽象层次的问题。它将不稳定性视为一种运行时训练条件,需要通过感知、解读并通过有界控制进行治理。 最近的LLM专项研究进一步激发了训练控制视角的需求。大规模语言模型训练已知会出现损失尖峰、发散、激进学习率下的不稳定性以及对训练配置的敏感性。来自PaLM、OPT和GLM-130B的公开报告描述了诸如检查点回滚、跳过批次、降低学习率和从早期检查点重启等实际缓解策略[3, 22, 21]。这些例子表明,不稳定性不仅仅是理论上的优化问题;它成为一个操作事件,必须在训练期间被检测、解读和管理。最近关于Adam不稳定性和LLM损失尖峰缓解的工作也强化了以下观点:不稳定性可以在训练期间动态出现,可能需要超越普通优化器选择的机制[12, 20]。LBW-Guard正定位在这个间隙中:它不取代优化器研究,但增加了一个运行时治理层,能够在保持底层优化器不变的同时响应不稳定性。 基础设施和生产研究使这个问题具有经济意义。随着模型变得更大、训练运行变得更长,不稳定性不仅影响最终损失,还影响计算生产率、挂钟时间、工程努力和实验可靠性。规模法则和计算最优训练研究表明,模型质量与计算分配、数据规模和训练效率紧密相关[9, 6]。然而,在生产环境中,计算资源不仅被成功的学习消耗,也被失败运行、退化轨迹、硬件故障、调度低效、检查点恢复和操作重启消耗。数据中心研究表明,大规模语言模型开发与基础设施故障、资源不平衡和容错恢复纠缠在一起[7]。来自大规模训练平台的生产证据进一步表明,训练失败会浪费大量资源和时间[8]。这些发现激发了超越最终验证损失本身的评估标准。训练方法还应通过其在压力下是否保持生产性计算来进行评估。 这一区别是本文的核心。标准优化器比较通常询问在给定配置下哪种更新规则实现更好的损失或收敛。稳定化方法通常询问是否可以通过裁剪、归一化或架构调整来减少特定病理。LBW-Guard提出了一个互补的系统问题:是否可以在执行过程中对训练过程进行治理,使得不稳定性能够被早期感知、解读为一个运行条件,并通过有界纠正行为进行处理?这将焦点从优化器替换转向训练控制治理。优化器仍计算更新;治理层管理执行这些更新的条件。 因此,最近的概念类比不是另一个优化器,而是围绕现有执行机制的控制层。正如安全关键的工程系统通常将执行器与管理其操作的控制逻辑分开一样,LBW-Guard将作为优化器执行器的AdamW与监控和调节训练执行的有界治理逻辑分开。这种架构分离很重要,因为它允许该方法与现有优化器基础设施保持兼容,同时增加遥测、状态解读、有界控制姿态和日志记录。日志记录器还通过控制活跃步数、状态切换、规模和控制能量等数量使控制过程可观察。这种可观察性支持对训练行为的系统级解释,而不是将该方法视为不透明的性能改进。 与梯度裁剪的经验比较对于定位尤为重要。梯度裁剪是一种广泛使用的稳定化技术,但主要作为局部梯度抑制。它本身并不构成训练状态治理循环:它不解读操作状态,不区分压力与恢复类条件,也不将控制活跃行为记录为运行级过程。因此,本文中的裁剪基线测试LBW-Guard的效果是否可以归结为普通的梯度幅度限制。结果表明,单纯裁剪无法复现所观察到的压力下可训练性保持,支持了LBW-Guard在不同抽象层次上运行的论断。 总之,先前工作为本文提供了三个基础:优化器研究解释了参数更新如何计算;稳定化研究解释了局部训练病理如何减少;生产基础设施研究解释了不稳定性为何具有操作和经济后果。LBW-Guard为这些文献之间的空间做出了贡献。它将LLM训练视为一个运行时系统,不仅需要优化,还需要对训练过程进行有界自主控制治理。这一框架为随后的组件级方法规范和应力与鲁棒性评估提供了动机。 传感层|轻量级遥测 分析器|运行状态估计 策略/控制器|有界姿态 执行器|治理AdamW执行 AdamW优化器|更新引擎 遥测记录器|控制活跃步数 图1:LBW-Guard架构。AdamW保持为优化器平面,而LBW-Guard作为有界控制治理平面运行于训练执行之上。 ## 3 LBW-Guard:组件控制方法 LBW-Guard是一个有界自主控制治理层,它包裹AdamW但不重新定义AdamW。优化器平面仍然负责参数更新。治理平面监控训练轨迹、解读运行条件、选择有界控制姿态,并对优化器执行路径施加约束后的执行动作。图1总结了该架构。 表1:LBW-Guard的组件级方法规范。传感层是只读的,在结构上不依赖于LoRA。传感器可以使用轻量级仅损失遥测或稀疏探测;全梯度仪器是可选的而非必需的。贡献在于系统层级。
相似文章
神经代理控制:一种基于深度学习、LLM驱动的代理AI框架,用于安全控制的管控
本文介绍了一种神经代理控制框架,该框架将一个基于LLM的规划器(Gemini 2.5 Flash-Lite)与一个预训练的时间序列基础模型(TimesFM)相结合,用于工业物联网中基于物理的自主防御。一种反事实物理注入机制确保仅执行安全、非幻觉的动作,在SWaT数据集上实现了零无效动作,并且比LSTM和TCN基线具有更好的入侵预防效果。
AgentBound: 自主AI智能体的可验证行为治理
AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。
互动训练 2:面向实时模型训练的可审计控制平面
互动训练 2 引入了一个通过共享协议引导实时模型训练的可审计控制平面,允许人类和自动化控制器提交请求,这些请求在安全控制点进行验证并应用。该系统在自然语言处理(NLP)和强化学习工作流中进行了演示。
运行时的管理自主性:基于档位的单/多智能体信息物理系统安全与治理
本文介绍了EntropyRuntime,一个用于单/多智能体LLM驱动及机器人智能体的离散时间控制系统,采用五个执行档位,配备效用门控调度和事件驱动回退,以确保安全、稳定和连续性。它提供了形式化证明,并在一个三智能体UR5机器人装配单元上进行评估,实现了99.6%的异常检测率。
TEMPO:通过模式分离策略优化实现时间强制,用于可信的大语言模型回测
提出TEMPO,一种策略优化方法,通过使用双模式奖励和基于GRPO的训练,训练大语言模型仅依据截止日期前的信息进行推理,将知识泄露降低2–13%,同时将任务性能提升6–13%。