PsiLogic:一种面向Adam的混沌感知主动取消方法及公平跨域基准

arXiv cs.LG 论文

摘要

介绍了PsiLogic,一种基于梯度不稳定性动态阻尼项增强Adam的混沌感知优化器,并提出了FairBench以实现可复现评估。在NLP、ViT和ResNet任务上展示了具有竞争力或更优的结果,并对局限性保持完全透明。

arXiv:2607.16268v1 Announce Type: new 摘要:自适应优化器(如Adam和AdamW)无论训练处于混沌早期阶段还是接近收敛阶段,都采用相同的更新规则。我们引入PsiLogic,这是一种优化器,通过基于尺度归一化梯度范数的双指数移动平均(EMA)门控的动态主动取消项来增强Adam。由此产生的混沌检测器在梯度统计不稳定时加强阻尼,并在训练稳定时逐渐衰减至零,从而无需手动调整学习率预热计划。 我们使用FairBench——一种可复现的基准测试协议(包括逐优化器学习率扫描、每种子相同初始化以及Welch t检验),将PsiLogic与Adam、AdamW和Lion进行了对比。在NVIDIA H100 80GB参考运行(4个竞技场、3个种子、2000步、bf16 AMP)中,PsiLogic在四个竞技场中的三个中取得了最佳验证指标:NLP困惑度7.79 +/- 0.18对比8.17 +/- 0.08(AdamW,p = 0.049),ViT top-1准确率0.244 +/- 0.006对比0.223 +/- 0.002(AdamW,p = 0.015),以及ResNet top-1准确率0.222 +/- 0.001对比0.172 +/- 0.004(Adam,p = 0.001)。在扩散任务上,验证MSE与Adam/AdamW统计上无显著差异(p = 0.49)。ResNet准确率与AdamW相比,在三个种子上数值相当且无统计显著性(p = 0.44)。GPU峰值内存各优化器间相当;PsiLogic在Transformer密集型竞技场上产生1.2--1.8倍的挂钟时间开销(受实现限制)。 我们发布了开源的PyTorch实现、完整的FairBench框架以及所有原始CSV输出,以支持独立验证。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:48

# 基于混沌感知的Adam主动抵消优化器及跨领域公平评测基准
来源: https://arxiv.org/html/2607.16268
###### 摘要

自适应优化器(如 Adam 和 AdamW)无论训练处于混沌的早期阶段还是接近收敛,都应用相同的更新规则。我们提出 PsiLogic (Ψ\Psi) 优化器,该优化器通过一个由尺度归一化梯度范数的双重指数移动平均(EMA)门控的*动态主动抵消项*来增强 Adam。由此产生的*混沌检测器*在梯度统计不稳定时加强阻尼,并在训练稳定时衰减至零,从而无需手动调整调度即可提供隐式预热。

我们使用 FairBench(一个可复现的基准测试协议,包含针对每个优化器的学习率扫描、每种子相同的初始化以及 Welch t 检验)将 PsiLogic 与 Adam、AdamW 和 Lion 进行了比较。在 NVIDIA H100 80GB 参考运行(4 个竞技场,3 个种子,2000 步,bf16 AMP)中,PsiLogic 在*四个竞技场中的三个*取得了最佳验证指标:NLP 困惑度 7.79±0.187.79\pm0.18 vs. 8.17±0.088.17\pm0.08 (AdamW, p=0.049p=0.049),ViT Top-1 准确率 0.244±0.0060.244\pm0.006 vs. 0.223±0.0020.223\pm0.002 (AdamW, p=0.015p=0.015),以及 ResNet Top-1 准确率 0.222±0.0010.222\pm0.001 vs. 0.172±0.0040.172\pm0.004 (Adam, p=0.001p=0.001)。在扩散模型上,验证 MSE 与 Adam/AdamW 统计上持平 (p=0.49p=0.49)。ResNet 与 AdamW 的准确率在三个种子上无显著性差异 (p=0.44p=0.44)。峰值 GPU 内存各优化器间相当;PsiLogic 在 Transformer 密集的竞技场上产生 1.2–1.8×\times 倍的 wall-clock 开销(实现限制;参见第 6 节 (https://arxiv.org/html/2607.16268#S6.SS0.SSS0.Px4))。

我们发布了一个开源的 PyTorch 实现、完整的 FairBench 工具链以及所有原始 CSV 输出,以支持独立验证。

**关键词:** 优化,Adam,自适应学习率,深度学习,可复现性

## 1 引言

优化器的选择影响深度学习的收敛速度、泛化能力和训练稳定性。Adam [7 (https://arxiv.org/html/2607.16268#bib.bib7)] 和 AdamW [9 (https://arxiv.org/html/2607.16268#bib.bib9)] 主导了实践,然而它们的修正信号并不能根据*模型当前的困惑程度*进行调整。在初始化时,梯度大且噪声多;接近收敛时,梯度小且稳定。标准的 Adam 对这两种状态都采用结构相似的更新。

我们提出 PsiLogic,它在 Adam 更新中添加了一个混沌条件阻尼项。当归一化梯度范数的双重 EMA 指示不稳定时,该项最强,并在训练稳定后自动消失。PsiLogic 被设计为 `torch.optim.Adam` 的即插即用替代品,并带有可选的任务预设(PsiLogicNLP, PsiLogicGPT, PsiLogicViT)。

#### 贡献。

1.  1. PsiLogic 优化器——在 Adam 之上实现混沌门控的主动抵消,具有统一衰减、可选的梯度中心化(GC)和自适应梯度裁剪(AGC)。
2.  2. FairBench——一种偏差减轻的评估协议:针对每个优化器的 LR 扫描、每种子相同的权重、多领域任务以及 Welch t 检验。
3.  3. 参考 H100 基准测试——在 `benchmark/results/full/` 目录下提交了可复现的 CSV 和学习曲线图,在 NLP、ViT 和 ResNet 上显示出有竞争力或更优的质量,并明确报告了非显著性和负面的结果。

我们*不*声称普遍优于 AdamW 或 Lion。我们明确报告了局限性——包括步长时间开销以及在扩散模型和 ResNet-vs-AdamW 上的持平结果。

## 2 相关工作

#### 自适应一阶方法。

Adam [7 (https://arxiv.org/html/2607.16268#bib.bib7)] 维护了每个参数自适应速率的偏差校正一阶和二阶矩估计。AdamW [9 (https://arxiv.org/html/2607.16268#bib.bib9)] 将权重衰减与梯度步解耦,是 Transformer 的事实标准。AdaFactor [11 (https://arxiv.org/html/2607.16268#bib.bib11)] 通过因式分解的二阶矩估计来减少内存。Lion [3 (https://arxiv.org/html/2607.16268#bib.bib3)] 使用基于符号的更新并带有耦合的权重衰减;它可能节省内存,但通常需要仔细的 LR 调整。

#### 大批量和逐层缩放。

LARS [13 (https://arxiv.org/html/2607.16268#bib.bib13)] 和 LAMB [14 (https://arxiv.org/html/2607.16268#bib.bib14)] 使用参数范数与梯度范数之比来重新缩放更新,从而稳定非常大的小批量训练。这些方法解决了各层之间的尺度不匹配问题,但并不像 PsiLogic 的混沌检测器那样基于在线梯度*波动性*来门控阻尼。

#### 二阶和曲率感知方法。

Shampoo [6 (https://arxiv.org/html/2607.16268#bib.bib6)] 和 Sophia [8 (https://arxiv.org/html/2607.16268#bib.bib8)] 结合了更丰富的曲率或 Hessian 信息以实现更快的收敛,但每步成本更高。PsiLogic 仍属于一阶 Adam 家族,仅增加了跨参数共享的标量混沌统计。

#### 自动学习率和预热。

手动 LR 预热 [5 (https://arxiv.org/html/2607.16268#bib.bib5)] 是大批量 SGD 和 Transformer 的标准做法。超梯度下降 [1 (https://arxiv.org/html/2607.16268#bib.bib1)] 通过优化器微分以在线调整 LR。最近的*无参数*方法,如 D-Adaptation [4 (https://arxiv.org/html/2607.16268#bib.bib4)] 和 Prodigy [10 (https://arxiv.org/html/2607.16268#bib.bib10)],从观察到的梯度中估计合适的全局步长。PsiLogic 提供了一种互补的、混沌驱动的*隐式预热*:当梯度统计不稳定时,有效阻尼上升,并在没有外部调度的情况下衰减。

#### 稳定性机制。

梯度中心化 [12 (https://arxiv.org/html/2607.16268#bib.bib12)] 和自适应梯度裁剪 [2 (https://arxiv.org/html/2607.16268#bib.bib2)] 改善了训练稳定性。PsiLogic 可选地集成了两者。其主动抵消项是正交的:它在检测到混沌时缩减权重,而不是仅重新缩放或裁剪梯度。

#### 优化器评估。

公平比较需要匹配的调优预算。FairBench 为每个优化器提供自己的 LR 搜索,而不是单个共享 LR,从而减少了历史上混淆优化器比较的调优偏差。

## 3 方法

### 3.1 符号和每组超参数

PsiLogic 在由 `k` 索引的参数组上操作,每个参数组具有学习率 η\eta、AdamW 权重衰减 λ\lambda、混沌增益 γ\gamma,以及一个特定组的*混沌放大因子* P_k ≥ 0P_k \geq 0(实现名称 `p_ext`,默认 1.01.0)。P_kP_k 允许预设为敏感组(例如嵌入)分配更强的抵消,为其他组分配较弱的阻尼,而无需改变全局混沌信号。我们记 g_t = ∇_θ L\mathbf{g}_t = \nabla_\theta \mathcal{L} 为步骤 `t` 的梯度,w_t ∈ [0,1]w_t \in [0,1] 为*混沌预热权重*(第 3.5 节 (https://arxiv.org/html/2607.16268#S3.SS5));这避免了用标量增益重载 g_t\mathbf{g}_t。

### 3.2 更新规则

每一步首先应用统一乘法衰减,然后应用偏差校正的 Adam 梯度步骤。组合这两个操作得到

θ_t+1 = θ_t · (1 − δ_t) − η · (m̂_t) / (√(v̂_t) + ε), \theta_{t+1} = \theta_t \cdot (1 - \delta_t) - \eta \cdot \frac{\hat{m}_t}{\sqrt{\hat{v}_t} + \varepsilon}\,, \tag{1}

其中 m̂_t 和 v̂_t 是通常的*偏差校正* Adam 矩(我们在下文和列表 1 (https://arxiv.org/html/2607.16268#LST1) 中一致使用 ⋅̂\hat{\cdot}),δ_t 是标量统一衰减系数(第 3.4 节 (https://arxiv.org/html/2607.16268#S3.SS4))。列表 1 (https://arxiv.org/html/2607.16268#LST1) 程序性地阐述了相同的序列。

### 3.3 混沌检测器

令 gn_t = ||g_t||_2 / √(numel) \mathrm{gn}_t = ||\mathbf{g}_t||_2 / \sqrt{\mathrm{numel}} 为尺度归一化梯度范数。我们维护:

fast_t = 0.90 · fast_{t-1} + 0.10 · gn_t \mathrm{fast}_t = 0.90 \cdot \mathrm{fast}_{t-1} + 0.10 \cdot \mathrm{gn}_t \tag{2}
slow_t = 0.99 · slow_{t-1} + 0.01 · gn_t \mathrm{slow}_t = 0.99 \cdot \mathrm{slow}_{t-1} + 0.01 \cdot \mathrm{gn}_t \tag{3}
ratio_t = fast_t / (slow_t + ε) \mathrm{ratio}_t = \mathrm{fast}_t / (\mathrm{slow}_t + \varepsilon) \tag{4}
chaos_t = tanh(slow_t) · (1 + 0.5 · tanh(relu(ratio_t − 1))) \mathrm{chaos}_t = \tanh(\mathrm{slow}_t) \cdot \bigl(1 + 0.5 \cdot \tanh(\operatorname{relu}(\mathrm{ratio}_t - 1))\bigr) \tag{5}

快速和慢速 EMA 分别对应于大约 10 和 100 步的有效视野。在自适应模式(默认)下,当 fast_t > τ_scale · slow_t \mathrm{fast}_t > \tau_{\mathrm{scale}} \cdot \mathrm{slow}_t (τ_scale = 2.0 \tau_{\mathrm{scale}} = 2.0) 时,抵消激活,检测梯度混沌中的相对尖峰。随着 slow_t → 0 \mathrm{slow}_t \to 0 接近收敛,chaos_t → 0 \mathrm{chaos}_t \to 0,PsiLogic 缩减为类似 AdamW 的行为。

### 3.4 统一衰减

如果将权重衰减和主动抵消天真地作为单独的乘法因子应用,例如 θ(1−ηλ) \theta(1-\eta\lambda) 后跟 θ(1−c_t) \theta(1-c_t),则只会将参数缩减为 (1−ηλ)(1−c_t) ≈ 1−ηλ−c_t (1-\eta\lambda)(1-c_t) \approx 1-\eta\lambda - c_t,仅至一阶;在大的早期步长下,交叉项 −ηλc_t -\eta\lambda c_t 会过度阻尼权重。PsiLogic 改为每步计算一个组合系数。

定义混沌预热权重 w_t ∈ [0,1] w_t \in [0,1](在初始预热窗口内从 0 开始;第 3.5 节 (https://arxiv.org/html/2607.16268#S3.SS5))以及来自混沌门控的每组尖峰掩码 s_t ∈ {0,1} s_t \in \{0,1\}。在钳位之前的原始抵消分数是

c̃_t = s_t · chaos_t · η · γ · P_k. \tilde{c}_t = s_t \cdot \mathrm{chaos}_t \cdot \eta \cdot \gamma \cdot P_k. \tag{6}

我们钳位并添加权重衰减:

δ_t = ηλ + w_t · min(c̃_t, c_max), c_max = max_cancel \delta_t = \eta\lambda + w_t \cdot \min\!\bigl(\tilde{c}_t,\; c_{\max}\bigr), \qquad c_{\max} = \texttt{max\_cancel} \tag{7}

这是在公式 (1) (https://arxiv.org/html/2607.16268#S3.E1) 中使用的 δ_t。直观地说,ηλ 是 AdamW 的衰减贡献;w_t · min(c̃_t, c_max) 是由 P_k 缩放的混沌门控主动抵消;c_max(默认 0.05)限制了不稳定的初始化期间的每步缩减。γ 的可选余弦调度通过 `gamma_T_max` 支持。

#### 可选量子衰减。

令 q_0 ≥ 0 q_0 \geq 0 表示 `quantum_decay` 超参数(默认 q_0 = 0 q_0 = 0 禁用该特性)。当 q_0 > 0 q_0 > 0 时,一个有效速率 q_t 在训练过程中与 γ 一起通过 `gamma_T_max`(用于 γ 的相同调度辅助函数)进行余弦调度。在计算 δ_t 之后,但在列表 1 (https://arxiv.org/html/2607.16268#LST1) 中的 Adam 减法之前,每个坐标乘以

ρ_{t,i} = 1 − η q_t w_t (1 − s_t) tanh(|g_{t,i}|), \rho_{t,i} = 1 - \eta\, q_t\, w_t\, (1 - s_t)\, \tanh\!\bigl(|g_{t,i}|\bigr), \tag{8}

但仅当 s_t = 0 s_t = 0 时,因此辅助的梯度相关正则化不会与尖峰步上的主动抵消叠加。除非另有说明,FairBench 预设使用 q_0 = 0 q_0 = 0。

### 3.5 混沌预热

对于 `chaos_warmup = -1`,预热视界自动缩放为 max(500, T/20) \max(500, T/20),其中 T 是训练步数。当 t ≤ t_warm t \leq t_{\mathrm{warm}} 时,w_t = 0 w_t = 0;然后 w_t 在 t_warm/4 t_{\mathrm{warm}}/4 步内线性上升到 1。这防止混沌项在原始的、从头开始的梯度噪声中触发。

### 3.6 算法

列表 1: PsiLogic(简化版本;对应公式 7 (https://arxiv.org/html/2607.16268#S3.E7)、1 (https://arxiv.org/html/2607.16268#S3.E1))。
for t=1...T:
  grad <- ∇L(theta); 可选应用 AGC 和梯度中心化
  更新 Adam 矩 m, v; 从 ||grad||_2 更新 fast_t, slow_t
  s_t <- 来自混沌门控的尖峰掩码
  c_t <- min(s_t * chaos_t * eta * gamma * P_k, max_cancel)
  delta <- eta * lambda + w_t * c_t
  theta <- theta * (1 - delta)
  theta <- theta * (1 - eta * q_t * w_t * (1 - s_t) * tanh(abs(grad)))
  theta <- theta - eta * m_hat / (sqrt(v_hat) + eps)

### 3.7 与基线的比较

表 1:优化器的特性比较。

## 4 FairBench 评估

### 4.1 协议与竞技场

所有主要数字均来自在 `NVIDIA H100 80GB HBM3`(PyTorch 2.4.1+cu124, CUDA 12.4)上的一次参考运行,配置冻结在 `benchmark/results/full/config.json` 中。FairBench 使用两阶段协议:(1)针对每个优化器在 7 个对数间隔的速率(从 10^{-5} 10^{-5} 到 10^{-2} 10^{-2})上进行 LR 扫描(各 500 步);(2)使用最佳 LR 评估 2000 步,种子为 {0,1,2} \{0,1,2\},并具有相同的初始化。共享设置:批次 64,bf16 AMP,梯度裁剪 1.0,余弦 LR,100 步预热。四个竞技场涵盖 NLP(小型 GPT / TinyStories)、CIFAR-100 上的 ViT-Tiny、Tiny ImageNet 上的 ResNet-18 以及 CelebA 64^2 64^2 上的 DDPM。完整的协议和竞技场表格见附录 A (https://arxiv.org/html/2607.16268#A1)。PsiLogic 使用固定的每竞技场预设;**仅调整 LR**,与所有基线相同。

### 4.2 主要结果

表 2:主要 FairBench 结果(3 个种子的平均值 ± 标准差)。每行最佳值以粗体显示。
选择的 LR。NLP——全部 3.16×10^{-4} 3.16\times10^{-4};ViT——Adam 3.16×10^{-5} 3.16\times10^{-5},AdamW/PsiLogic 3.16×10^{-4} 3.16\times10^{-4},Lion 10^{-4} 10^{-4};ResNet——Adam/Lion 10^{-4} 10^{-4},AdamW/PsiLogic 3.16×10^{-4} 3.16\times10^{-4};扩散——Adam/AdamW/PsiLogic 10^{-3} 10^{-3},Lion 10^{-4} 10^{-4}。
Welch t 检验、计算成本和每种子分解报告于附录 B (https://arxiv.org/html/2607.16268#A2) 至 D (https://arxiv.org/html/2607.16268#A4)。

### 4.3 学习曲线与开销

参见标题
(a) ViT 验证准确率。
(b) NLP 困惑度。
(c) ResNet Top-1 准确率。
(d) ViT 步时间。

图 1: FairBench 学习曲线(平均值 ± 标准差)以及 H100 上的 ViT 每步 wall-clock 开销。
PsiLogic 在表 2 (https://arxiv.org/html/2607.16268#S4.T2) 中报告了 NLP、ViT 和 ResNet 上的最佳验证指标。与 Adam 相比,所有三个增益均具有统计显著性(附录 B (https://arxiv.org/html/2607.16268#A2));与 AdamW 相比,ViT 和 NLP 困惑度显著,而 ResNet 具有数值优势(0.222 0.222 vs. 0.219 0.219),但三个种子上无显著性(p=0.44 p=0.44),并且扩散模型仍持平。ViT 上的步时间开销达到 1.79×\times(图 1 (https://arxiv.org/html/2607.16268#S4.F1),面板 d);此差距是**实现限制**而非混沌统计本身固有的(第 6 节 (https://arxiv.org/html/2607.16268#S6.SS0.SSS0.Px4))。

## 5 消融实验与组件分析

在 v0.3.x 的合成 MLP 任务上的先前消融实验表明,梯度中心化和自适应梯度裁剪在与混沌项结合时各自独立地提高了稳定性。*镜像消融*实验证明,将 PsiLogic 的抵消幅度动态镜像为 AdamW 权重衰减并不能完全复现 PsiLogic 的每参数行为,表明混沌信号不等于单个全局权重衰减调度。

这些消融实验先于 FairBench 进行;组件测试维护在 `tests/` 中。扩展的 FairBench 消融实验(γ、max_cancel、chaos_warmup)计划中。

## 6 讨论

#### 为什么混沌阻尼有帮助。

ViT 上早期的大幅改进(0.244 0.244 vs. 0.079 0.079 Adam)表明混沌项抑制了梯度环境不稳定时的破坏性早期更新。

相似文章

随机动态系统的Adam算法分析

arXiv cs.LG

本文建立了针对时变和非平稳随机系统的Adam优化器的通用理论,在允许非平稳和依赖数据的随机激励条件下,提供了参数跟踪和输出预测误差界。

Gefen:优化的随机优化器

arXiv cs.LG

Gefen是一种内存高效的优化器,通过自动共享二阶矩估计并使用学习到的码本量化一阶矩,将AdamW的内存占用减少约8倍,同时保持与AdamW相当的性能。

超越熵:通过对比策略优化的正确性感知优势塑造

Hugging Face Daily Papers

本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。