以人为中心的学习机制:熵正则化表示学习的动态框架

arXiv cs.LG 论文

摘要

本文提出了以人为中心的学习机制(HCLM),这是一个用于研究开放和受控学习系统的动态信息理论框架。它通过有效信息力形式化了熵正则化,推导了收敛性和泛化结果,并提供了对尺度律行为的条件性解释。

arXiv:2605.22940v1 公告类型:新 摘要:深度学习越来越多地被视作参数空间中的动态过程,但许多现有理论仍将训练视为封闭优化系统。这一观点对于现实世界的人工智能而言具有局限性,因为模型需要在不确定性、资源约束、分布偏移、下游决策风险以及人类反馈下运行。我们提出了以人为中心的学习机制(HCLM),这是一个用于开放和受控学习系统的动态信息理论框架。核心思想是:只有当所选熵代理在优化轨迹上生成非退化信息力时,熵正则化才有用;否则,熵项可能产生弱、不稳定或不匹配的梯度,导致动态过程坍缩为普通损失最小化。我们引入了有效熵的概念,并研究了易处理的几何熵代理,包括基于方差和对数行列式协方差的代理。本文做出三项贡献:首先,通过有效信息力形式化了熵正则化,并刻画了退化熵机制;其次,在明确假设下推导了收敛性、熵流、Wasserstein梯度流和带噪表示的泛化结果;第三,将类尺度律行为解释为信息注入、熵耗散和残差风险之间的平衡,这是一种条件动态解释,而非声称无条件推导出经验神经缩放定律。受控表示学习实验支持了以下假设:几何熵代理(尤其是对数行列式协方差熵)能诱导出比softmax归一化熵更强更稳定的信息力。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:56

# 以人为本的学习力学:一种用于熵调控表示学习的动态框架
来源:https://arxiv.org/html/2605.22940
22通讯作者:Kim Phuc Tran,邮箱:kim\-phuc\.tran@ensait\.frKim Phuc Tran法国里尔大学,ENSAIT,ULR 2461 – GEMTEX – 纺织工程与材料实验室,F\-59000 里尔,法国国际数据科学与可解释人工智能首席专家,国际人工智能与数据科学研究所,东 A 大学,岘港,越南

###### 摘要

虽然深度学习越来越被理解为参数空间中的一个动态过程,但许多现有视角主要将训练建模为一个封闭的优化系统。这种封闭系统视图不足以应对现实世界的人工智能,在这些场景中,模型在不确定性、资源限制、分布偏移、下游决策风险和持续的人类反馈下运行。为弥补这一差距,我们提出了**以人为本的学习力学**(HCLM),这是一个用于研究开放和受控学习系统的动力学与信息论框架。HCLM 的核心前提是:熵正则化的益处并不仅仅源于将其包含在目标函数中。只有当所选的熵替代项沿着优化轨迹产生一个非退化的**信息力**时,它才变得有意义。朴素定义的熵惩罚可能会产生可忽略、不稳定或对齐不良的梯度,在这种情况下,熵正则化的动力学实际上会坍缩为普通的损失最小化。因此,我们引入了**有效熵**的概念,并研究了易于处理的几何熵替代项,包括基于方差和对数行列式协方差的代理量。本文做出了三项具体贡献。首先,我们通过有效信息力形式化了熵正则化,并刻画了退化熵机制。其次,我们在明确假设下推导了收敛性、熵流、Wasserstein 梯度流以及带噪表示泛化的结果。第三,我们通过信息注入、熵耗散和残差风险之间的平衡,提供了缩放法则行为的条件性动力学解释。此解释并非旨在作为经验神经缩放法则的无条件推导。在受控表示学习任务上的实证分析支持以下假设:几何熵替代项,尤其是对数行列式协方差熵,比 softmax 归一化熵能诱导出更强、更稳定的信息力。

关键词:以人为本的学习力学,熵调控学习,表示学习,信息力,带噪表示压缩,Wasserstein 梯度流,受控学习动力学

## 1 引言

深度学习极大地推动了科学、工程和工业的进步。尽管取得了这些进展,但关于这些系统如何学习的理论理解仍不完整。在实践中,神经网络主要使用经验启发式、大规模超参数调整和大量的试错工程进行训练。越来越多的理论工作认为,深度学习是一种物理现象,可以接受严谨的科学理论,从而超越经验启发式。这个新兴范式越来越被称为**学习的力学**[Mei 等人,2018(https://arxiv.org/html/2605.22940#bib.bib10),Chizat 和 Bach,2018(https://arxiv.org/html/2605.22940#bib.bib9)]。在这种力学观点下,神经网络的训练被建模为高维参数空间中的一个连续动力系统。模型沿着由梯度向量驱动的轨迹演化,就像物理粒子在保守力作用下在能量景观中运动一样。网络的架构、数据分布的统计结构、任务目标以及特定的学习规则共同决定了作用于模型参数的有效力。这种封闭系统视角已成功解释了几种普遍现象,例如梯度下降中的稳定性边缘 [Cohen 等人,2021(https://arxiv.org/html/2605.22940#bib.bib3)] 和无限宽平均场极限 [Jacot 等人,2018(https://arxiv.org/html/2605.22940#bib.bib2)]。这种封闭系统力学虽然有用,但在应用于现代现实世界的人工智能(AI)系统时是不完整的。现实世界的 AI 并非在孤立真空中运行。这些系统部署在开放环境中,其特征是深度不确定性、部分可观察性和持续的数据分布偏移。它们受到严格的延迟限制、隐私约束、能耗预算、安全护栏以及持续的人类决策过程的约束。在安全关键、工业和以人为本的场景中——例如自动驾驶、医疗诊断或通过人类反馈对齐的大型语言模型(LLM)——学习已从最小化静态预测误差演变为嵌入更广泛决策循环中的受控信息过程。

为弥补这一差距,本文发展了**以人为本的学习力学**(HCLM),这是一个统一的理论框架,其中学习明确被视为在实际约束和主动人类控制下的熵约束动力学。通过将深度学习重新构想为一个开放的、熵调控的热力学系统,我们确立了 HCLM 的核心原则:**学习是在不确定性和约束下的受控熵塑形**。HCLM 与经典信息论学习 [Tishby 等人,2000(https://arxiv.org/html/2605.22940#bib.bib1)] 的一个关键区别在于熵的操作化。在传统文献中,精确的表示熵通常被视为一个抽象的、难以处理的量,主要用作事后界限。相比之下,HCLM 引入了易于处理的熵替代项,它们积极参与优化过程。本文的目标并非取代随机梯度下降(SGD)或 Adam 等自适应优化器,而是提供一个有凝聚力的框架,用以解释、量化并动态调控学习过程中的信息流。我们发现,简单地将熵正则化项附加到目标函数中是不够的。标准的熵正则化器通常是动态不活跃的,导致退化优化。为解决此问题,我们引入了**有效熵**的概念,证明一个熵替代项只有在它诱导出一个非退化的、可测量的**信息力**,从而主动塑造表示空间的几何结构时,才具有动态有用性。此外,HCLM 提供了对人类或基于奖励的反馈——包括来自人类反馈强化学习(RLHF)[Ouyang 等人,2022(https://arxiv.org/html/2605.22940#bib.bib14)] 的信号——的动态解释,将其视为能够调节熵耗散率的热力学控制机制。通过综合任务驱动的信息注入与受控的熵耗散,该框架为泛化、表示压缩和人类对齐的适应性提供了一种机械论的、数学上明确的视角。我们并不声称缩放法则无条件地源于熵动力学,而是表明在连接信息注入、耗散和超额风险的明确平衡假设下,可以恢复幂律行为。从这个意义上说,HCLM 应被理解为一个受控动力学框架,它阐明了熵调控何时能够支持稳定学习,而不是作为现有优化或统计学习理论的替代品。本文应被视为一项机制研究,而非对现有学习算法的普遍优越性的声称。我们的目标是隔离一个基本的动力学现象:熵只有在产生有效力时才会影响学习。因此,有目的地使用受控综合实验,是因为它们使得信息力的退化、坍缩和稳定化现象在没有大规模架构、数据增强或优化器工程干扰的情况下变得可观测。尤其需要指出的是,HCLM 并不声称熵正则化本身就能解释泛化、对齐或神经缩放法则。相反,它隔离了一个特定的动力学机制:只有当熵沿着优化轨迹诱导出非退化的力时,学习才会受熵影响。

本文组织结构如下。第 2 节回顾相关文献。第 3 节介绍 HCLM 的概念架构。第 4 节定义实用的能量公式和随机表示替代项。第 5 节定义有效熵和信息力。第 6 节建立 HCLM 的理论基础,包括收敛保证、熵流恒等式、表示压缩泛化以及 Wasserstein 梯度流公式。第 7 节提供神经缩放法则的条件性机制解释。第 8 节进行实证分析。详细的数学证明见附录。

## 2 相关工作

HCLM 框架位于学习力学、信息论学习、PAC-Bayes 泛化、平均场动力学、基于尖锐度的分析以及人在回路学习的交叉点。力学观点通过动力系统、极限机制和统计物理启发原理来研究神经网络训练。神经正切核理论通过将非线性优化简化为函数空间中近似线性的演化,解释了无限宽网络的训练动态 [Jacot 等人,2018(https://arxiv.org/html/2605.22940#bib.bib2)],而优化几何的研究揭示了诸如稳定性边缘等现象,其中基于梯度的学习在稳定曲率的边界附近运行 [Cohen 等人,2021(https://arxiv.org/html/2605.22940#bib.bib3)]。这些方法为将训练理解为动态过程提供了强大工具,但它们主要描述由固定损失、固定数据分布和固定优化规则支配的封闭学习系统。HCLM 建立在这种基于轨迹的视角之上,同时通过将熵耗散、表示几何、决策约束以及人类或基于奖励的反馈作为学习动态的显式组成部分,将其扩展到开放和受控系统。

另一条密切相关的研究方向是通过对扰动的鲁棒性、损失景观的尖锐度和平坦度来研究泛化。PAC-Bayes 分析已被用于计算深度随机神经网络的非空洞泛化界,并推导神经网络的谱归一化边界界 [Dziugaite 和 Roy,2017(https://arxiv.org/html/2605.22940#bib.bib8),Neyshabur 等人,2018(https://arxiv.org/html/2605.22940#bib.bib20)]。尖锐度感知最小化显式优化在参数空间局部邻域内保持鲁棒的解 [Foret 等人,2021(https://arxiv.org/html/2605.22940#bib.bib21)]。HCLM 与这些方法是互补的:尖锐度和 PAC-Bayes 平坦度主要刻画参数空间中的稳定性,而 HCLM 则聚焦于作用于表示几何的熵诱导信息力。从这个意义上说,HCLM 可以被视为基于尖锐度的泛化分析在表示几何上的对应物,其重要区别在于它研究的是所选的熵替代项是否主动塑造了学习轨迹,而不仅仅是训练后测量复杂性。

信息论学习传统上通过信息瓶颈原则进行研究,该原则将学习表述为压缩输入与保留与预测目标相关信息之间的权衡 [Tishby 等人,2000(https://arxiv.org/html/2605.22940#bib.bib1)]。相关方法包括变分信息瓶颈 [Alemi 等人,2016(https://arxiv.org/html/2605.22940#bib.bib5)] 以及深度网络中压缩的实证分析 [Shwartz-Ziv 和 Tishby,2017(https://arxiv.org/html/2605.22940#bib.bib4)]。然而,在高维确定性神经网络中,精确的互信息难以可靠估计,并且一个信息量在数学上可能是有意义的,但如果它在训练过程中不能产生有用的梯度,则在动态上可能是不活跃的。因此,HCLM 通过将易于处理的几何熵替代项直接嵌入学习动态中,偏离了标准的信息瓶颈公式。HCLM 不是仅仅将信息视为静态复杂性度量,而是分析其在优化轨迹上的时间注入、耗散以及由此产生的信息力。

PAC-Bayes 理论将泛化与学习到的预测器后验分布与先验分布之间的散度联系起来 [McAllester,1999(https://arxiv.org/html/2605.22940#bib.bib6),Catoni,2007(https://arxiv.org/html/2605.22940#bib.bib7)]。最近的研究表明,当后验和先验被精心构造时,PAC-Bayes 界对于深度网络可以变得非空洞 [Dziugaite 和 Roy,2017(https://arxiv.org/html/2605.22940#bib.bib8)]。另一条补充性工作路线使用训练数据与学习到的假设之间的互信息来推导泛化界 [Russo 和 Zou,2016(https://arxiv.org/html/2605.22940#bib.bib17),Xu 和 Raginsky,2017(https://arxiv.org/html/2605.22940#bib.bib16),Bu 等人,2020(https://arxiv.org/html/2605.22940#bib.bib18)]。HCLM 与这第二种视角一致,但避免假设参数空间 PAC-Bayes 复杂度与表示熵之间存在直接等价关系。相反,它使用带噪表示压缩作为从几何熵控制到泛化的一条更明确的路径。这一区别至关重要:HCLM 并不声称更低的熵会自动改善泛化。相反,它探究的是熵替代项是否诱导出可测量的信息力,以及该力是否以支持稳定预测的方式调节表示几何。

平均场理论将宽神经网络建模为在参数空间上演化的概率测度 [Mei 等人,2018(https://arxiv.org/html/2605.22940#bib.bib10)]。这连接了神经网络训练与最优传输和 Wasserstein 梯度流,其中学习可以被视为最小化自由能泛函的概率分布的演化 [Chizat 和 Bach,2018(https://arxiv.org/html/2605.22940#bib.bib9)]。Fokker-Planck 方程作为 Wasserstein 梯度流的变分公式由 Jordan、Kinderlehrer 和 Otto 建立 [Jordan 等人,1998(https://arxiv.org/html/2605.22940#bib.bib19)]。像随机梯度 Langevin 动力学这样的随机优化方法进一步将学习动力学与 Fokker-Planck 方程和非平衡热力学联系起来 [Raginsky 等人,2017(https://arxiv.org/html/2605.22940#bib.bib11)]。HCLM 建立在这一系列工作的基础上,将熵调控和人类调控的项引入自由能公式,使得学习可以被解释为一个耗散随机过程,其中预测损失、熵产生、表示压缩和外部控制共同塑造系统的演化。

最后,HCLM 与决策感知和人在回路学习相关。标准经验风险最小化假设预测准确性是主要目标,而许多现实世界系统仅将预测用作下游决策的中间量。决策聚焦学习解决了这一问题,

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。

DHRCL:训练代码LLM的密集分层奖励与课程学习

arXiv cs.LG

DHRCL提出了一种结合密集分层奖励与课程学习的强化学习框架,用于训练代码LLM。该框架在三个阶段的课程中,利用语法验证、执行成功、单元测试通过率和AST结构相似性作为反馈信号。

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

arXiv cs.LG

本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。