@BetaTomorrow: #DeepManifoldInterpretation 论文:《语言模型的熵校准》 作者:Steven Cao, Gregory Valiant, 等人…
摘要
该论文《语言模型的熵校准》将熵的上升解释为自回归生成中可达路径的扩散增加,提出由于重尾数据,扩展的效益有限,并建议一种路径感知的解码替代方案。
查看缓存全文
缓存时间: 2026/08/18 02:30
#深度流形解读
论文:《语言模型的熵校准》
作者:Steven Cao, Gregory Valiant 与 Percy Liang(@percyliang)
论文的熵校准结果可解读为:在递归改变边界条件下产生的内在路径不稳定性。
在自回归生成过程中,每个生成的词元都成为下一段上下文的组成部分,因此每一步都改变了迭代积分的边界条件,并可能将推理过程引向学习流形中约束更弱的不同区域。
论文所测量到的熵值上升,因此可视为可访问路径扩散度的增加,而不仅仅是逐词元误差的累积。
对于自然语言而言,规模提升收效甚微,因为重尾分布的数据不断暴露流形中的新稀疏区域;扩大模型规模虽能扩展覆盖范围,但也会揭示更多约束不足的几何结构。
截断和低温解码通过收窄可容许路径来稳定生成过程,但会牺牲多样性。
最引人深思的是,论文提出的“未来熵“概念暗示了一种路径感知的替代方案:选择当前词元不仅依据其局部概率,还需考虑它所开启的延续序列的预期稳定性。
#深度流形解读
论文:《小规模实验:我们准备好了吗?》
作者:Nicholas Lourie(@NickLourie), Kyunghyun Cho(@kchonyc), Karen Ullrich(@karen_ullrich), Sanae Lotfi(@LotfiSanae)
论文发现经过精心调优的小模型能够复现大规模趋势,这一结论自然契合数据驱动架构的理念,但也揭示了其局限性。学习本质上是逆问题:表达数据所需的结构与自由度是事先未知的。
因此深度流形理论主张:架构应当遵循学习空间而定,而非仅凭规模预设。具体而言——
《深度流形第二部分:神经网络数学》§4.7 数据驱动架构指出
模型规模应主要由学习空间内数据的非线性程度决定。
小规模实验能揭示特定架构族内的扩展趋势,但无法独自确定基础学习问题最终所需的自由度数量。
论文的第二个重要观察——小模型对超参数高度敏感,而这种敏感性随规模扩大而减弱——可通过深度流形理论解读为刚性与训练动态的差异。
小模型具有较少的有效自由度,因而更刚性:学习率、预热策略、归一化方法或其他训练条件的变化会更强烈地约束其演化中的流形。
大模型具有更强的表征弹性,能够容纳或围绕此类扰动进行重组。
更重要的是,训练是动态过程,超参数的作用不仅限于施加时刻;其影响会通过后续迭代传播,并可能在很久之后才体现在学习到的几何结构中。
正如《训练动态的数学考量》中所述,训练条件具有时间延迟效应,因为每次参数更新都会改变后续所有学习的起始状态。
从这一视角看,大模型并非简单地对超参数敏感性降低,而是对延迟效应具有更强的动态耐受性。
相似文章
通过熵门控连续比特流扩散缩小语言建模中的自回归差距
本文介绍了一种扩散语言模型,将文本视为二进制比特流上的连续过程,利用熵门控随机采样来缩小与自回归模型的性能差距。该模型在 LM1B 和 OWT 基准测试中取得了最先进的结果,同时降低了内存占用。
微调提升了语言模型的信息传递能力
本文引入冠层熵(CE⋆)来衡量语言模型中生成空间的有效大小,并发现微调将不确定性重新组织为更具信息量和语义意义的输出,使熵率与语义多样性之间的相关性几乎增加了两倍。
@Letian_Wang_6: 语言用了自回归,其他一切都用了扩散——这是一个不稳定的均衡。最近一直困扰我的问题是:……
一位研究者思考这种不稳定的均衡:语言使用自回归模型,而其他模态使用扩散模型,并推测统一的多模态架构取决于每种模态揭示信息的顺序。他为此押下了赌注。
不确定但确信:揭示扩散语言模型中的表征-置信度差距
本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。
@rohanpaul_ai: 非常有趣的工作——语言模型不仅会在输出表面产生不良结果;它们还会经历内部状态…
讨论了一项研究,表明语言模型会展现出内部状态,这些状态携带了不确定性、策略性扭曲或不当服从的痕迹,而不仅仅是产生不良输出。