@BetaTomorrow: #DeepManifoldInterpretation 论文:《语言模型的熵校准》 作者:Steven Cao, Gregory Valiant, 等人…

X AI KOLs Following 论文

摘要

该论文《语言模型的熵校准》将熵的上升解释为自回归生成中可达路径的扩散增加,提出由于重尾数据,扩展的效益有限,并建议一种路径感知的解码替代方案。

#DeepManifoldInterpretation 论文:《语言模型的熵校准》 作者:Steven Cao, Gregory Valiant, and Percy Liang (@percyliang) 该论文的熵校准结果可以解释为在递归改变边界条件下的内在路径不稳定性。 在自回归生成中,每个生成的令牌成为下一个上下文的一部分,因此每一步都会改变迭代积分的边界条件,并可能将推断重定向到学习流形的更弱约束区域。 因此,论文测量的熵上升可以被视为可达路径的扩散增加,而不仅仅是令牌级错误的累积。 对于自然语言,扩展帮助不大,因为重尾数据不断暴露流形的新稀疏区域;增加模型大小扩大了覆盖范围,但也揭示了额外的弱约束几何。 截断和低温解码通过缩小允许路径来稳定生成,但以多样性为代价。 最有趣的是,论文的未来熵思想建议了一种路径感知的替代方案:选择当前令牌不仅基于其局部概率,还基于其开启的延续的预期稳定性。
查看原文
查看缓存全文

缓存时间: 2026/08/18 02:30

#深度流形解读
论文:《语言模型的熵校准》
作者:Steven Cao, Gregory Valiant 与 Percy Liang(@percyliang)

论文的熵校准结果可解读为:在递归改变边界条件下产生的内在路径不稳定性。

在自回归生成过程中,每个生成的词元都成为下一段上下文的组成部分,因此每一步都改变了迭代积分的边界条件,并可能将推理过程引向学习流形中约束更弱的不同区域。

论文所测量到的熵值上升,因此可视为可访问路径扩散度的增加,而不仅仅是逐词元误差的累积。

对于自然语言而言,规模提升收效甚微,因为重尾分布的数据不断暴露流形中的新稀疏区域;扩大模型规模虽能扩展覆盖范围,但也会揭示更多约束不足的几何结构。

截断和低温解码通过收窄可容许路径来稳定生成过程,但会牺牲多样性。

最引人深思的是,论文提出的“未来熵“概念暗示了一种路径感知的替代方案:选择当前词元不仅依据其局部概率,还需考虑它所开启的延续序列的预期稳定性。

#深度流形解读
论文:《小规模实验:我们准备好了吗?》
作者:Nicholas Lourie(@NickLourie), Kyunghyun Cho(@kchonyc), Karen Ullrich(@karen_ullrich), Sanae Lotfi(@LotfiSanae)

论文发现经过精心调优的小模型能够复现大规模趋势,这一结论自然契合数据驱动架构的理念,但也揭示了其局限性。学习本质上是逆问题:表达数据所需的结构与自由度是事先未知的。

因此深度流形理论主张:架构应当遵循学习空间而定,而非仅凭规模预设。具体而言——

《深度流形第二部分:神经网络数学》§4.7 数据驱动架构指出
模型规模应主要由学习空间内数据的非线性程度决定。

小规模实验能揭示特定架构族内的扩展趋势,但无法独自确定基础学习问题最终所需的自由度数量。

论文的第二个重要观察——小模型对超参数高度敏感,而这种敏感性随规模扩大而减弱——可通过深度流形理论解读为刚性与训练动态的差异。

小模型具有较少的有效自由度,因而更刚性:学习率、预热策略、归一化方法或其他训练条件的变化会更强烈地约束其演化中的流形。

大模型具有更强的表征弹性,能够容纳或围绕此类扰动进行重组。

更重要的是,训练是动态过程,超参数的作用不仅限于施加时刻;其影响会通过后续迭代传播,并可能在很久之后才体现在学习到的几何结构中。

正如《训练动态的数学考量》中所述,训练条件具有时间延迟效应,因为每次参数更新都会改变后续所有学习的起始状态。

从这一视角看,大模型并非简单地对超参数敏感性降低,而是对延迟效应具有更强的动态耐受性。

相似文章

微调提升了语言模型的信息传递能力

arXiv cs.CL

本文引入冠层熵(CE⋆)来衡量语言模型中生成空间的有效大小,并发现微调将不确定性重新组织为更具信息量和语义意义的输出,使熵率与语义多样性之间的相关性几乎增加了两倍。

不确定但确信:揭示扩散语言模型中的表征-置信度差距

arXiv cs.CL

本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。