PLDR-LLMs 的训练与推理动态:行映射坍缩、重正化与预测约化

Hugging Face Daily Papers 论文

摘要

本专著为幂律解码器表示语言模型(PLDR-LLMs)的训练与推理动态提供了统一的解释,涵盖精确恒等式、重正化和实验发现。

本专著为幂律解码器表示语言模型(PLDR-LLMs)的训练与推理提供了统一的解释。精确的有限功恒等式将行中心学习映射的绝对能量变化分解为参数贡献、带符号交互和数值观测缺陷。正仿射阻塞使得重启在行常数面上得以保留,而增强的AdamW状态提供了完整的动态描述。 预测性重正化作用于针对不同语料库目标块的单次传递的完整条件训练法则,保留优化器内存、剩余数据、调度和数值策略。自主约化需要封闭性;近似约化携带后继和发射误差。有限群体协方差、匹配的物理时钟、矩阵通量和带符号时间能量将行动态连接到模型范围的观测。区分绝对行坍缩、相对行集中、算子稳定化和预测准确性。 实验揭示了观察者和优化器的依赖性,拒绝了测试的自主行状态候选,并支持有限条件预测和状态特定的算子约化。独立的单次传递族展示了移动的有限波动区域,但没有建立热力学临界类。条件对称性、头限制、协方差流和读出误差预算指定了将缩放定律转移到推理所需的假设。该理论分离了精确恒等式、条件动态声明和有限经验发现,并伴有证明、选定的形式检查和紧凑的数值证据。
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:15

论文页面 - PLDR-LLMs的训练与推理动态:行映射坍缩、重整化与预测性约简

来源:https://huggingface.co/papers/2609.34130

摘要

本专著对幂律解码器表征语言模型((PLDR-LLMs))的训练与推理过程进行了统一阐述。精确有限功恒等式将行中心化学习映射的绝对能量变化分解为参数贡献、带符号交互作用和数值观测缺陷。正仿射阻断保留了行常数面上的重启过程,而增强的AdamW状态提供了完整的动力学描述。预测性重整化作用于对不同语料库目标块进行单次遍历的完整条件训练规律,并保留优化器记忆、剩余数据、调度策略和数值策略。自主约简需要封闭性;近似约简会带来后继与发射误差。有限总体协方差、匹配的物理时钟、矩阵通量和带符号的时间能量将行动力学与模型全局观测相联系。绝对行坍缩、相对行集中、算子稳定性和预测准确性被明确区分。实验揭示了观测者与优化器的依赖性,否定了被测试的自主行状态候选方案,并支持有限条件预测和状态特定算子约简。独立的单次遍历族表现出移动有限涨落区域,但未建立热力学临界类。条件对称性、头部限制、协方差流和读出误差预算规定了将缩放定律转移至推理所需的假设。该理论区分了精确恒等式、条件动力学论断和有限经验发现,并辅以证明、选定的形式化检验和简洁的数值证据。

查看arXiv页面 (https://arxiv.org/abs/2609.34130)查看PDF (https://arxiv.org/pdf/2609.34130)项目页面 (https://huggingface.co/fromthesky)GitHub0 (https://github.com/burcgokden/PLDR-LLM-Training-Dynamics)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.34130)

引用本文的模型0

无关联模型

在模型README.md中引用 arxiv.org/abs/2609.34130 以从本页面建立关联。

引用本文的数据集0

无关联数据集

在数据集README.md中引用 arxiv.org/abs/2609.34130 以从本页面建立关联。

引用本文的空间0

无关联空间

在空间README.md中引用 arxiv.org/abs/2609.34130 以从本页面建立关联。

包含本文的收藏集0

无包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection)以从本页面建立关联。

相似文章

层表示动力学:跨嵌入器和基础大语言模型的实证研究

arXiv cs.LG

本文引入了层表示动力学(LRD),这是一个包含三个测量家族的框架,用于分析语言模型中各层隐藏状态的变化。应用于30个MTEB任务上的31个模型,LRD揭示了架构差异,并实现了无标签模型选择和推理时层剪枝。

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。