PLDR-LLMs 的训练与推理动态:行映射坍缩、重正化与预测约化
摘要
本专著为幂律解码器表示语言模型(PLDR-LLMs)的训练与推理动态提供了统一的解释,涵盖精确恒等式、重正化和实验发现。
查看缓存全文
缓存时间: 2026/09/29 08:15
论文页面 - PLDR-LLMs的训练与推理动态:行映射坍缩、重整化与预测性约简
来源:https://huggingface.co/papers/2609.34130
摘要
本专著对幂律解码器表征语言模型((PLDR-LLMs))的训练与推理过程进行了统一阐述。精确有限功恒等式将行中心化学习映射的绝对能量变化分解为参数贡献、带符号交互作用和数值观测缺陷。正仿射阻断保留了行常数面上的重启过程,而增强的AdamW状态提供了完整的动力学描述。预测性重整化作用于对不同语料库目标块进行单次遍历的完整条件训练规律,并保留优化器记忆、剩余数据、调度策略和数值策略。自主约简需要封闭性;近似约简会带来后继与发射误差。有限总体协方差、匹配的物理时钟、矩阵通量和带符号的时间能量将行动力学与模型全局观测相联系。绝对行坍缩、相对行集中、算子稳定性和预测准确性被明确区分。实验揭示了观测者与优化器的依赖性,否定了被测试的自主行状态候选方案,并支持有限条件预测和状态特定算子约简。独立的单次遍历族表现出移动有限涨落区域,但未建立热力学临界类。条件对称性、头部限制、协方差流和读出误差预算规定了将缩放定律转移至推理所需的假设。该理论区分了精确恒等式、条件动力学论断和有限经验发现,并辅以证明、选定的形式化检验和简洁的数值证据。
查看arXiv页面 (https://arxiv.org/abs/2609.34130)查看PDF (https://arxiv.org/pdf/2609.34130)项目页面 (https://huggingface.co/fromthesky)GitHub0 (https://github.com/burcgokden/PLDR-LLM-Training-Dynamics)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.34130)
引用本文的模型0
无关联模型
在模型README.md中引用 arxiv.org/abs/2609.34130 以从本页面建立关联。
引用本文的数据集0
无关联数据集
在数据集README.md中引用 arxiv.org/abs/2609.34130 以从本页面建立关联。
引用本文的空间0
无关联空间
在空间README.md中引用 arxiv.org/abs/2609.34130 以从本页面建立关联。
包含本文的收藏集0
无包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection)以从本页面建立关联。
相似文章
层表示动力学:跨嵌入器和基础大语言模型的实证研究
本文引入了层表示动力学(LRD),这是一个包含三个测量家族的框架,用于分析语言模型中各层隐藏状态的变化。应用于30个MTEB任务上的31个模型,LRD揭示了架构差异,并实现了无标签模型选择和推理时层剪枝。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
强化学习能否教会大型语言模型进行长程推理?表达力是关键
本文介绍了 ScaleLogic 框架,该框架证明了强化学习的训练计算资源消耗遵循与大型语言模型推理深度相关的幂律分布。文章强调,逻辑表达力对于提升下游迁移能力和训练效率至关重要。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
GRRR:解码器LLM后训练中的重塑、旋转与路由几何
本文利用奇异值分解分析LLM的后训练权重更新,识别出驱动性能提升的几何成分,表明重塑奇异值不如旋转和路由变化关键。