@sedielem: 这是一篇精彩的LLM轶事:原始缩放定律因一个错误而失效,很可能导致大量计算浪费在…
摘要
原始LLM缩放定律中的一个错误导致计算浪费在过大且训练不足的模型上,作者分享了这一发现。
这是一篇精彩的LLM轶事:原始缩放定律因一个错误而失效,很可能导致大量计算浪费在过大且训练不足的模型上 🫣(而且这还是在我们将推理成本纳入核算之前!)
查看缓存全文
缓存时间: 2026/07/06 16:08
这是一个关于LLM的有趣冷知识:最初的缩放定律因一个bug而被证明是错误的,这可能导致了大量计算资源被浪费在过度庞大但训练不足的模型上🫣(而这还是在我们开始正确考虑推理成本之前!)
相似文章
@lilianweng: 一篇超级迟到的(3年以上?)关于扩展定律的帖子。计算很昂贵。扩展定律是一种帮助我们推理…
Lilian Weng的博客文章全面概述了深度学习中的扩展定律,涵盖了它们的推导、计算最优分配以及Kaplan等人与Chinchilla之间的争论。
扩展定律,谨慎解读(25分钟阅读)
全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。
LLM的下一个重大‘扩展时代’是什么
作者回顾了过去LLM的扩展时代(模型规模、思维链、智能体),并推测下一个重大扩展维度,提出递归自我改进可能是一个突破。
@omarsar0:Meta 令人印象深刻的新论文。(收藏)缩放定律假设模型规模和训练数据独立作用于损失…
Meta 研究人员提出了 Skaling 定律,这是一种广义的缩放定律,通过单个交互指数将模型容量和数据耦合起来,将预测误差降低 1.5–3 倍,并使得全网格外推所需的计算量减少约 10 倍。
@neural_avb: 给他们一大笔钱,这样他们就能进行这些扩展到70亿参数及以上的大语言模型的实验。从中学到的东西太多了…
Zyphra 分享了他们在大型语言模型持续学习方面的首项工作,研究模型是否能够从新数据中持续学习,并推导出在高达70亿参数的扩展实验中塑性丧失开始的缩放定律。