@rohanpaul_ai:Meta新论文显示,小模型可能并非规模预测效果不佳,或许只是未获得充分调优。研究发现……

X AI KOLs Timeline 论文

摘要

Meta最新论文显示,小型模型能够准确预测缩放规律,但需要更全面的超参数调优。研究发现,缩放规律在参数量约400万时开始显现,通过恰当调优其特征会变得更加清晰。

最新Meta论文显示,小模型可能并非尺度预测的劣质指标——它们或许只是未被充分调参。 研究发现扩展规律在约400万参数规模时显现,此时模型可在单块GPU上于1小时内完成训练。 小模型对超参数表现出异常敏感性。 当每个尺度仅配置4或16组参数时,规律几乎不可见;增至64组时规律初现但外推效果较差;达到256组时规律才趋于稳定。 随着模型规模扩大,优良参数组合在搜索空间中的占比增加,且接近最优解时的有效超参数数量趋近于1。 这解释了为何扩展规律在大模型中更清晰:因其更易调参。 作为验证,小规模实验确认了在测试范围内,预归一化Transformer的扩展性优于后归一化版本。 存在一个界限:若过度外推至远超实测规模的区域,统计误差可能主导结果。 对于模型研究而言,低成本实验可能需要更广的调参范围,而非单纯追求更大的模型规模。 – arxiv.org/abs/2608.11859 标题:"小规模实验:已就绪否?"
查看原文
查看缓存全文

缓存时间: 2026/08/17 04:07

最新Meta论文表明,小模型可能并非不良的规模预测器——它们或许只是未得到充分调参。

研究发现,当模型参数达到约400万时,缩放定律开始显现,此时模型可在单块GPU上于1小时内完成训练。

小模型对超参数异常敏感。

当每个规模仅测试4或16种配置组合时,缩放定律基本不可见;测试64种配置时定律显现但外推性较差;而当配置数达到256种时,定律变得准确可靠。

随着模型规模扩大,优质参数配置在搜索空间中的占比逐渐增加,且最优解附近的有效超参数数量趋近于1。

这有助于解释为何大规模模型的缩放定律更清晰——这类模型更易于调参。

作为验证,小规模实验在测试范围内复现了预归一化Transformer比后归一化模型具有更优缩放特性的结论。

但存在一个限制:若超出实测规模过度外推,统计误差可能主导结果。

对于模型研究而言,低成本实验可能需要更广泛的调参广度,而非单纯扩大模型规模。

– arxiv. org/abs/2608.11859

论文标题:《小规模实验:足够可靠了吗?》

相似文章

奖励模型过度优化的标度律

OpenAI Blog

OpenAI 研究人员通过实验研究了奖励模型过度优化对性能的影响,建立了标度律来说明代理奖励优化与真实性能之间的关系如何随优化方法变化,并与模型规模成可预测的关系。