标签
Google DeepMind 引入了一种路由方法,将其框定为潘多拉盒子问题,通过决定何时投资于更好的模型选择估计来高效分配计算,展示了在诸如 MATH、RAG 和 EmbedLLM 等基准测试上的改进性能。
本文介绍了Skaling定律,这是一种广义的神经缩放定律,通过一个交互指数将模型容量和数据耦合,将预测误差降低1.5至3倍,并能在计算量约为均匀扫描十分之一的情况下实现全网格外推。
本文证明,在小规模Transformer模型上拟合的缩放定律能够准确预测在粒子物理喷注数据上训练的更大模型的损失,从而在大规模训练之前将计算预算转化为预期的物理性能。他们发布了五个预训练模型以及完整的训练方案。