标签
本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。
本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。
这篇观点文章认为,由于严格的数学约束,生成模型的概率性扩展不足以用于量子电路生成,并提出了集成形式化方法的验证感知架构。
这项研究探讨了不同数据域在预训练期间的互动方式,发现加入代码可以提高数学性能,而某些组合则会相互影响,并提出将数据协同纳入缩放定律。
UltraX 提出了一种面向大规模预训练数据的函数调用式优化框架,在删除和修改之外引入插入操作,补全了编辑函数空间,从而实现细粒度的实例级编辑。该框架构建了可靠的程序监督生成流水线,在从头训练 1B 模型时,展示了更优的数据效率和模型性能。
本文分析了深度强化学习中的评估与设计范式,揭示了性能排名在不同数据范围下并非单调递增,且常见的低数据范围基准可能导致错误结论。
本文分析了深度强化学习中的评估与设计范式,展示了经典范式可能导致错误结论,并提供了关于扩展性、容量和复杂性的见解。
Christopher Potts宣布了一篇由Jing Huang和EkdeepL撰写的新论文,该论文研究了为什么更大规模的模型性能优于较小模型,并将其归因于数据导致的神经元竞争。论文将在7月10日的ICML HiLD研讨会上发表。
介绍OpenDDE,一个开源的全原子生物分子基础模型,该模型利用共折叠作为药物发现的共享结构推理层,实现了高精度,并识别出用于进一步改进的缩放定律。
文章认为,AI扩展正触及数据极限,需要类似计算项目的文明规模数据投入,并预测到2030年数据支出将超过每年1000亿美元。
EdgeBench分析了跨越134个任务的38000小时真实世界智能体交互,揭示了性能的对数S形缩放定律以及指数级学习速度提升。该论文引入了一个基准测试套件,用于研究智能体如何从真实世界经验中学习。
一项新研究量化了语言模型预训练中重复数据造成的损害,表明即使是激进的去重也会留下有害的重复,可能浪费多达三分之一的算力 FLOPs。
原始LLM缩放定律中的一个错误导致计算浪费在过大且训练不足的模型上,作者分享了这一发现。
@goyalayus 的一条推文指出,四本未指定的书籍足以学习任何领域,随后引用 Praveen Kumar Verma 的建议,按特定顺序阅读基础 LLM 论文,包括《Attention Is All You Need》、BERT、GPT、GPT-2、Scaling Laws 和 GPT-3。
本文在合成数据扩展中区分了固定源合成(FSS)与源扩展,提出了一种修正的缩放定律,能够从低预算拟合预测高预算下的性能。实验结果表明,FSS 是有界的,并且在大规模下,增加种子问题比增加回答预算表现更好。
提出了一种三项缩放定律,将模型大小、训练步数和批次大小解耦,使得用更少的运行次数即可进行稳健拟合,并推导出次优批次大小的缩放定律。
作者认为,尽管当前AI的扩展方法是工程的巅峰,但其效率极其低下,未来会被视为原始,就像我们现在看待1960年代的大型主机一样。
本文分析了不同的AI性能指标(有界 vs 无界)如何决定前沿AI能力是仍集中在富裕行为者手中,还是扩散到较小的模型,这对监管具有重要意义。