标签
本文提出了一个token级别的框架,表明语言模型损失中的幂律缩放来源于单个token的S形学习曲线的聚合,并证明根据token学习时间重塑训练分布可以将验证损失降低11%。
该研究提案探讨了不同编程语言中代码库大小如何影响编码LLM的困惑度,并以Lean作为形式语言的测试案例。它表明Lean可能具有更优的缩放指数,从而使大规模软件更安全、更可靠。
本文应用《Moneyball》的理念于Physical AI,指出行业过度重视原始数据量和远程操作时长,而低估了数据的新颖性和边际效用。文章提供了一个数据定价框架,并推荐了机器人领域资本效率的策略。
Geoffrey Hinton强调Adam Brown的讲座,讲述了LLMs在物理学上从学前水平进步到博士水平的能力,扩展定律和基准测试显示其快速进展。
Niels Rogge 在 Papers with Code 上添加了 Lilian Weng 关于扩展定律的博客作为推荐读物,并附上了原始论文及引用链接。
本文推导了在高斯潜变量模型下的草图线性对比学习的缩放定律,分析了风险如何分解为近似项、优化项和统计项,并为对比学习中平衡模型规模、数据和计算提供了理论指导。
Latent Space 播客邀请 OpenAI 首席研究官 Mark Chen,在烹饪过程中讨论扩展定律、预训练、评估危机以及 OpenAI 的研究路线图。
Lilian Weng的博客文章全面概述了深度学习中的扩展定律,涵盖了它们的推导、计算最优分配以及Kaplan等人与Chinchilla之间的争论。
本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。
个人感悟:获取更多算力只会暴露对算力的进一步需求,反映了人工智能和科技领域中永不满足的需求。
本文讨论了大型语言模型的小缩放指数,认为它们在能源资源方面指示了一种不可持续的状态。还探讨了'pedestal effect',并类比流体湍流以评论数据的平滑性。
本文介绍了归一化上下文利用(NCU)指标,用于量化RAG系统中上下文信息的增益。该指标挑战了规模定律,表明在严格的事实提取中,小语言模型由于较低的“先验主导性”可以与更大模型匹敌甚至更优,并且一个商业API在对抗性设置中经常覆盖外部证据。
本文深入分析了AI的样本效率远低于人类的问题,指出前沿模型需要海量领域特定数据,而人类仅需少量示例即可学习,这种数据黑洞是当前AI发展的核心瓶颈。文章通过多个比较(标记量、机器人操控、驾驶)和反驳常见反对意见,论证了这一差距的严峻性,并探讨了对AI自动化目标的影响。
机器人团队正在从头重建数据栈,以克服“数据层税”对机器人学习迭代和扩展的拖累,因为现有基础设施无法处理多速率和多模态数据。
本文基于研究者Victoria Lin的分享,系统梳理了原生多模态大模型的主流技术路线(Chameleon、Transfusion、MOT)及其优缺点,指出多模态AI仍处于早期探索阶段,存在缩放定律空白、图像理解与生成编码不统一、与物理世界对接等开放问题。
本文介绍了'Rosetta Neurons'——跨越不同神经网络的通用神经元——并展示它们以亚线性幂律缩放,随着规模增大变得更具选择性和单义性,从而实现几乎与oracle性能相匹配的数据过滤。
采访 Google DeepMind 预训练领域负责人 Vlad Feinberg,探讨如何在前沿 AI 实验室(如 Google DeepMind、Anthropic 或 OpenAI)找到工作,涵盖所需技能、研究 vs 工程的区别以及扩展定律。
本文研究了字节级语言模型中训练规模与UTF-8生成可靠性之间的关系,发现UTF-8有效性收敛的速度比困惑度大约慢一倍。作者引入了用于隔离结构有效性的评估协议,并表明可靠的UTF-8生成是一种需要单独评估的独特能力。
OpenRouter 推出 Fusion API,这是一种复合模型,通过结合多个AI模型,以一半的价格实现神话般的智能,可能改变AI性能的前沿。