scaling-laws

标签

Cards List
#scaling-laws

@rosinality: https://arxiv.org/abs/2606.29858 为什么会出现幂律缩放?单个token的损失遵循S形曲线,……

X AI KOLs Timeline · 2026-06-30 缓存

本文提出了一个token级别的框架,表明语言模型损失中的幂律缩放来源于单个token的S形学习曲线的聚合,并证明根据token学习时间重塑训练分布可以将验证损失降低11%。

0 人收藏 0 人点赞
#scaling-laws

Lean软件规模定律(阅读时间17分钟)

TLDR AI · 2026-06-29 缓存

该研究提案探讨了不同编程语言中代码库大小如何影响编码LLM的困惑度,并以Lean作为形式语言的测试案例。它表明Lean可能具有更优的缩放指数,从而使大规模软件更安全、更可靠。

0 人收藏 0 人点赞
#scaling-laws

Moneyball for Physical AI(26分钟阅读)

TLDR AI · 2026-06-29 缓存

本文应用《Moneyball》的理念于Physical AI,指出行业过度重视原始数据量和远程操作时长,而低估了数据的新颖性和边际效用。文章提供了一个数据定价框架,并推荐了机器人领域资本效率的策略。

0 人收藏 0 人点赞
#scaling-laws

@geoffreyhinton:我刚看了一场Adam Brown关于AI对物理学未来影响的精彩讲座

X AI KOLs Following · 2026-06-28 缓存

Geoffrey Hinton强调Adam Brown的讲座,讲述了LLMs在物理学上从学前水平进步到博士水平的能力,扩展定律和基准测试显示其快速进展。

0 人收藏 0 人点赞
#scaling-laws

@NielsRogge:刚刚在 Papers with Code 的 Scaling Laws 方法中添加了 Lilian Weng 的博客作为推荐读物

X AI KOLs Timeline · 2026-06-26 缓存

Niels Rogge 在 Papers with Code 上添加了 Lilian Weng 关于扩展定律的博客作为推荐读物,并附上了原始论文及引用链接。

0 人收藏 0 人点赞
#scaling-laws

草图线性对比学习:近似、优化与统计缩放

arXiv cs.LG · 2026-06-26 缓存

本文推导了在高斯潜变量模型下的草图线性对比学习的缩放定律,分析了风险如何分解为近似项、优化项和统计项,并为对比学习中平衡模型规模、数据和计算提供了理论指导。

0 人收藏 0 人点赞
#scaling-laws

扩展定律,谨慎解读(25分钟阅读)

TLDR AI · 2026-06-26 缓存

全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。

0 人收藏 0 人点赞
#scaling-laws

@latentspacepod: 在本期节目中,@OpenAI 首席研究官 @markchen90 与 @allenpark 一起制作火焰虾、煮韩式炖菜,并聊……

X AI KOLs Following · 2026-06-25 缓存

Latent Space 播客邀请 OpenAI 首席研究官 Mark Chen,在烹饪过程中讨论扩展定律、预训练、评估危机以及 OpenAI 的研究路线图。

0 人收藏 0 人点赞
#scaling-laws

@lilianweng: 一篇超级迟到的(3年以上?)关于扩展定律的帖子。计算很昂贵。扩展定律是一种帮助我们推理…

X AI KOLs Timeline · 2026-06-25 缓存

Lilian Weng的博客文章全面概述了深度学习中的扩展定律,涵盖了它们的推导、计算最优分配以及Kaplan等人与Chinchilla之间的争论。

0 人收藏 0 人点赞
#scaling-laws

内部数据重复破坏语言模型

arXiv cs.LG · 2026-06-25 缓存

本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。

0 人收藏 0 人点赞
#scaling-laws

@Suhail:每当我获得更多算力,我就发现可以用更多算力去做其他新的事情。

X AI KOLs Following · 2026-06-25

个人感悟:获取更多算力只会暴露对算力的进一步需求,反映了人工智能和科技领域中永不满足的需求。

0 人收藏 0 人点赞
#scaling-laws

论大型语言模型缩放指数的微小性

arXiv cs.AI · 2026-06-24 缓存

本文讨论了大型语言模型的小缩放指数,认为它们在能源资源方面指示了一种不可持续的状态。还探讨了'pedestal effect',并类比流体湍流以评论数据的平滑性。

0 人收藏 0 人点赞
#scaling-laws

量化RAG系统中的先验主导性

arXiv cs.CL · 2026-06-24 缓存

本文介绍了归一化上下文利用(NCU)指标,用于量化RAG系统中上下文信息的增益。该指标挑战了规模定律,表明在严格的事实提取中,小语言模型由于较低的“先验主导性”可以与更大模型匹敌甚至更优,并且一个商业API在对抗性设置中经常覆盖外部证据。

0 人收藏 0 人点赞
#scaling-laws

The data black hole at the center of AI

Reddit r/artificial · 2026-06-21 缓存

本文深入分析了AI的样本效率远低于人类的问题,指出前沿模型需要海量领域特定数据,而人类仅需少量示例即可学习,这种数据黑洞是当前AI发展的核心瓶颈。文章通过多个比较(标记量、机器人操控、驾驶)和反驳常见反对意见,论证了这一差距的严峻性,并探讨了对AI自动化目标的影响。

0 人收藏 0 人点赞
#scaling-laws

机器人团队正在从头重建数据栈

Hacker News Top · 2026-06-21 缓存

机器人团队正在从头重建数据栈,以克服“数据层税”对机器人学习迭代和扩展的拖累,因为现有基础设施无法处理多速率和多模态数据。

0 人收藏 0 人点赞
#scaling-laws

@seclink: https://x.com/seclink/status/2067968283492712846

X AI KOLs Following · 2026-06-19 缓存

本文基于研究者Victoria Lin的分享,系统梳理了原生多模态大模型的主流技术路线(Chameleon、Transfusion、MOT)及其优缺点,指出多模态AI仍处于早期探索阶段,存在缩放定律空白、图像理解与生成编码不统一、与物理世界对接等开放问题。

0 人收藏 0 人点赞
#scaling-laws

神经元群体随规模变化展现分歧的选择性 [R]

Reddit r/MachineLearning · 2026-06-18

本文介绍了'Rosetta Neurons'——跨越不同神经网络的通用神经元——并展示它们以亚线性幂律缩放,随着规模增大变得更具选择性和单义性,从而实现几乎与oracle性能相匹配的数据过滤。

0 人收藏 0 人点赞
#scaling-laws

@ryanlpeterman: Vlad Feinberg (@FeinbergVlad) 是 Google DeepMind 的预训练领域负责人,我向他请教了如何在前沿 AI 实验室找到工作……

X AI KOLs Timeline · 2026-06-15 缓存

采访 Google DeepMind 预训练领域负责人 Vlad Feinberg,探讨如何在前沿 AI 实验室(如 Google DeepMind、Anthropic 或 OpenAI)找到工作,涵盖所需技能、研究 vs 工程的区别以及扩展定律。

0 人收藏 0 人点赞
#scaling-laws

超越困惑度:面向字节感知语言模型中的UTF-8有效性

arXiv cs.CL · 2026-06-15 缓存

本文研究了字节级语言模型中训练规模与UTF-8生成可靠性之间的关系,发现UTF-8有效性收敛的速度比困惑度大约慢一倍。作者引入了用于隔离结构有效性的评估协议,并表明可靠的UTF-8生成是一种需要单独评估的独特能力。

0 人收藏 0 人点赞
#scaling-laws

@iamtrask: 这比看起来要*厉害得多*... 前沿AI公司将*再也*无法拥有前沿,我没开玩笑...……

X AI KOLs Following · 2026-06-14 缓存

OpenRouter 推出 Fusion API,这是一种复合模型,通过结合多个AI模型,以一半的价格实现神话般的智能,可能改变AI性能的前沿。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈