scaling-law

标签

Cards List
#scaling-law

人类语言中上下文持久性的标度律

arXiv cs.CL · 2天前 缓存

本文提出一个标度律,表明人类语言中词序的上下文影响随距离近似以1/d的速率衰减,该衰减通过大型语言模型测得的困惑度降低来衡量,且在不同语言和语料库中均成立。

0 人收藏 0 人点赞
#scaling-law

DomainPilot:基于领域级损失引导的两阶段数据混合优化,用于高效语言模型微调

arXiv cs.LG · 3天前 缓存

DomainPilot 提出了一种基于领域级损失引导的两阶段框架,用于大语言模型微调中的数据混合优化,在无需增加数据量或训练成本的情况下,在 MMLU-Redux、AIME24、LiveCodeBench v5 和 BFCL v3 上实现了性能提升。

0 人收藏 0 人点赞
#scaling-law

@DeFiMinty: 强化学习能否弥补弱预训练的不足?研究人员通过国际象棋谜题进行了测试,其中每个提议…

X AI KOLs Timeline · 2026-07-21 缓存

研究人员研究了强化学习(RL)与预训练质量之间的相互作用,表明预训练更强的模型从RL中获益更多,且RL无法完全弥补弱预训练的不足。还确定了预训练和后训练计算分配的联合缩放定律。

0 人收藏 0 人点赞
#scaling-law

Bielik 知道它不知道什么吗?激活分散性在模型规模上区分实体熟悉度与事实可靠性

arXiv cs.CL · 2026-07-09 缓存

本文研究了波兰 Bielik 大语言模型中的激活模式是否能在生成前检测到实体熟悉度,使用了无监督的分散度量,在模型规模上实现了已知实体与虚构实体的近乎完美分离,同时表明事实可靠性随规模急剧提升,但更难从激活中预测。

0 人收藏 0 人点赞
#scaling-law

@xiaogaifun: https://x.com/xiaogaifun/status/2073771786202939572

X AI KOLs Timeline · 2026-07-05 缓存

字节Seed团队发布了EdgeBench基准测试,允许AI模型连续工作12-72小时来评估长程任务中的学习能力,发现模型从环境学习的时间和性能之间遵循log-sigmoid曲线,存在新的Scaling Law。

0 人收藏 0 人点赞
#scaling-law

EdgeBench揭示新缩放定律:即时AI学习速度每三个月翻一番

Reddit r/singularity · 2026-07-02

EdgeBench揭示了一条新缩放定律,表明即时AI学习速度每三个月翻一番。

0 人收藏 0 人点赞
#scaling-law

数据驱动的机器学习无法达到符号级别的逻辑推理——缩放定律的极限

arXiv cs.AI · 2026-06-26 缓存

本文认为,包括GPT-5在内的数据驱动机器学习系统无法仅通过缩放达到符号级别的逻辑推理,原因在于它们在区分逻辑结构与统计规律方面存在固有局限性。

0 人收藏 0 人点赞
#scaling-law

@AYi_AInotes: 全网都在吹日本Fugu跑分超GPT,但我敢说99%的人没看懂它真正炸场的地方。 首先这玩意儿根本不是什么超大单体大模型, 它全身上下只有0.6B参数,本职工作就其实就是个AI项目经理, 简单任务自己处理,复杂任务自动拆分,从全球顶级模型池…

X AI KOLs Timeline · 2026-06-23 缓存

Sakana AI 发布 Fugu,一个仅 0.6B 参数的多智能体编排系统,通过智能任务拆分和模型协作达到前沿性能,绕开了传统的参数量扩增路径,标志着多智能体编排正式成为可用的生产力工具。

0 人收藏 0 人点赞
#scaling-law

@paulwalker99318: 晚点LateTask这篇访谈的信息量非常大,关于百度美研、Scaling Law、OpenAI、Anthropic、Cerebras的往事。 > "Dario 能进百度,其实是他职业生涯里很重要的一步。他是 Greg Diamos 招进来…

X AI KOLs Timeline · 2026-06-22 缓存

这是一条对晚点LateTask访谈的总结,回顾了百度美研在AI领域的早期布局,包括投资Cerebras、差点投资OpenAI和Anthropic,以及多位人才从百度流向这些公司等历史细节。

0 人收藏 0 人点赞
#scaling-law

@SaitoWu: 十年前百度美研一群人就预判:不能把 AI 算力全押在英伟达身上。结果他们真的投了一家「晶圆级」芯片公司 —Cerebras。 2016 年,周楠从投行跳去百度美国人工智能研究院。那时候吴恩达带队,预算充足,GPU 随便买。Dario(An…

X AI KOLs Timeline · 2026-06-17 缓存

文章回顾了百度美研十年前投资Cerebras晶圆级芯片公司的故事,分析了AI芯片市场从训练到推理的转变,以及非共识投资的重要性。

0 人收藏 0 人点赞
#scaling-law

权重范数确定Grokking时间尺度:一个因果延迟定律

arXiv cs.LG · 2026-06-15 缓存

本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。

0 人收藏 0 人点赞
#scaling-law

@gntalktalk: 这是最近ai开发领域最好的方法论:软件工程的scaling law --- Channel AI 创始人Luke Orthwine 提出了一种全新的思维范式:丢掉单线程线性思考的“象棋思维”,转向高并发、宏观调度、饱和攻击的“实时战略游戏…

X AI KOLs Timeline · 2026-06-14 缓存

Channel AI创始人Luke Orthwine提出一种新的软件开发方法论:将编程思维从传统的象棋式单线程线性思考,转向实时战略游戏(RTS)式的高并发、宏观调度和饱和攻击,以实现AI Agent时代的高效率开发。

0 人收藏 0 人点赞
#scaling-law

@snowboat84: https://x.com/snowboat84/status/2062686432335184321

X AI KOLs Timeline · 2026-06-05 缓存

这篇文章探讨了物理学与深度学习之间的深层联系,分析了Scaling Law、涌现等现象与物理学中临界标度律、相变等概念的同构性,并梳理了物理方法论在AI中的应用现状与前景。

0 人收藏 0 人点赞
#scaling-law

多智能体推理中的流式通信

Hugging Face Daily Papers · 2026-06-03 缓存

StreamMA 提出了一种用于多智能体推理的流式通信范式,通过管道化中间结果来降低延迟,并利用更可靠的早期步骤提升效果,在多个基准测试中优于基线方法,同时揭示了步骤级别的缩放定律。

0 人收藏 0 人点赞
#scaling-law

又一个‘DeepSeek时刻’?分析师称华为里程碑改变中国芯片竞赛轨迹

Reddit r/ArtificialInteligence · 2026-05-31 缓存

华为推出Tau缩放定律,这是一种绕过美国制裁的芯片架构变通方案,旨在到2031年实现相当于1.4纳米工艺的晶体管密度,标志着中国半导体自给自足迈出重要一步,并改变了与华盛顿的技术竞争格局。

0 人收藏 0 人点赞
#scaling-law

@snowboat84: 今天讨论点硬核的。一个问题:AI用到了什么程度的数学? 从工具和模型本身看,AI用到的数学平均年龄150岁,绝大部分是19世纪中叶之前就有的:矩阵乘法、梯度下降、链式求导、傅里叶、内积、概率,大都是本科前两年的内容。 但AI涌现出的一些现…

X AI KOLs Timeline · 2026-05-23 缓存

讨论AI用到的数学主要是19世纪之前的线性代数、微积分等,但涌现现象如Scaling Law、涌现能力、双下降、情境学习和表示几何缺乏数学解释,类比1900年物理学的乌云,认为可能推动21世纪数学发展。

0 人收藏 0 人点赞
#scaling-law

@jinchenma_ai: 看了张小珺那期访谈姚顺宇,4 个小时,干货密度很高。 他有个判断特别反主流。 很多人说预训练撞墙了、Scaling Law 到头了。他说没有,接下来几个月也看不到到头的迹象。 那为什么这么多人觉得撞墙?他直说:绝大多数喊撞墙的人,是自己代…

X AI KOLs Timeline · 2026-05-21 缓存

姚顺宇在访谈中提出反主流观点,认为预训练并未撞墙、Scaling Law也未到头,声称多数喊撞墙的人是因为代码中有bug。

0 人收藏 0 人点赞
#scaling-law

@Valley101_Qian: 恭喜Yuandong @tydsh ,在之前我们采访的尾声,他说的“新方向”今天官宣了:融资6.5亿、估值46.5亿美元的neolab Recursive_SI. 期待行业更多的research freedom与research tast…

X AI KOLs Timeline · 2026-05-14 缓存

田渊栋在Meta裁员后宣布新方向,融资6.5亿美元成立neolab Recursive_SI,估值46.5亿美元,并在采访中分享了关于AI趋势、LLM局限、强化学习和研究自由的见解。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈