@ChrisGPotts: Jing 将在7月10日的ICML HiLD研讨会上首次展示这篇论文。为了支持,我制作了这首音乐视频……
摘要
Christopher Potts宣布了一篇由Jing Huang和EkdeepL撰写的新论文,该论文研究了为什么更大规模的模型性能优于较小模型,并将其归因于数据导致的神经元竞争。论文将在7月10日的ICML HiLD研讨会上发表。
查看缓存全文
缓存时间: 2026/07/08 02:25
Jing将于7月10日在ICML HiLD研讨会上首次展示这篇论文。为表支持,我为此论文制作了一段音乐视频,歌词由我原创,讲述了完整的故事:https://t.co/UXJyvtfBdn
Christopher Potts (@ChrisGPotts): 我们理所当然地认为更大的模型比小的更好,但为什么会这样?由Jing Huang与@EkdeepL领导的新论文,通过形式化分析、理想化任务以及真实预训练,将其归因于数据引起的资源(神经元)竞争。
相似文章
@ChrisGPotts:我们理所当然地认为更大的模型比小的更好,但为什么会这样?我们的新论文,由Jing Hua领导……
本文探讨了为什么更大的模型性能优于较小的模型,通过形式化分析和实验将其归因于数据引发的神经资源竞争。
@notsurajgaud: 7月31日:今日研究论文。一个更小的模型能否比大100倍的模型更受青睐?可以,当后训练教会它遵循人类意图时……
一篇作为“今日论文”分享的研究论文认为,当后训练教会模型遵循人类意图时,一个更小的模型可能比大100倍的模型更受青睐。
@heyrobinai: 整个AI行业刚刚被羞辱了——一个仅用单张显卡训练几小时的微型模型正在规划...
Yann LeCun的团队发布了LeWorldModel,一个仅有1500万参数的物理模型,在单张GPU上训练数小时,在规划速度和物理合理性上超越了价值数十亿美元的基础模型,挑战了主流的规模扩展范式。
@AnimaAnandkumar: 祝贺!
彭瑞韩(Pengrui Han)的论文在ICML理论与基准结合研讨会(ICML Combining Theory and Benchmarks Workshop)上获得最佳论文奖,Anima Anandkumar表示祝贺。
@natashajaques:非常喜欢阅读微软MAI-Thinking-1的《Building a Hill Climbing Machine》论文。令人惊讶的是他们公开了……
Natasha Jaques赞扬微软MAI-Thinking-1论文完全公开了前沿模型的训练方法,重点指出预训练、中期训练和RL后训练阶段的token分布,并提到Yann LeCun的蛋糕比喻很有先见之明。