@jaminball: 我很喜欢参加专注于研究的会议,这周的@CAISconf非常棒!了解前沿进展令人着迷……

X AI KOLs Following 事件

摘要

Percy Liang 讨论了如何使用适度的算力训练开放前沿模型,强调算法效率和缩放配方,并主张超越开放权重的开放开发。

我很喜欢参加专注于研究的会议,这周的@CAISconf非常棒!了解前沿动态令人着迷。昨天@percyliang 就如何用适度的算力训练开放前沿模型并将其作为真正的科学进行了精彩演讲。几点收获:准确率 = 算法效率 × 资源。作为研究人员,你不需要最好的模型,你需要证明你的效率更高。算法进步是真实存在的:LM 效率大约每 8 个月将计算量减半。早期的 Marin“YOLO 运行”让我们得以一窥内部:学习率退火并观察训练损失上升(通过 z-loss 解决)、模型永远无法恢复的糟糕损失尖峰(添加了 QK-norm),以及在冷却阶段出现的神秘损失跳跃(最终追溯到糟糕的随机数生成器未打乱数据)。虽然技术性较强,但能了解这些内部细节非常酷!这些可不是你在论文中能读到的。真正的转变:不再调整单次运行,而是调整缩放配方。一个缩放配方是从计算量到完整训练配置的参数化映射:给定计算预算,它会告诉你参数数量、token 数量、学习率、批大小、深度等。所以不再是问“这个模型的超参数是什么”,而是问“在任何规模下选择超参数的规则是什么”,然后在此基础上拟合缩放定律。正如 Percy 所说:“缩放定律不会自动发生。你必须把它们创造出来。”可预测性是科学的衡量标准:在 GitHub 上预先登记预测的损失,然后验证。他们在拟合的 300 倍 FLOPs 规模上实现了约 0.005 的损失精度——在 MoE 上同样如此,约 0.02,没有尖峰。开放开发 > 开放权重。一个真正的谱系:封闭(仅 API)→ 开放权重(Llama、DeepSeek)→ 开源(OLMo、Nemotron)→ 开放开发(Marin)。大多数“开放”模型只是把权重交给你。Marin/OpenAthena 展示整个流程:权重、代码、数据配方,以及实时研究本身,任何人都可以像给 Linux 提交 PR 一样提交实验。一个我喜欢的类比:今天的人工智能就像 1999 年的软件。那时的开源并不明显会赢,但最终成为一切建设的基础。Percy 认为真正的开放模型会遵循同样的轨迹,成为研究和业务的基础设施,我希望他是对的!我们迫切需要有更强大的开源(真正开源)模型。
查看原文

相似文章

@PyTorch: Live from Shanghai, @sparkycollier delivers his keynote, “Building Frontier Intelligence in the Open,” at PyTorch Confe…

X AI KOLs Following

Live from Shanghai, @sparkycollier delivers his keynote, “Building Frontier Intelligence in the Open,” at PyTorch Conference China 2026. Mark focuses on how PyTorch supports an open ecosystem where researchers, developers, model builders, and hardware companies can build and optimize AI across a growing range of models and compute. From open models to new accelerator architectures, Mark is exploring how open development expands who can build AI, helps breakthroughs move from experimentation to p