@TimDaugs: Kimi 的 CEO 有一条反对精巧架构的既定原则。杨植麟说过,实际的关键几乎从来不是新……

X AI KOLs Timeline 新闻

摘要

Kimi 的 CEO 杨植麟主张避免精巧架构,优先考虑规模化,例如 Moonshot 的 MuonClip 修复方案使得在 15.5 万亿 token 上稳定训练成为可能。

Kimi 的 CEO 有一条反对精巧架构的既定原则。 杨植麟曾说,实际的关键几乎从来不是新算法。 如果规模化能解决问题,那就用规模化解决。 新架构只有让规模化效果更好时才有价值,而不是因为它在纸上看起来更聪明。 这不是他为 Kimi 想出的口号。 他在卡内基梅隆大学读博期间,合著了 XLNet 论文,被引用超过一万次。 它从现有的 Transformer 架构中挖掘出更多潜力,而不是发明什么新奇的东西。 Moonshot 自身的技术选择也遵循同样的直觉。 MuonClip 并非一个新架构。 它是对一个已有优化器中特定不稳定性的针对性修复。 这一修复使他们在 15.5 万亿 token 上训练时没有出现一次损失尖峰。 没有跳线式架构,没有重新发明的核心。 真正的纪律不是构建精巧的东西。 而是察觉到什么时候精巧的东西从来都不是必要的。
查看原文
查看缓存全文

缓存时间: 2026/07/25 20:12

kimi的CEO有一条铁律:反对花哨的架构。

杨志林曾表示,实际有效的改进几乎从来不是新算法。

如果规模化能解决问题,那就用规模化解决。

新架构只有能让规模化更高效才有意义,而不是因为它在理论上看起来更聪明。

这不是他为kimi特意发明的口号。

他卡内基梅隆大学博士期间参与合著的XLNet论文被引用超过一万次。

该研究从现有Transformer配置中挖掘潜力,而非发明某个新奇结构。

月之暗面自身的技术选择也遵循同样的直觉。

MuonClip并非新架构。

它只是针对某个已有优化器中特定不稳定性的精准修复。

这一修复让他们在15.5万亿个token上训练,没有出现一次loss spike。

没有跳线架构。没有重新发明核心。

真正的纪律不是去构建聪明的东西。

而是意识到聪明的东西有时根本没必要。

Tim Daugs(@TimDaugs): kimi的CEO认为每个人工智能实验室(包括Claude)都在为错误的奖励优化。

英特尔的第一款商用芯片在70年代初发布,当时还没有人用得着它。

比尔·盖茨和保罗·艾伦看着摩尔定律,赌今天无用的芯片将成为整个行业的基础。

相似文章

稀疏设计(5分钟阅读)

TLDR AI

Moonshot的Kimi K3是一个2.8万亿参数的开源权重模型,拥有896个专家(每个token激活16个),体现了在保持活跃计算不变的情况下扩大总参数的趋势,并使用注意力压缩来减少KV缓存大小,使得前沿推理更容易实现,但存储成本较高。

@berryxia: Moonshot AI创始人杨植麟最近放出了一个40分钟视频。 这位92年生、清华计算机本科第一、CMU博士、Transformer-XL和XLNet共同作者,前Google Brain和Meta研究员,坐在镜头前平静拆解了Kimi K2…

X AI KOLs Timeline

Moonshot AI创始人杨植麟发布40分钟视频,详细拆解Kimi K2模型训练过程,仅花费460万美元,并在8模型编程大战中击败GPT-5.5等夺得第一,展现小团队通过架构优化颠覆传统堆算力模式。