@TimDaugs: Kimi 的 CEO 有一条反对精巧架构的既定原则。杨植麟说过,实际的关键几乎从来不是新……
摘要
Kimi 的 CEO 杨植麟主张避免精巧架构,优先考虑规模化,例如 Moonshot 的 MuonClip 修复方案使得在 15.5 万亿 token 上稳定训练成为可能。
查看缓存全文
缓存时间: 2026/07/25 20:12
kimi的CEO有一条铁律:反对花哨的架构。
杨志林曾表示,实际有效的改进几乎从来不是新算法。
如果规模化能解决问题,那就用规模化解决。
新架构只有能让规模化更高效才有意义,而不是因为它在理论上看起来更聪明。
这不是他为kimi特意发明的口号。
他卡内基梅隆大学博士期间参与合著的XLNet论文被引用超过一万次。
该研究从现有Transformer配置中挖掘潜力,而非发明某个新奇结构。
月之暗面自身的技术选择也遵循同样的直觉。
MuonClip并非新架构。
它只是针对某个已有优化器中特定不稳定性的精准修复。
这一修复让他们在15.5万亿个token上训练,没有出现一次loss spike。
没有跳线架构。没有重新发明核心。
真正的纪律不是去构建聪明的东西。
而是意识到聪明的东西有时根本没必要。
Tim Daugs(@TimDaugs): kimi的CEO认为每个人工智能实验室(包括Claude)都在为错误的奖励优化。
英特尔的第一款商用芯片在70年代初发布,当时还没有人用得着它。
比尔·盖茨和保罗·艾伦看着摩尔定律,赌今天无用的芯片将成为整个行业的基础。
相似文章
@0xF1ction: Kimi CEO杨植麟:"每个AI实验室,比如Claude,都认为模型最重要。错了。关键在于你如何组…
Kimi CEO杨植麟认为,组织结构比AI模型本身更为关键,他以英特尔的历史作类比,并强调长上下文的规模化是一个关键优势。
稀疏设计(5分钟阅读)
Moonshot的Kimi K3是一个2.8万亿参数的开源权重模型,拥有896个专家(每个token激活16个),体现了在保持活跃计算不变的情况下扩大总参数的趋势,并使用注意力压缩来减少KV缓存大小,使得前沿推理更容易实现,但存储成本较高。
@gnotuy:我们开源了 Kimi K2.6,测试时计算的下一个前沿不是更大的模型,而是更优的智能组织……
Moonshot AI 开源 Kimi K2.6,并指出测试时计算的下一个前沿在于更优的智能组织,而非单纯堆砌更大的模型。
@zhang_benita: https://x.com/zhang_benita/status/2078716535548600458
本文采访了Moonshot AI创始人杨植麟,讨论了构建基础模型和AI助手Kimi的挑战与愿景,并反思了过去一年的发展。
@berryxia: Moonshot AI创始人杨植麟最近放出了一个40分钟视频。 这位92年生、清华计算机本科第一、CMU博士、Transformer-XL和XLNet共同作者,前Google Brain和Meta研究员,坐在镜头前平静拆解了Kimi K2…
Moonshot AI创始人杨植麟发布40分钟视频,详细拆解Kimi K2模型训练过程,仅花费460万美元,并在8模型编程大战中击败GPT-5.5等夺得第一,展现小团队通过架构优化颠覆传统堆算力模式。