@FinanceYF5: Kimi打赢美国模型的关键技术之一,源头或许是创始人杨植麟十年前写的博士论文。 他34岁,清华本科+CMU博士,读博期间在Meta AI和Google Brain都待过。那篇引超1万次的XLNet,脉络后来变成Kimi K2的万亿参数Mo…
摘要
文章指出Kimi击败美国模型的关键技术可能源于其创始人杨植麟十年前的博士论文,提到了XLNet与Kimi K2的万亿参数MoE架构的联系。
查看缓存全文
缓存时间: 2026/07/21 18:48
Kimi打赢美国模型的关键技术之一,源头或许是创始人杨植麟十年前写的博士论文。
他34岁,清华本科+CMU博士,读博期间在Meta AI和Google Brain都待过。那篇引超1万次的XLNet,脉络后来变成Kimi K2的万亿参数MoE架构。 https://t.co/QraSavtKQt
相似文章
@berryxia: Moonshot AI创始人杨植麟最近放出了一个40分钟视频。 这位92年生、清华计算机本科第一、CMU博士、Transformer-XL和XLNet共同作者,前Google Brain和Meta研究员,坐在镜头前平静拆解了Kimi K2…
Moonshot AI创始人杨植麟发布40分钟视频,详细拆解Kimi K2模型训练过程,仅花费460万美元,并在8模型编程大战中击败GPT-5.5等夺得第一,展现小团队通过架构优化颠覆传统堆算力模式。
@YRSM_Simon: 这是个大新闻! kimi 2.6 是生成级的模型了,在 LLM 能力溢出的年代,速度要成为竞争的胜负手了,芯片领域又要“板块轮动”了吗
Cerebras is now running Kimi K2.6, a trillion-parameter model, in enterprise trials at ~1,000 tokens/s, the fastest frontier model performance ever measured by Artificial Analysis.
Implementing Kimi K3 from scratch in PyTorch [P]
本文详细解析了Moonshot AI发布的Kimi K3模型(2.8万亿参数,100万token上下文)的架构,并展示了如何从零开始用PyTorch实现其七项核心创新,包括KDA循环注意力、门控MLA和稳定潜在MoE。
@interjc: 市场还是需要鲶鱼,不管你用不用 Kimi,反正各大厂的重置次数是多起来了
Kimi 发布 K3 模型,拥有 2.8 万亿参数、百万上下文窗口和原生多模态能力,通过 Kimi Delta Attention 和 Attention Residuals 技术提升推理速度和训练效率。
Kimi K2.7 Code:1万亿参数MoE,每百万token仅0.95美元,MIT许可证,MCP工具调用性能超越Opus 4.8
Moonshot AI 发布了专注于编程的开放式权重模型 Kimi K2.7 Code,拥有1万亿参数和384个专家,性能在MCP工具调用上超越Opus 4.8,成本仅为十分之一。