@ProfTomYeh: Kimi 3 研讨会录像已上传 http://byhand.ai/v/kimi3 ~ Prof. Tom Yeh
摘要
Prof. Tom Yeh 上传了关于 Kimi 3 的研讨会录像,特邀嘉宾 Nathan Lambert,讨论了 RLHF、模型架构和前沿 AI 主题。
查看缓存全文
缓存时间: 2026/08/22 07:22
Kimi 3 研讨会录像已上传 👉 https://t.co/hxfYtPg0X7
~ Tom Yeh 教授 https://t.co/6CbTa3Wf5l
Kimi 3 新研讨会录像
来源:https://www.byhand.ai/p/library-videos-seminars-2026-kimi-3-seminar-recording
资料库 (https://www.byhand.ai/p/library) › 2026年研讨会系列 (https://www.byhand.ai/p/library-series-videos-seminars-2026)
- DeepSeek 的流形约束超连接 (mHC) (2026年1月9日) (https://www.byhand.ai/p/manifold-constrained-hyper-connections)
- 小模型如何学习使用工具 (2026年1月11日) (https://www.byhand.ai/p/how-small-models-learn-tool-use)
- 生成式AI导论 (2026年1月11日) (https://www.byhand.ai/p/introduction-to-gen-ai)
- 从注意力到前沿:基础回顾 (2026年1月15日) (https://www.byhand.ai/p/seminar-foundation-attention-to-frontier)
- Google Ironwood TPU:从比特到HBM (2026年1月19日) (https://www.byhand.ai/p/google-ironwood-tpu-from-bits-to)
- 你必须知道的9个AI评估公式 (2026年1月24日) (https://www.byhand.ai/p/ai-eval-equations-you-must-know)
- Meta超级智能实验室 vs Facebook AI研究 (2026年1月30日) (https://www.byhand.ai/p/meta-superintelligence-labs-vs-facebook)
- Transformer:六层理解 (2026年2月13日) (https://www.byhand.ai/p/transformer-six-levels-of-understanding)
- OpenClaw研讨会 (2026年2月23日) (https://www.byhand.ai/p/openclaw-seminar)
- PPO → DPO → GRPO → 评分标准 (2026年3月2日) (https://www.byhand.ai/p/recording-ppo-dpo-grpo-rubrics)
- Gemma 4 (2026年5月7日) (https://www.byhand.ai/p/gemma-4-seminar-recording)
- Qwen 3.6 (2026年5月21日) (https://www.byhand.ai/p/qwen-3-6-seminar-recording)
- Kimi 3 (2026年8月6日)
距离上次关于Qwen的研讨会已有一段时间了。很高兴能再次与许多朋友相聚,一起在Excel中手动学习前沿模型的数学原理和架构!
我们很荣幸请到了Nathan Lambert (https://x.com/natolambert) 作为特邀嘉宾,他是Interconnects (https://www.interconnects.ai/) 的作者,该网站发布了一些关于开源模型最权威的文章。Nathan也撰写了RLHF一书 (https://rlhfbook.com/),该书刚刚由Manning出版社 (https://www.manning.com/books/the-rlhf-book) 出版。
- Nathan分享了他前往月之暗面(Moonshot AI)之旅的幕后故事。
- Nathan著名的狗Phoebe意外在镜头前出镜。
- 我终于有机会谈论线性Transformer系列的前沿模型进展。
- 我在解释注意力机制时提到了勒布朗·詹姆斯。
感谢您的反馈!
在夏天之前,我确实计划谈论线性Transformer系列,并想以NVIDIA Nemotron为背景。然而,当Kimi 3发布时,我发现了一个更有力的故事线,我可以更深入地追踪从线性注意力、DeltaNet到最新的Kimi Delta Attention(KDA)的演进过程。
- 访谈与讨论 - Nathan Lambert - 月之暗面之旅 - 开源与闭源模型 - 观众问答
- 手动解析Kimi 3 - 注意力机制 - 二次注意力 - 推理与KV缓存 - 局部注意力 - 线性注意力 - DeltaNet - Kimi Delta Attention(KDA) - 卷积与门控 - 分块并行计算 - Seq2Seq LSTM
限时免费:完整录像和Excel工作簿目前对所有人开放。
⬇ Excel 工作簿 (https://library.byhand.ai/files/videos/seminars-2026/kimi-3-seminar-recording/Kimi3.xlsx)
关于本文的讨论
准备获取更多内容?
相似文章
Kimi K3 架构概述与笔记
Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。
Kimi-K3 在 HuggingFace 上发布
Moonshot AI 发布了 Kimi-K3,这是一个拥有 2.8 万亿参数的混合专家模型,支持 100 万 tokens 的上下文窗口。该模型已在 HuggingFace 上以具有商业限制的宽松许可证提供。
关于Kimi K3:其能力与相关不满(70分钟阅读)
Kimi K3是Moonshot AI推出的2.8T参数开放模型,基准测试表现强劲,但可能过度优化,且落后顶级闭源模型数月。它从Claude蒸馏而来,其发布可能先于IPO。
Kimi K3 如何通过工程创新跻身前沿 [R]
Moonshot 推出的 Kimi K3 是一款开放权重的模型,在 580 个模型中排名第四。其创新包括 Kimi Delta Attention(减少 KV 缓存内存)、Quantile Balancing(专家负载均衡)以及 AgentENV(高效 RL 训练沙盒)。
Kimi K3 已上线 HF Viewer!
Kimi K3 是一款新的人工智能模型,现已在 Hugging Face Viewer 上提供,方便访问和探索。