@ProfTomYeh: Kimi 3 研讨会录像已上传 http://byhand.ai/v/kimi3 ~ Prof. Tom Yeh

X AI KOLs Timeline 事件

摘要

Prof. Tom Yeh 上传了关于 Kimi 3 的研讨会录像,特邀嘉宾 Nathan Lambert,讨论了 RLHF、模型架构和前沿 AI 主题。

Kimi 3 研讨会录像已上传 👉 https://t.co/hxfYtPg0X7 ~ Prof. Tom Yeh https://t.co/6CbTa3Wf5l
查看原文
查看缓存全文

缓存时间: 2026/08/22 07:22

Kimi 3 研讨会录像已上传 👉 https://t.co/hxfYtPg0X7

~ Tom Yeh 教授 https://t.co/6CbTa3Wf5l


Kimi 3 新研讨会录像

来源:https://www.byhand.ai/p/library-videos-seminars-2026-kimi-3-seminar-recording

资料库 (https://www.byhand.ai/p/library) › 2026年研讨会系列 (https://www.byhand.ai/p/library-series-videos-seminars-2026)

  1. DeepSeek 的流形约束超连接 (mHC) (2026年1月9日) (https://www.byhand.ai/p/manifold-constrained-hyper-connections)
  2. 小模型如何学习使用工具 (2026年1月11日) (https://www.byhand.ai/p/how-small-models-learn-tool-use)
  3. 生成式AI导论 (2026年1月11日) (https://www.byhand.ai/p/introduction-to-gen-ai)
  4. 从注意力到前沿:基础回顾 (2026年1月15日) (https://www.byhand.ai/p/seminar-foundation-attention-to-frontier)
  5. Google Ironwood TPU:从比特到HBM (2026年1月19日) (https://www.byhand.ai/p/google-ironwood-tpu-from-bits-to)
  6. 你必须知道的9个AI评估公式 (2026年1月24日) (https://www.byhand.ai/p/ai-eval-equations-you-must-know)
  7. Meta超级智能实验室 vs Facebook AI研究 (2026年1月30日) (https://www.byhand.ai/p/meta-superintelligence-labs-vs-facebook)
  8. Transformer:六层理解 (2026年2月13日) (https://www.byhand.ai/p/transformer-six-levels-of-understanding)
  9. OpenClaw研讨会 (2026年2月23日) (https://www.byhand.ai/p/openclaw-seminar)
  10. PPO → DPO → GRPO → 评分标准 (2026年3月2日) (https://www.byhand.ai/p/recording-ppo-dpo-grpo-rubrics)
  11. Gemma 4 (2026年5月7日) (https://www.byhand.ai/p/gemma-4-seminar-recording)
  12. Qwen 3.6 (2026年5月21日) (https://www.byhand.ai/p/qwen-3-6-seminar-recording)
  13. Kimi 3 (2026年8月6日)

感谢所有参加Kimi 3前沿AI研讨会的朋友们。

距离上次关于Qwen的研讨会已有一段时间了。很高兴能再次与许多朋友相聚,一起在Excel中手动学习前沿模型的数学原理和架构!

我们很荣幸请到了Nathan Lambert (https://x.com/natolambert) 作为特邀嘉宾,他是Interconnects (https://www.interconnects.ai/) 的作者,该网站发布了一些关于开源模型最权威的文章。Nathan也撰写了RLHF一书 (https://rlhfbook.com/),该书刚刚由Manning出版社 (https://www.manning.com/books/the-rlhf-book) 出版。

以下是我最喜欢的几个瞬间:

  • Nathan分享了他前往月之暗面(Moonshot AI)之旅的幕后故事。
  • Nathan著名的狗Phoebe意外在镜头前出镜。
  • 我终于有机会谈论线性Transformer系列的前沿模型进展。
  • 我在解释注意力机制时提到了勒布朗·詹姆斯。

感谢您的反馈!

在夏天之前,我确实计划谈论线性Transformer系列,并想以NVIDIA Nemotron为背景。然而,当Kimi 3发布时,我发现了一个更有力的故事线,我可以更深入地追踪从线性注意力、DeltaNet到最新的Kimi Delta Attention(KDA)的演进过程。

  1. 访谈与讨论 - Nathan Lambert - 月之暗面之旅 - 开源与闭源模型 - 观众问答
  2. 手动解析Kimi 3 - 注意力机制 - 二次注意力 - 推理与KV缓存 - 局部注意力 - 线性注意力 - DeltaNet - Kimi Delta Attention(KDA) - 卷积与门控 - 分块并行计算 - Seq2Seq LSTM

限时免费:完整录像和Excel工作簿目前对所有人开放。

⬇ Excel 工作簿 (https://library.byhand.ai/files/videos/seminars-2026/kimi-3-seminar-recording/Kimi3.xlsx)

关于本文的讨论

准备获取更多内容?

相似文章

Kimi K3 架构概述与笔记

Hacker News Top

Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。

Kimi-K3 在 HuggingFace 上发布

Reddit r/artificial

Moonshot AI 发布了 Kimi-K3,这是一个拥有 2.8 万亿参数的混合专家模型,支持 100 万 tokens 的上下文窗口。该模型已在 HuggingFace 上以具有商业限制的宽松许可证提供。

Kimi K3 如何通过工程创新跻身前沿 [R]

Reddit r/MachineLearning

Moonshot 推出的 Kimi K3 是一款开放权重的模型,在 580 个模型中排名第四。其创新包括 Kimi Delta Attention(减少 KV 缓存内存)、Quantile Balancing(专家负载均衡)以及 AgentENV(高效 RL 训练沙盒)。

Kimi K3 已上线 HF Viewer!

Reddit r/LocalLLaMA

Kimi K3 是一款新的人工智能模型,现已在 Hugging Face Viewer 上提供,方便访问和探索。