@pallavishekhar_: 逐步学习LLM内部原理 - 从分词到注意力到推理优化 - BPE - 分词 - Tran…
摘要
一条推文,推广逐步学习LLM内部原理的资源,涵盖分词、注意力机制和优化技术。
逐步学习LLM内部原理 - 从分词到注意力机制再到推理优化
- BPE
- 分词
- Transformer架构
- 注意力背后的数学 - Q、K 和 V
- √dₖ缩放因子背后的数学
- 因果掩码
- KV缓存
- 分页注意力
- Flash注意力
- 专家混合
- 分组查询注意力
- RoPE
- RMSNorm
- LoRA
- 以及更多。
在此学习:
查看缓存全文
缓存时间: 2026/06/09 14:49
逐步学习LLM内部原理——从分词到注意力机制再到推理优化
- BPE
- Tokenization
- Transformer Architecture
- Math behind Attention - Q, K, and V
- Math behind √dk Scaling Factor
- Causal Masking
- KV Cache
- Paged Attention
- Flash Attention
- Mixture of Experts
- Grouped Query Attention
- RoPE
- RMSNorm
- LoRA
- 以及更多。
在此学习:
相似文章
大语言模型实际工作原理
深入剖析现代大语言模型的工作原理,涵盖从分词到下一个词预测的核心机制,无需复杂数学知识。
@divaagurlxw: 我花了几个月时间学习 LLM 推理。以下是我遇到过的最佳资源。1. 基础……
一条推文串分享了一份精心挑选的 LLM 推理学习资源清单,涵盖分词、GPU 硬件、量化与推测解码等优化技术,以及 vLLM 和 SGLang 等推理引擎,并附有 NVIDIA 架构师演讲的总结。
@TheAhmadOsman: 不可思议的资源 从第一性原理理解LLM的最完整指南现已可在网上阅读…
一份全面的免费指南,从第一性原理解释LLM,涵盖令牌、Transformer、注意力机制、微调和本地部署。
@CamilleRoux: 对LLMs内部工作原理的精彩解释:tokens、embeddings、positional encoding、attention、feed-forward…
这条推文分享了一篇关于LLMs内部工作原理的详尽解释,涵盖了tokens、embeddings、positional encoding、attention和feed-forward网络,来源于0xkato的一篇博文。
大型语言模型是如何工作的(26分钟阅读)
详细讲解基于Transformer的大型语言模型的工作原理,涵盖分词、嵌入、注意力机制和下一个词元预测,无需复杂数学。