标签
Berkeley 189 lecture provides a clear explanation of the attention mechanism, tracing the evolution from RNN+attention to Transformer and contrasting MLP/CNN parameter efficiency.
一条推文推荐了一系列关于LLM基础的解析文章,尤其是《Vectors are all you need》,并将其添加到顶级学习资源列表中。
一条推特串解释了七个必备的AI术语(如LLM、tokens等),面向创作者和创始人,旨在为2026年提供实用的词汇。
清晰解释标准RAG、Graph RAG和Agentic RAG,涵盖它们的区别、用例以及如何处理单跳与多跳查询。
将Transformer中的注意力机制解释为一种查找操作:每个token构建查询,与键进行比较,并检索加权的值向量,附带视频覆盖完整流程。
Nous Research 的 Hermes Agent 引入了 Mixture of Agents (MoA),允许用户定义预设,将多个模型用于咨询,并由一个最终回答模型整合,通过覆盖盲点来提升性能。该功能无缝集成到现有的智能体循环中,保留了工具、记忆和上下文。
一条推文解释了Transformer模型中注意力机制的核心公式:Q × Kᵀ 计算相关性,Softmax 将其转换为概率,V 提供内容,构成了现代AI的基础。
这条推文分享了一篇关于LLMs内部工作原理的详尽解释,涵盖了tokens、embeddings、positional encoding、attention和feed-forward网络,来源于0xkato的一篇博文。
对8种主要AI模型架构的可视化解析,包括LLM、VLM、MoE、SLM等,外加来自MIT的递归语言模型的额外介绍。
一篇关于现代深度学习的详细个人综述,聚焦于基础模型、视觉语言模型及其架构决策,面向那些希望获得直觉而非密集数学的读者。
本文提供了大型语言模型中Transformer架构的可视化指南,涵盖自注意力、因果自注意力、掩码多头注意力以及输出层,并附有逐步解释和示例。
详细讲解基于Transformer的大型语言模型的工作原理,涵盖分词、嵌入、注意力机制和下一个词元预测,无需复杂数学。
技术探索 ANSI 转义码,追溯其 1970 年代终端起源,并探讨其在现代 CLI 工具和终端 UI 中的持久相关性。
本文基于SGLang Omni团队的内部决策文章,从自回归解码、KV缓存、连续批处理等基础概念出发,深入浅出地介绍了LLM推理系统的运作原理。
一份来自TechCrunch的术语表,定义了AGI、AI智能体、API端点和思维链等常见AI术语,并随着领域发展定期更新。
KV cache 在自回归生成过程中存储先前计算的键向量和值向量,使模型能够避免在每一步重新计算整个序列,从而显著加速推理,但代价是内存使用增加。
Google DeepMind 芯片工程师 Reiner Pope 在一段免费 YouTube 视频中,通过白板全面讲解了芯片的工作原理,从逻辑门到脉动阵列乃至人脑。