@_avichawla:8种AI模型架构的视觉解析:人们往往把LLM视作整个领域,但它们只是其中一员……
摘要
对8种主要AI模型架构的可视化解析,包括LLM、VLM、MoE、SLM等,外加来自MIT的递归语言模型的额外介绍。
查看缓存全文
缓存时间: 2026/06/09 10:44
8种AI模型架构,可视化解读:
人们往往把大语言模型当成整个AI领域的全部。但它们只是众多模型家族中的一支,每种模型都由不同的输入、输出或约束条件塑造而成。
以下是详细拆解:
- 大语言模型(LLM)
文本输入,被token化后转为嵌入向量,经过Transformer处理,再输出文本。
↳ GPT、Claude、Gemini、Llama
- 大概念模型(LCM)
在概念层面而非token层面工作。输入被切分为句子,通过SONAR嵌入,然后使用扩散模型进行输出。
↳ Meta的LCM是先行者
- 大动作模型(LAM)
将意图转化为行动。输入经过感知、意图识别、任务拆解,再结合记忆进行动作规划后执行。
↳ Rabbit R1、Microsoft UFO、Claude Computer Use
- 混合专家模型(MoE)
一个路由器决定哪些专门的“专家”处理你的查询。只有相关的专家被激活,结果经过选择和加工。
↳ Mixtral、GPT-4、DeepSeek
- 视觉语言模型(VLM)
图像经过视觉编码器,文本经过文本编码器。两者在多模态处理器中融合,然后由语言模型生成输出。
↳ GPT-4V、Gemini Pro Vision、LLaVA
- 小语言模型(SLM)
针对边缘设备优化的大语言模型,采用紧凑的token化、高效的Transformer和量化技术,实现本地部署。
↳ Phi-3、Gemma、Mistral 7B、Llama 3.2 1B
- 掩码语言模型(MLM)
部分token被掩盖,转换为嵌入向量,然后通过双向处理来预测被隐藏的词。
↳ BERT、RoBERTa、DeBERTa 驱动搜索和情感分析
- 分割一切模型(SAM)
提示词和图像分别通过编码器,输入掩码解码器,生成像素级分割。
↳ Meta的SAM 赋能照片编辑、医学影像和自动驾驶
以上8种架构是当前主流的模型家族。
我刻意在图中留了一种未画出来,因为它更像一个前沿概念,而非模型家族——那就是麻省理工学院提出的递归语言模型。
RLM不通过更大的窗口来对抗上下文衰减,而是将你的提示词作为变量存储在一个Python环境中,让一个根模型编写代码来检查它,然后启动递归子调用来处理相关片段。
模型在上下文之上进行推理,而不是被上下文淹没,这使得它无需重新训练就能扩展到1000万以上的token,甚至在输入已经适合的情况下也能超越基础模型。
我最近写了一篇关于它的完整解析文章。
下方即可阅读。
乐意效劳。
好观点。既然你提到了MoE,我还画了一张示意图展示它们的工作原理:
相似文章
@Ai_Vaidehi: 使用LLM构建AI系统的步骤。下面我给出了一个简单详细的解释。步骤1 – 大语言模型(LLMs) (𝗟𝗮𝗿�…
使用LLM构建AI系统的逐步指南,涵盖从选择模型到使用框架、向量数据库和数据提取工具进行评估的步骤。
@pmddomingos: 你可以阅读数百篇充满炒作的大语言模型文章,却仍然不知道它们是如何工作的。或者,你可以阅读这篇,然后...
一条推文推荐了一篇全面的博客文章,该文章从注意力机制和分布式表示开始,解释了大语言模型的历史,旨在帮助读者揭开LLMs的神秘面纱。
@Tabbu_ai: https://x.com/Tabbu_ai/status/2058145123444347339
一篇教育性推文串,解释了理解和从头构建LLM架构的11个关键课程,涵盖token、嵌入、注意力、位置编码、数据质量和常见误解。
@ickma2311: 高效AI 第12讲:Transformer 与 LLM 本讲不仅介绍 LLM 的工作原理,还深入讲解其底层构建模块……
一门高效AI课程的第12讲笔记,涵盖 Transformer 与 LLM 基础知识,包括多头注意力机制、位置编码、KV 缓存,以及模型架构与推理效率之间的关联。内容阐释了 Transformer 中的设计选择如何影响内存占用、延迟表现和硬件效率。
大语言模型与本地AI硬件的推理引擎(2026版)
本文提供了一份全面的指南,针对2026年本地AI硬件上的大语言模型推理引擎,解释了如何根据硬件策略、工作负载和服务模型进行选择,并涵盖了诸如llama.cpp、MLX、ExLlamaV2/3、vLLM、SGLang、TensorRT-LLM和NVIDIA Dynamo等引擎。