@_avichawla:8种AI模型架构的视觉解析:人们往往把LLM视作整个领域,但它们只是其中一员……

X AI KOLs Timeline 新闻

摘要

对8种主要AI模型架构的可视化解析,包括LLM、VLM、MoE、SLM等,外加来自MIT的递归语言模型的额外介绍。

8种AI模型架构的视觉解析: 人们往往把LLM视作整个领域,但它们只是众多模型家族之一,每种模型都因不同的输入、输出或约束而独特。 以下是详细分解: 1. LLM(大语言模型) 文本输入,通过分词转换为嵌入向量,经过Transformer处理,输出文本。 ↳ GPT、Claude、Gemini、Llama。 2. LCM(大概念模型) 在概念层面运作,而非token。输入被分割成句子,通过SONAR嵌入向量,然后使用扩散模型输出。 ↳ Meta的LCM是开创者。 3. LAM(大动作模型) 将意图转化为行动。输入经过感知、意图识别、任务分解,然后结合记忆进行行动规划并执行。 ↳ Rabbit R1、Microsoft UFO、Claude Computer Use。 4. MoE(混合专家模型) 路由器决定哪些专门的“专家”处理你的查询。仅相关专家被激活。结果经过选择和加工。 ↳ Mixtral、GPT-4、DeepSeek。 5. VLM(视觉-语言模型) 图像通过视觉编码器,文本通过文本编码器。两者在多模态处理器中融合,然后语言模型生成输出。 ↳ GPT-4V、Gemini Pro Vision、LLaVA。 6. SLM(小语言模型) 针对边缘设备优化的LLM,使用紧凑分词、高效Transformer和量化技术以实现本地部署。 ↳ Phi-3、Gemma、Mistral 7B、Llama 3.2 1B。 7. MLM(掩码语言模型) Token被掩码,转换为嵌入向量,然后通过双向处理预测隐藏的词。 ↳ BERT、RoBERTa、DeBERTa支撑着搜索和情感分析。 8. SAM(分割一切模型) 提示和图像分别通过各自的编码器,然后输入掩码解码器,生成像素级的分割。 ↳ Meta的SAM支撑着照片编辑、医学影像和自动驾驶。 话说回来,以上8种架构是已确立的模型家族。 我故意在图中遗漏了一个,因为它与其说是一个模型家族,不如说是一个前沿概念——MIT的递归语言模型。 RLM不是通过更大的上下文窗口来对抗上下文腐烂,而是将用户提示作为Python环境中的变量存储,让根模型编写代码来检查它,然后生成递归子调用来处理相关片段。 模型对上下文进行推理,而非淹没其中,从而无需重新训练即可扩展到1000万以上的token,甚至在输入已适合的情况下也优于基础模型。 我最近写了一篇关于它的完整解析。 请阅读下文。
查看原文
查看缓存全文

缓存时间: 2026/06/09 10:44

8种AI模型架构,可视化解读:

人们往往把大语言模型当成整个AI领域的全部。但它们只是众多模型家族中的一支,每种模型都由不同的输入、输出或约束条件塑造而成。

以下是详细拆解:

  1. 大语言模型(LLM)

文本输入,被token化后转为嵌入向量,经过Transformer处理,再输出文本。

↳ GPT、Claude、Gemini、Llama

  1. 大概念模型(LCM)

在概念层面而非token层面工作。输入被切分为句子,通过SONAR嵌入,然后使用扩散模型进行输出。

↳ Meta的LCM是先行者

  1. 大动作模型(LAM)

将意图转化为行动。输入经过感知、意图识别、任务拆解,再结合记忆进行动作规划后执行。

↳ Rabbit R1、Microsoft UFO、Claude Computer Use

  1. 混合专家模型(MoE)

一个路由器决定哪些专门的“专家”处理你的查询。只有相关的专家被激活,结果经过选择和加工。

↳ Mixtral、GPT-4、DeepSeek

  1. 视觉语言模型(VLM)

图像经过视觉编码器,文本经过文本编码器。两者在多模态处理器中融合,然后由语言模型生成输出。

↳ GPT-4V、Gemini Pro Vision、LLaVA

  1. 小语言模型(SLM)

针对边缘设备优化的大语言模型,采用紧凑的token化、高效的Transformer和量化技术,实现本地部署。

↳ Phi-3、Gemma、Mistral 7B、Llama 3.2 1B

  1. 掩码语言模型(MLM)

部分token被掩盖,转换为嵌入向量,然后通过双向处理来预测被隐藏的词。

↳ BERT、RoBERTa、DeBERTa 驱动搜索和情感分析

  1. 分割一切模型(SAM)

提示词和图像分别通过编码器,输入掩码解码器,生成像素级分割。

↳ Meta的SAM 赋能照片编辑、医学影像和自动驾驶

以上8种架构是当前主流的模型家族。

我刻意在图中留了一种未画出来,因为它更像一个前沿概念,而非模型家族——那就是麻省理工学院提出的递归语言模型。

RLM不通过更大的窗口来对抗上下文衰减,而是将你的提示词作为变量存储在一个Python环境中,让一个根模型编写代码来检查它,然后启动递归子调用来处理相关片段。

模型在上下文之上进行推理,而不是被上下文淹没,这使得它无需重新训练就能扩展到1000万以上的token,甚至在输入已经适合的情况下也能超越基础模型。

我最近写了一篇关于它的完整解析文章。

下方即可阅读。

乐意效劳。

好观点。既然你提到了MoE,我还画了一张示意图展示它们的工作原理:

相似文章

大语言模型与本地AI硬件的推理引擎(2026版)

X AI KOLs

本文提供了一份全面的指南,针对2026年本地AI硬件上的大语言模型推理引擎,解释了如何根据硬件策略、工作负载和服务模型进行选择,并涵盖了诸如llama.cpp、MLX、ExLlamaV2/3、vLLM、SGLang、TensorRT-LLM和NVIDIA Dynamo等引擎。