@seclink: https://x.com/seclink/status/2067968283492712846
摘要
本文基于研究者Victoria Lin的分享,系统梳理了原生多模态大模型的主流技术路线(Chameleon、Transfusion、MOT)及其优缺点,指出多模态AI仍处于早期探索阶段,存在缩放定律空白、图像理解与生成编码不统一、与物理世界对接等开放问题。
查看缓存全文
缓存时间: 2026/06/20 14:37
为什么说多模态AI,才刚刚起步
📌 内容来源: https://www.youtube.com/watch?v=NDdc39KYqDU
为什么说多模态AI,才刚刚起步
⚡ 开篇先看 核心观点: 真实世界本身就是多模态的,纯语言AI天生有缺陷 - 当前原生多模态大模型的主流分类和核心技术路线,优缺点一目了然 - 新一代MOT架构为什么能解决现有方案痛点,核心逻辑是什么 - 多模态AI还有哪些核心开放问题,未来的研究方向在哪
现在我们日常用的GPT-4o、Kimi,都已经是能看能说能生成图像的多模态AI,很多人觉得多模态技术已经成熟,就差落地应用了。但在学界前沿,原生多模态大模型的基础架构、训练规律,其实还有一大堆没有解决的问题,整个领域还处在探索早期。
这篇文章整理了原生多模态研究者Victoria Lin(曾任职Meta AI、Salesforce AI Research,现任Thinking Machines Lab研究员)的公开技术分享,所有专业术语都配了大白话解释,把复杂的技术路线拆得清晰易懂,看完就能搞懂多模态AI的现在和未来。
🧩 什么是原生多模态大模型
结论先行:原生多模态大模型的核心逻辑,就是把所有类型信息统一处理,直接复制纯文本大模型的成功经验。
先补几个基础术语的大白话解释: - token(大模型处理单位):大模型处理信息的基本单位,把原始信息拆成token的过程叫token化。 - Transformer(基础架构):当前所有大语言模型、多模态大模型通用的基础神经网络架构。 - 自回归生成:大模型生成内容的常用方式,逐个生成内容单元,后一个单元的生成依赖前面已经生成的所有内容。
我们熟悉的纯文本大模型,通用范式就是:把所有文本拆成token,训练模型做下一个token预测,随着数据量和模型规模扩大,会自然涌现出知识储备、推理、规划这些高级能力。这套逻辑已经被反复验证成功。
原生多模态大模型就是把这套逻辑直接复用:不管输入是文本、图像、视频还是音频,都统一做token化处理,转化成Transformer能处理的token,再用和纯文本大模型一模一样的方式训练。
现在原生多模态模型主要分两类: 第一类是多模态输入、仅文本输出,这是目前多数主流产品的模式,代表产品有Gemini、Quon、Kimi; 第二类是全模态模型,支持多模态输入也支持多模态输出,能直接生成文本、图像、音频等不同内容,GPT-4o就是这类代表,也是当前行业的主要探索方向。
⚖️ 主流全模态技术路线,各有什么优缺点
结论先行:目前全模态模型的两大主流路线,都解决了旧问题,但都留下了新坑。
第一条路线是Meta的Chameleon系列模型,它的核心假设是:所有模态都可以转化为离散token。具体做法是把一张图像切成固定大小的小块(通用标准是16像素×16像素),用VQ-VAE(一种把连续图像转成离散编码的技术)把图像转化成离散token,再和文本做成交错序列一起训练。
Chameleon是最早验证了「从零开始训练交错图文序列,可以同时获得多模态能力,还能保留强纯文本性能」的模型,但它的缺陷也很明显:离散化会损失大量图像信息,图像理解性能落后于现在主流的连续编码方案,而且token效率很低,需要大量训练数据才能生成合格的图像。
第二条同期提出的路线是Transfusion,就是为了解决Chameleon的缺陷设计的。它采用图像的连续表征,把自回归语言建模和扩散图像生成(当前主流的AI生成图像技术)无缝统一在同一个Transformer里。输入还是交错图文序列,文本用标准自回归建模,图像用扩散操作,生成图像的质量和token效率都远优于Chameleon的离散token方案。
但它也有解决不了的问题:目前学界普遍发现,图像生成和图像理解需要不同的编码方案,Transfusion的图像表征对生成任务友好,但对图像理解任务效率不高。现在效果最好的全模态模型一般用双图像编码方案绕开这个问题,但本质问题还没有解决,依然是开放研究课题。
🧠 MOT架构:给不同模态分专属参数的创新
结论先行:MOT(Mixture of Transformers,混合Transformer架构)的核心思路非常简单——不同模态本质不同,共用一套参数不如各用各的效果好。
之前的多模态模型,不管是什么模态,都共用同一套Transformer参数。但MOT架构发现,不同模态的信息密度、数据性质差异很大,共用参数反而会互相影响。
所以MOT的做法是:给每个模态分配独立的Transformer参数,不管是注意力层的投影还是前馈层都分开。处理混合模态输入的时候,哪个模态的token就激活对应模态的参数,处理完之后再通过自注意力做跨模态的信息交互。
这个架构不需要推翻之前的路线,它可以和Chameleon、Transfusion等现有方案直接结合使用,相当于一个通用优化思路。
研究者做了从1.63亿参数到70亿参数不同规模的对比实验,结果很明确:和总参数量相当的基线模型比,MOT可以在不牺牲纯文本性能的前提下,显著提升图像等非文本模态的生成效果。
它还有一个额外的实用优势:支持异步训练。如果你已经有一个训练好的成熟文本大模型,不需要全量微调,只要冻住原本文本模型的参数,只新增训练图像、语音的专属参数就行,就能低成本给旧模型扩展多模态生成能力。
现在这个架构思路已经被不少后续研究采纳:去年发布的多模态模型Bagel用了类似方案,给图像生成单独分了一套参数,图像理解部分共享基础参数,实现了「先生成思考文本再生成图像」的流程,大幅提升了生成图像的细节质量;在具身AI、机器人领域,也有不少团队用这个思路给动作预测分配专属参数,依托大语言模型的知识提升了动作预测的效果。
❓ 多模态AI还有哪些没解决的核心问题
结论先行:和已经成熟的纯文本大模型相比,多模态AI的开放问题远多于已经解决的问题,还有大量红利待挖掘。
第一个最大的空白是缩放定律。纯文本大模型的性能随参数量、训练数据量增长的规律已经摸得非常准,但多模态模型的精确缩放定律还没有得到充分研究,是一片非常有价值的研究蓝海,多模态的增长红利还远没吃完。
第二个核心矛盾是图像理解和生成的需求不统一。现在还找不到一套能同时满足理解和生成的图像编码方案,理解需要一套,生成需要另一套,怎么统一这个问题还没人给出完美答案。
第三个本质差异是语言和感官模态的训练规律完全不同:语言是人类认知的高度压缩抽象,训练下一个token预测本质就是学习人类的推理和意图;但图像视频是对世界的被动感官观察,不是抽象出来的认知符号,加上帧间信息冗余度高,损失函数更复杂,所以预训练的收益规律和语言完全不一样。此前就有伯克利一位学者提出一个令业界困惑的现象:大语言模型靠下一个token预测就能涌现强能力,但视频模型做下一帧预测,并没有得到同等水平的能力提升,这个问题至今没有明确答案。
第四个落地的大问题:现在的多模态AI只在数字信息处理领域表现不错,要对接物理世界,比如空间推理、实时感知、机器人控制这类任务,还有大量未解决的问题。
最后关于大家关心的「纯视觉能不能不靠语言做推理」,目前学界的结论是:现阶段以语言作为骨架帮视觉推理效果更好,因为语言抽象程度更高,这条路已经被验证有效;但未来算力足够发达之后,纯视觉/纯视频模型能不能实现推理,依然是一个开放问题,没有人能拍板说不可能。
💡 核心金句
-
真实世界本身就是多模态的,纯语言AI天生有缺陷。
-
把所有模态都拆成统一的token,就能把大语言模型的成功直接复制到多模态。
-
给不同模态做专用参数,比所有模态共用一套参数效果更好。
-
多模态AI的增长红利还没吃完,缩放定律还是一片待挖掘的蓝海。
-
理解能帮生成,生成不一定帮理解。
-
统一多模态,要把其他模态对齐到文本,别反过来把文本对齐到其他模态。
-
多模态模型还远没有研究透,开放问题比已经解决的问题多得多。
-
现在的多模态AI擅长处理数字信息,离搞定物理世界的多模态智能还差得远。
相似文章
@seclink: 冷知识: 目前多模态大模型创业的具体落地方向通常有如下方向,如果都不是你感兴趣的话,还是别赶时髦,乖乖回去学AI coding吧 : 1. 游戏 AI NPC / 智能体中间件(如端云协同的 OmniNPC,赋能 3D 角色交互与情感叙事…
总结了当前多模态大模型创业的几个主要落地方向,包括游戏AI NPC、企业级多模态Agent、内容生成、具身智能和视觉代码助手等。
@tanzhengmc97: https://x.com/tanzhengmc97/status/2066531753762656730
用通俗易懂的语言解释了大模型的运行原理,包括词向量、Transformer注意力机制、下一个词预测训练以及涌现能力,适合初学者理解AI基础概念。
@seclink: https://x.com/seclink/status/2067970118873993482
当前主流纯数据驱动机器人方案存在数据效率低、泛化性差的缺陷,新提出的神经符号物理智能范式将任务拆分为世界建模和规划两步,仅需1-10个演示即可学会新任务,泛化能力远超传统端到端方案,为通用机器人提供了更可靠的路径。
@snowboat84: 你有没有发现,AI里模型的诞生其实相当随意?拿语言模型举例子:先是RNN,再到LSTM,某天突然说Transformer效果好就全换上,后来又拆成Encoder和Decoder,一会儿说BERT一桶浆糊,一会儿又说GPT可以有涌现能力,S…
文章讨论了AI模型诞生的随意性,提出从物理学模型中获得灵感并建立备选模型资料库,将选模型过程工程化的想法。
@snowboat84: https://x.com/snowboat84/status/2064135804092645410
本文系统梳理了世界模型(world model)这一概念从1943年Craik的心理隐喻到2024-2026年产业爆发的演进历程,详细介绍了符号AI、深度学习流派(Schmidhuber-Ha、Dreamer系列、JEPA、视频生成方向)的核心理念与代表作品,并指出当前定义混乱、各派竞争的现状。