@seclink: https://x.com/seclink/status/2067968283492712846

X AI KOLs Following 新闻

摘要

本文基于研究者Victoria Lin的分享,系统梳理了原生多模态大模型的主流技术路线(Chameleon、Transfusion、MOT)及其优缺点,指出多模态AI仍处于早期探索阶段,存在缩放定律空白、图像理解与生成编码不统一、与物理世界对接等开放问题。

https://t.co/vflyYJ0Kk4
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:37

为什么说多模态AI,才刚刚起步

📌 内容来源: https://www.youtube.com/watch?v=NDdc39KYqDU

为什么说多模态AI,才刚刚起步

⚡ 开篇先看 核心观点: 真实世界本身就是多模态的,纯语言AI天生有缺陷 - 当前原生多模态大模型的主流分类和核心技术路线,优缺点一目了然 - 新一代MOT架构为什么能解决现有方案痛点,核心逻辑是什么 - 多模态AI还有哪些核心开放问题,未来的研究方向在哪

现在我们日常用的GPT-4o、Kimi,都已经是能看能说能生成图像的多模态AI,很多人觉得多模态技术已经成熟,就差落地应用了。但在学界前沿,原生多模态大模型的基础架构、训练规律,其实还有一大堆没有解决的问题,整个领域还处在探索早期。

这篇文章整理了原生多模态研究者Victoria Lin(曾任职Meta AI、Salesforce AI Research,现任Thinking Machines Lab研究员)的公开技术分享,所有专业术语都配了大白话解释,把复杂的技术路线拆得清晰易懂,看完就能搞懂多模态AI的现在和未来。

🧩 什么是原生多模态大模型

结论先行:原生多模态大模型的核心逻辑,就是把所有类型信息统一处理,直接复制纯文本大模型的成功经验。

先补几个基础术语的大白话解释: - token(大模型处理单位):大模型处理信息的基本单位,把原始信息拆成token的过程叫token化。 - Transformer(基础架构):当前所有大语言模型、多模态大模型通用的基础神经网络架构。 - 自回归生成:大模型生成内容的常用方式,逐个生成内容单元,后一个单元的生成依赖前面已经生成的所有内容。

我们熟悉的纯文本大模型,通用范式就是:把所有文本拆成token,训练模型做下一个token预测,随着数据量和模型规模扩大,会自然涌现出知识储备、推理、规划这些高级能力。这套逻辑已经被反复验证成功。

原生多模态大模型就是把这套逻辑直接复用:不管输入是文本、图像、视频还是音频,都统一做token化处理,转化成Transformer能处理的token,再用和纯文本大模型一模一样的方式训练。

现在原生多模态模型主要分两类: 第一类是多模态输入、仅文本输出,这是目前多数主流产品的模式,代表产品有Gemini、Quon、Kimi; 第二类是全模态模型,支持多模态输入也支持多模态输出,能直接生成文本、图像、音频等不同内容,GPT-4o就是这类代表,也是当前行业的主要探索方向。

⚖️ 主流全模态技术路线,各有什么优缺点

结论先行:目前全模态模型的两大主流路线,都解决了旧问题,但都留下了新坑。

第一条路线是Meta的Chameleon系列模型,它的核心假设是:所有模态都可以转化为离散token。具体做法是把一张图像切成固定大小的小块(通用标准是16像素×16像素),用VQ-VAE(一种把连续图像转成离散编码的技术)把图像转化成离散token,再和文本做成交错序列一起训练。

Chameleon是最早验证了「从零开始训练交错图文序列,可以同时获得多模态能力,还能保留强纯文本性能」的模型,但它的缺陷也很明显:离散化会损失大量图像信息,图像理解性能落后于现在主流的连续编码方案,而且token效率很低,需要大量训练数据才能生成合格的图像。

第二条同期提出的路线是Transfusion,就是为了解决Chameleon的缺陷设计的。它采用图像的连续表征,把自回归语言建模和扩散图像生成(当前主流的AI生成图像技术)无缝统一在同一个Transformer里。输入还是交错图文序列,文本用标准自回归建模,图像用扩散操作,生成图像的质量和token效率都远优于Chameleon的离散token方案。

但它也有解决不了的问题:目前学界普遍发现,图像生成和图像理解需要不同的编码方案,Transfusion的图像表征对生成任务友好,但对图像理解任务效率不高。现在效果最好的全模态模型一般用双图像编码方案绕开这个问题,但本质问题还没有解决,依然是开放研究课题。

🧠 MOT架构:给不同模态分专属参数的创新

结论先行:MOT(Mixture of Transformers,混合Transformer架构)的核心思路非常简单——不同模态本质不同,共用一套参数不如各用各的效果好。

之前的多模态模型,不管是什么模态,都共用同一套Transformer参数。但MOT架构发现,不同模态的信息密度、数据性质差异很大,共用参数反而会互相影响。

所以MOT的做法是:给每个模态分配独立的Transformer参数,不管是注意力层的投影还是前馈层都分开。处理混合模态输入的时候,哪个模态的token就激活对应模态的参数,处理完之后再通过自注意力做跨模态的信息交互。

这个架构不需要推翻之前的路线,它可以和Chameleon、Transfusion等现有方案直接结合使用,相当于一个通用优化思路。

研究者做了从1.63亿参数到70亿参数不同规模的对比实验,结果很明确:和总参数量相当的基线模型比,MOT可以在不牺牲纯文本性能的前提下,显著提升图像等非文本模态的生成效果。

它还有一个额外的实用优势:支持异步训练。如果你已经有一个训练好的成熟文本大模型,不需要全量微调,只要冻住原本文本模型的参数,只新增训练图像、语音的专属参数就行,就能低成本给旧模型扩展多模态生成能力。

现在这个架构思路已经被不少后续研究采纳:去年发布的多模态模型Bagel用了类似方案,给图像生成单独分了一套参数,图像理解部分共享基础参数,实现了「先生成思考文本再生成图像」的流程,大幅提升了生成图像的细节质量;在具身AI、机器人领域,也有不少团队用这个思路给动作预测分配专属参数,依托大语言模型的知识提升了动作预测的效果。

❓ 多模态AI还有哪些没解决的核心问题

结论先行:和已经成熟的纯文本大模型相比,多模态AI的开放问题远多于已经解决的问题,还有大量红利待挖掘。

第一个最大的空白是缩放定律。纯文本大模型的性能随参数量、训练数据量增长的规律已经摸得非常准,但多模态模型的精确缩放定律还没有得到充分研究,是一片非常有价值的研究蓝海,多模态的增长红利还远没吃完。

第二个核心矛盾是图像理解和生成的需求不统一。现在还找不到一套能同时满足理解和生成的图像编码方案,理解需要一套,生成需要另一套,怎么统一这个问题还没人给出完美答案。

第三个本质差异是语言和感官模态的训练规律完全不同:语言是人类认知的高度压缩抽象,训练下一个token预测本质就是学习人类的推理和意图;但图像视频是对世界的被动感官观察,不是抽象出来的认知符号,加上帧间信息冗余度高,损失函数更复杂,所以预训练的收益规律和语言完全不一样。此前就有伯克利一位学者提出一个令业界困惑的现象:大语言模型靠下一个token预测就能涌现强能力,但视频模型做下一帧预测,并没有得到同等水平的能力提升,这个问题至今没有明确答案。

第四个落地的大问题:现在的多模态AI只在数字信息处理领域表现不错,要对接物理世界,比如空间推理、实时感知、机器人控制这类任务,还有大量未解决的问题。

最后关于大家关心的「纯视觉能不能不靠语言做推理」,目前学界的结论是:现阶段以语言作为骨架帮视觉推理效果更好,因为语言抽象程度更高,这条路已经被验证有效;但未来算力足够发达之后,纯视觉/纯视频模型能不能实现推理,依然是一个开放问题,没有人能拍板说不可能。

💡 核心金句

  • 真实世界本身就是多模态的,纯语言AI天生有缺陷。

  • 把所有模态都拆成统一的token,就能把大语言模型的成功直接复制到多模态。

  • 给不同模态做专用参数,比所有模态共用一套参数效果更好。

  • 多模态AI的增长红利还没吃完,缩放定律还是一片待挖掘的蓝海。

  • 理解能帮生成,生成不一定帮理解。

  • 统一多模态,要把其他模态对齐到文本,别反过来把文本对齐到其他模态。

  • 多模态模型还远没有研究透,开放问题比已经解决的问题多得多。

  • 现在的多模态AI擅长处理数字信息,离搞定物理世界的多模态智能还差得远。

相似文章

@seclink: https://x.com/seclink/status/2067970118873993482

X AI KOLs Following

当前主流纯数据驱动机器人方案存在数据效率低、泛化性差的缺陷,新提出的神经符号物理智能范式将任务拆分为世界建模和规划两步,仅需1-10个演示即可学会新任务,泛化能力远超传统端到端方案,为通用机器人提供了更可靠的路径。

@snowboat84: https://x.com/snowboat84/status/2064135804092645410

X AI KOLs Timeline

本文系统梳理了世界模型(world model)这一概念从1943年Craik的心理隐喻到2024-2026年产业爆发的演进历程,详细介绍了符号AI、深度学习流派(Schmidhuber-Ha、Dreamer系列、JEPA、视频生成方向)的核心理念与代表作品,并指出当前定义混乱、各派竞争的现状。