@VictoriaLinML: The video of my Stanford CS25 guest lecture, From Language Models to Native Multimodal Intelligence, is now online. I d…
摘要
Victoria Lin's Stanford CS25 lecture discusses the paradigm shift from language models to native multimodal intelligence, covering tokenization approaches and comparing models like Chameleon and Transfusion.
查看缓存全文
缓存时间: 2026/07/03 20:43
The video of my Stanford CS25 guest lecture, From Language Models to Native Multimodal Intelligence, is now online.
I discussed how the core ideas behind LLMs has shaped multimodal AI, from architectures to training paradigms and scaling, and where the next challenges may lie. :
TL;DR: Victoria Lin 在斯坦福 CS25 讲座中系统介绍了原生多模态语言模型的范式——通过统一 token 化将文本、图像、音频、视频转为序列,并像语言模型一样进行自回归建模,重点分析了全模态模型 Chameleon(离散 token)与 Transfusion(连续表示 + 扩散)的设计理念与优劣。
讲座背景
Victoria Lin 来自 Thinking Machines Lab,专注于原生多模态智能。她此前在 Meta AI 和 Salesforce AI Research 担任研究科学家,拥有华盛顿大学博士学位。本次讲座完全基于公开材料,仅代表个人观点。
为什么需要多模态语言模型?
大语言模型(LLM)通过预测下一个 token,在大规模文本数据上训练,展现出知识获取、指令遵循、思维链推理甚至复杂任务规划等涌现能力。但仅靠文本模态是不够的——我们每天接触的数字世界和物理世界充满图像、音频、视频等多模态信息。构建能与人类实时交互的 AI 系统,必须无缝处理视觉和听觉信息。
当前许多先进模型(如 Gemini、Qwen、Kimi)已经宣称是“原生多模态”的,能处理图像、视频理解等任务。讲座第一部分深入探讨这类模型的构建理念。
原生多模态语言模型的定义与范式
通过类比语言模型来理解该范式最直接:最先进的多模态语言模型全面执行 token 化,即无论输入是图像、视频还是音频,都将其转换为可由 Transformer 处理的 token 序列,然后像语言模型一样进行全局自回归生成建模。
不同模态的 token 化方法
- 文本:使用字节对编码(BPE)拆分为小块 token。
- 图像:执行“分块”(patchify)操作,将整张图像分割成固定大小的小块(如 16×16 像素),然后通过编码器获取向量表示,序列化后得到图像 token。
- 音频:对波形进行变换,对结果表示进行 token 化。
- 视频:将视频视为图像序列,对每一帧进行分块,再连接所有分块得到 token 序列。
这些 token 不必是离散的,编码成密集向量也仍称为 token。
两种主要类型
- 多模态输入 + 文本输出:输入多模态序列,但只计算文本 token 上的损失。例如 Gemini、Qwen、Kimi 等,能够理解图像/视频并用文本回答。当前许多核心产品仍然只做文本输出。
- 全模态模型(Omni):输入输出均为多模态,不仅能生成文本,还能生成图像、音频。代表如 GPT-4o。
从 LLM 范式迁移的好处
通过 token 化观点,可以将 LLM 的架构和训练原则转移到多模态领域:
- 提示与指令遵循:用混合模态提示模型,解决需要多模态能力的复杂任务。
- 规划与推理:模型能利用多模态信息进行规划和推理。
- 扩展定律:LLM 中数据量和模型规模增大带来性能提升的规律也适用于多模态模型。虽然多模态的精确缩放定律尚不明确(文本建模已有幂律拟合),但粗略趋势上仍看到扩展能力。
- 架构技术迁移:许多扩展技术(如专家混合 MoE 及其变体)可直接应用于多模态语言模型。
聚焦全模态模型
讲座重点介绍第二类全模态模型,因为 Victoria Lin 的研究小组一直致力于这类模型的开发。关键研究问题:(1)如何使模型生成非文本模态?(2)非文本模态的理解与生成之间是否存在迁移?
Chameleon 家族:离散 token 化
Chameleon 采用一个简单假设:将每一种模态 token 化为离散 token,然后像语言模型一样建模多模态世界为离散 token 序列。
如何离散化图像:对图像做分块后,使用学习到的向量码本(VQ-VAE 技术),将每个图像块的嵌入匹配到码本中最接近的离散索引,从而将图像转换为一系列离散表示。
训练与能力:将图像和文本作为交错序列,应用交叉熵语言模型目标训练。模型能按原始顺序生成交错的文本和图像,产生混合模态文档。也可进行多任务处理,如聊天、头脑风暴、比较图像等。
局限性:
- 离散化导致图像理解任务中的信息损失,与使用连续图像编码(如 SigLIP)的模型相比存在显著性能差距。
- 生成方面,离散化 token 效率低,需要大量数据才能采样出形状良好的图像。
Transfusion:连续表示 + 扩散
Transfusion 与 Chameleon 大致同时提出,试图克服其局限性。它采用图像的连续表示作为输入,并直接预测这些连续表示。
方法:在单一 Transformer 中结合自回归语言建模和基于扩散的图像生成。输入仍然是交错的文本和图像序列。对文本执行标准自回归建模,对图像部分不进行自回归预测,而是取一段图像表示进行扩散操作(多步扩散得到清晰图像),然后将清晰图像作为输入继续自回归处理。
结构变化:文本使用因果注意力,图像使用双向注意力以获得更好性能。
优势:根据论文,Transfusion 能够用比离散 token 方法更少的步骤生成质量更好的图像。
总结
从语言模型到原生多模态智能的转变,核心在于通过统一的 token 化将多模态信息纳入自回归框架。Chameleon 证明了从头训练交错序列的可行性,但离散化带来信息损失;Transfusion 结合连续表示和扩散,在生成效率和质量上更优。未来仍有多模态缩放定律、非文本模态理解与生成迁移等课题值得探索。
相似文章
@swyx: 完整文章和链接在此
Latent Space 播客的一集讨论了这样一个论点:视频模型从大语言模型(LLM)中获取智能,下一个前沿是视频智能体。嘉宾 Ethan He(曾在 xAI 构建 Grok Imagine)分享了构建前沿图像和视频系统的见解。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
Vokenization:面向视觉与语言的多模态学习
本文介绍了“Vokenization”,这是一种多模态学习技术,通过利用弱监督将视觉数据与语言标记联系起来,从而架起计算机视觉与自然语言处理之间的桥梁。文章将其与 GPT-3 和 BERT 等纯文本模型进行了对比,强调了视觉定位如何提升语言理解能力。
@seclink: https://x.com/seclink/status/2067968283492712846
本文基于研究者Victoria Lin的分享,系统梳理了原生多模态大模型的主流技术路线(Chameleon、Transfusion、MOT)及其优缺点,指出多模态AI仍处于早期探索阶段,存在缩放定律空白、图像理解与生成编码不统一、与物理世界对接等开放问题。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。