@VictoriaLinML: The video of my Stanford CS25 guest lecture, From Language Models to Native Multimodal Intelligence, is now online. I d…

X AI KOLs Timeline 事件

摘要

Victoria Lin's Stanford CS25 lecture discusses the paradigm shift from language models to native multimodal intelligence, covering tokenization approaches and comparing models like Chameleon and Transfusion.

The video of my Stanford CS25 guest lecture, From Language Models to Native Multimodal Intelligence, is now online. I discussed how the core ideas behind LLMs has shaped multimodal AI, from architectures to training paradigms and scaling, and where the next challenges may lie. :
查看原文
查看缓存全文

缓存时间: 2026/07/03 20:43

The video of my Stanford CS25 guest lecture, From Language Models to Native Multimodal Intelligence, is now online.

I discussed how the core ideas behind LLMs has shaped multimodal AI, from architectures to training paradigms and scaling, and where the next challenges may lie. :


TL;DR: Victoria Lin 在斯坦福 CS25 讲座中系统介绍了原生多模态语言模型的范式——通过统一 token 化将文本、图像、音频、视频转为序列,并像语言模型一样进行自回归建模,重点分析了全模态模型 Chameleon(离散 token)与 Transfusion(连续表示 + 扩散)的设计理念与优劣。

讲座背景

Victoria Lin 来自 Thinking Machines Lab,专注于原生多模态智能。她此前在 Meta AI 和 Salesforce AI Research 担任研究科学家,拥有华盛顿大学博士学位。本次讲座完全基于公开材料,仅代表个人观点。

为什么需要多模态语言模型?

大语言模型(LLM)通过预测下一个 token,在大规模文本数据上训练,展现出知识获取、指令遵循、思维链推理甚至复杂任务规划等涌现能力。但仅靠文本模态是不够的——我们每天接触的数字世界和物理世界充满图像、音频、视频等多模态信息。构建能与人类实时交互的 AI 系统,必须无缝处理视觉和听觉信息。

当前许多先进模型(如 Gemini、Qwen、Kimi)已经宣称是“原生多模态”的,能处理图像、视频理解等任务。讲座第一部分深入探讨这类模型的构建理念。

原生多模态语言模型的定义与范式

通过类比语言模型来理解该范式最直接:最先进的多模态语言模型全面执行 token 化,即无论输入是图像、视频还是音频,都将其转换为可由 Transformer 处理的 token 序列,然后像语言模型一样进行全局自回归生成建模。

不同模态的 token 化方法

  • 文本:使用字节对编码(BPE)拆分为小块 token。
  • 图像:执行“分块”(patchify)操作,将整张图像分割成固定大小的小块(如 16×16 像素),然后通过编码器获取向量表示,序列化后得到图像 token。
  • 音频:对波形进行变换,对结果表示进行 token 化。
  • 视频:将视频视为图像序列,对每一帧进行分块,再连接所有分块得到 token 序列。

这些 token 不必是离散的,编码成密集向量也仍称为 token。

两种主要类型

  1. 多模态输入 + 文本输出:输入多模态序列,但只计算文本 token 上的损失。例如 Gemini、Qwen、Kimi 等,能够理解图像/视频并用文本回答。当前许多核心产品仍然只做文本输出。
  2. 全模态模型(Omni):输入输出均为多模态,不仅能生成文本,还能生成图像、音频。代表如 GPT-4o。

从 LLM 范式迁移的好处

通过 token 化观点,可以将 LLM 的架构和训练原则转移到多模态领域:

  • 提示与指令遵循:用混合模态提示模型,解决需要多模态能力的复杂任务。
  • 规划与推理:模型能利用多模态信息进行规划和推理。
  • 扩展定律:LLM 中数据量和模型规模增大带来性能提升的规律也适用于多模态模型。虽然多模态的精确缩放定律尚不明确(文本建模已有幂律拟合),但粗略趋势上仍看到扩展能力。
  • 架构技术迁移:许多扩展技术(如专家混合 MoE 及其变体)可直接应用于多模态语言模型。

聚焦全模态模型

讲座重点介绍第二类全模态模型,因为 Victoria Lin 的研究小组一直致力于这类模型的开发。关键研究问题:(1)如何使模型生成非文本模态?(2)非文本模态的理解与生成之间是否存在迁移?

Chameleon 家族:离散 token 化

Chameleon 采用一个简单假设:将每一种模态 token 化为离散 token,然后像语言模型一样建模多模态世界为离散 token 序列。

如何离散化图像:对图像做分块后,使用学习到的向量码本(VQ-VAE 技术),将每个图像块的嵌入匹配到码本中最接近的离散索引,从而将图像转换为一系列离散表示。

训练与能力:将图像和文本作为交错序列,应用交叉熵语言模型目标训练。模型能按原始顺序生成交错的文本和图像,产生混合模态文档。也可进行多任务处理,如聊天、头脑风暴、比较图像等。

局限性:

  • 离散化导致图像理解任务中的信息损失,与使用连续图像编码(如 SigLIP)的模型相比存在显著性能差距。
  • 生成方面,离散化 token 效率低,需要大量数据才能采样出形状良好的图像。

Transfusion:连续表示 + 扩散

Transfusion 与 Chameleon 大致同时提出,试图克服其局限性。它采用图像的连续表示作为输入,并直接预测这些连续表示。

方法:在单一 Transformer 中结合自回归语言建模和基于扩散的图像生成。输入仍然是交错的文本和图像序列。对文本执行标准自回归建模,对图像部分不进行自回归预测,而是取一段图像表示进行扩散操作(多步扩散得到清晰图像),然后将清晰图像作为输入继续自回归处理。

结构变化:文本使用因果注意力,图像使用双向注意力以获得更好性能。

优势:根据论文,Transfusion 能够用比离散 token 方法更少的步骤生成质量更好的图像。

总结

从语言模型到原生多模态智能的转变,核心在于通过统一的 token 化将多模态信息纳入自回归框架。Chameleon 证明了从头训练交错序列的可行性,但离散化带来信息损失;Transfusion 结合连续表示和扩散,在生成效率和质量上更优。未来仍有多模态缩放定律、非文本模态理解与生成迁移等课题值得探索。

Source: https://www.youtube.com/watch?v=NDdc39KYqDU

相似文章

@swyx: 完整文章和链接在此

X AI KOLs Timeline

Latent Space 播客的一集讨论了这样一个论点:视频模型从大语言模型(LLM)中获取智能,下一个前沿是视频智能体。嘉宾 Ethan He(曾在 xAI 构建 Grok Imagine)分享了构建前沿图像和视频系统的见解。

Vokenization:面向视觉与语言的多模态学习

ML at Berkeley

本文介绍了“Vokenization”,这是一种多模态学习技术,通过利用弱监督将视觉数据与语言标记联系起来,从而架起计算机视觉与自然语言处理之间的桥梁。文章将其与 GPT-3 和 BERT 等纯文本模型进行了对比,强调了视觉定位如何提升语言理解能力。

@seclink: https://x.com/seclink/status/2067968283492712846

X AI KOLs Following

本文基于研究者Victoria Lin的分享,系统梳理了原生多模态大模型的主流技术路线(Chameleon、Transfusion、MOT)及其优缺点,指出多模态AI仍处于早期探索阶段,存在缩放定律空白、图像理解与生成编码不统一、与物理世界对接等开放问题。

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。