@Letian_Wang_6: 语言用了自回归,其他一切都用了扩散——这是一个不稳定的均衡。最近一直困扰我的问题是:……

X AI KOLs Following 新闻

摘要

一位研究者思考这种不稳定的均衡:语言使用自回归模型,而其他模态使用扩散模型,并推测统一的多模态架构取决于每种模态揭示信息的顺序。他为此押下了赌注。

语言走了自回归路线,其他一切都走了扩散路线——这是一个不稳定的均衡。最近有个问题一直缠着我:随着大语言模型、视频和机器人技术都日渐成熟,谁将吸收谁?一个真正原生的统一多模态架构应该是什么样子,而不是把用于文本的自回归和用于像素/动作的扩散拼接在一起? 我开始相信,答案取决于一个几乎没有人明确指出的设计轴:不是每种模态使用哪种损失函数,而是每种模态应该以什么顺序揭示其信息。把这个轴搞对了,整个技术栈的其他部分就会变得简单得几乎令人尴尬。 在此封存我当前的赌注: 5dd31d98f71c2a6d525e2032e3afda7c277204cc537f95316ad2810ce0e8eec5 一年后再来问我 :)
查看原文
查看缓存全文

缓存时间: 2026/08/07 12:56

语言模型(AR)获得了增长;其他一切则归扩散模型所有——这是一个不稳定的平衡。最近一个不断萦绕在我心头的问题是:随着 LLM、视频和机器人技术各自成熟,谁将吸纳谁?真正的原生统一多模态架构看起来是什么样的?不是为文本设计的自回归模型拼接到为像素/动作设计的扩散模型之上。

我开始相信,答案取决于一个几乎没有人明确指出过的设计轴心:不是每种模态获得哪种损失函数,而是每种模态应该以什么顺序揭示其信息。只要把这个轴心弄对,架构栈的其余部分就会坍缩成某种简单得几乎令人尴尬的东西。

在此押下我当前的赌注: 5dd31d98f71c2a6d525e2032e3afda7c277204cc537f95316ad2810ce0e8eec5

一年后问我吧 :)

相似文章