@Letian_Wang_6: 语言用了自回归,其他一切都用了扩散——这是一个不稳定的均衡。最近一直困扰我的问题是:……
摘要
一位研究者思考这种不稳定的均衡:语言使用自回归模型,而其他模态使用扩散模型,并推测统一的多模态架构取决于每种模态揭示信息的顺序。他为此押下了赌注。
查看缓存全文
缓存时间: 2026/08/07 12:56
语言模型(AR)获得了增长;其他一切则归扩散模型所有——这是一个不稳定的平衡。最近一个不断萦绕在我心头的问题是:随着 LLM、视频和机器人技术各自成熟,谁将吸纳谁?真正的原生统一多模态架构看起来是什么样的?不是为文本设计的自回归模型拼接到为像素/动作设计的扩散模型之上。
我开始相信,答案取决于一个几乎没有人明确指出过的设计轴心:不是每种模态获得哪种损失函数,而是每种模态应该以什么顺序揭示其信息。只要把这个轴心弄对,架构栈的其余部分就会坍缩成某种简单得几乎令人尴尬的东西。
在此押下我当前的赌注: 5dd31d98f71c2a6d525e2032e3afda7c277204cc537f95316ad2810ce0e8eec5
一年后问我吧 :)
相似文章
Nemotron-Labs-Diffusion: 统一自回归、扩散与自推测解码的三模式语言模型
本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。
我从零构建了一个扩散语言模型。它能写出语法完美的句子,但毫无意义,而这正是有趣之处。
作者从零构建了Joey,一个1.7亿参数的掩码扩散语言模型,在FineWeb-Edu上训练并在DailyDialog上微调,由于容量限制,模型能生成流畅但不连贯的句子。该项目突出了与自回归LLM的差异,以及从构建和调试系统中获得的经验教训。
通过熵门控连续比特流扩散缩小语言建模中的自回归差距
本文介绍了一种扩散语言模型,将文本视为二进制比特流上的连续过程,利用熵门控随机采样来缩小与自回归模型的性能差距。该模型在 LM1B 和 OWT 基准测试中取得了最先进的结果,同时降低了内存占用。
Set Diffusion:在自回归与扩散之间插值令牌顺序以实现快速灵活的解码
Set Diffusion 引入了一类新的语言模型,通过在灵活位置、灵活长度的令牌集合上分解令牌生成,在自回归模型和扩散模型之间进行插值。这使得解码速度更快,令牌排序更灵活,在推理、摘要和无条件生成任务上实现了更好的速度-质量权衡。
@volokuleshov: 新博客文章:如何构建扩散语言模型。扩散LLM从开放问题变为现实,用了2年时间 (Me…)
由Volodymyr Kuleshov的康奈尔团队撰写的综合博客文章,解释了如何构建扩散语言模型,涵盖了核心技术如掩码扩散、迭代细化、变长生成、可控生成、快速采样器和RL后训练,并以开源模型如Mercury、Gemma Diffusion和Nemotron Diffusion为例。