@Letian_Wang_6: 语言用了自回归,其他一切都用了扩散——这是一个不稳定的均衡。最近一直困扰我的问题是:……
摘要
一位研究者思考这种不稳定的均衡:语言使用自回归模型,而其他模态使用扩散模型,并推测统一的多模态架构取决于每种模态揭示信息的顺序。他为此押下了赌注。
查看缓存全文
缓存时间: 2026/08/07 12:56
语言模型(AR)获得了增长;其他一切则归扩散模型所有——这是一个不稳定的平衡。最近一个不断萦绕在我心头的问题是:随着 LLM、视频和机器人技术各自成熟,谁将吸纳谁?真正的原生统一多模态架构看起来是什么样的?不是为文本设计的自回归模型拼接到为像素/动作设计的扩散模型之上。
我开始相信,答案取决于一个几乎没有人明确指出过的设计轴心:不是每种模态获得哪种损失函数,而是每种模态应该以什么顺序揭示其信息。只要把这个轴心弄对,架构栈的其余部分就会坍缩成某种简单得几乎令人尴尬的东西。
在此押下我当前的赌注: 5dd31d98f71c2a6d525e2032e3afda7c277204cc537f95316ad2810ce0e8eec5
一年后问我吧 :)
相似文章
Nemotron-Labs-Diffusion: 统一自回归、扩散与自推测解码的三模式语言模型
本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。
@BetaTomorrow: #DeepManifoldInterpretation 论文:《语言模型的熵校准》 作者:Steven Cao, Gregory Valiant, 等人…
该论文《语言模型的熵校准》将熵的上升解释为自回归生成中可达路径的扩散增加,提出由于重尾数据,扩展的效益有限,并建议一种路径感知的解码替代方案。
我从零构建了一个扩散语言模型。它能写出语法完美的句子,但毫无意义,而这正是有趣之处。
作者从零构建了Joey,一个1.7亿参数的掩码扩散语言模型,在FineWeb-Edu上训练并在DailyDialog上微调,由于容量限制,模型能生成流畅但不连贯的句子。该项目突出了与自回归LLM的差异,以及从构建和调试系统中获得的经验教训。
@radixark: 现实世界是多模态的。为了人工智能理解和重现它,模型需要在多种模态之间学习。在我们的最新……
Radixark 分享了一篇博客文章,介绍 Miles 如何通过为视觉语言模型和扩散模型提供共享的后训练设计来支持人工智能模型的多模态学习。
通过熵门控连续比特流扩散缩小语言建模中的自回归差距
本文介绍了一种扩散语言模型,将文本视为二进制比特流上的连续过程,利用熵门控随机采样来缩小与自回归模型的性能差距。该模型在 LM1B 和 OWT 基准测试中取得了最先进的结果,同时降低了内存占用。