diffusion-language-model

标签

Cards List
#diffusion-language-model

@akshay_pachaar: NVIDIA可能刚刚解决了LLM中最大的权衡问题。每个LLM都让你在速度和品质之间做出选择。自回归…

X AI KOLs Timeline · 2026-07-11 缓存

NVIDIA推出了TwoTower,这是一种在扩散语言模型中解耦上下文表示和去噪的方法,在30B MoE主干上实现了2.42倍的吞吐量,同时保留了98.7%的自回归质量。

0 人收藏 0 人点赞
#diffusion-language-model

@NVIDIAAI:我们将一个300亿参数模型一分为二,并行生成token,而非逐个生成。推出Nemotron-Labs…

X AI KOLs Timeline · 2026-07-01 缓存

NVIDIA Research推出Nemotron-Labs-TwoTower,这是一种扩散语言模型,它将一个300亿参数的模型分成两半,实现并行token生成,生成速度提升2.42倍,同时保持了原始质量的98.7%。

0 人收藏 0 人点赞
#diffusion-language-model

TAG-DLM:面向文本属性图学习的扩散语言模型

arXiv cs.CL · 2026-07-01 缓存

TAG-DLM 在一个掩码扩散语言模型中统一了文本推理与图消息传递,使得能够在节点分类和链接预测任务中联合推理文本与图拓扑。

0 人收藏 0 人点赞
#diffusion-language-model

Nemotron-TwoTower:基于预训练自回归上下文的扩散语言建模

arXiv cs.CL · 2026-06-26 缓存

本文提出了Nemotron-TwoTower,一种扩散语言模型,通过冻结的自回归塔和可训练的扩散去噪器解耦上下文表示与去噪过程,以2.42倍吞吐量达到了基线质量98.7%的水平。

0 人收藏 0 人点赞
#diffusion-language-model

我从零构建了一个扩散语言模型。它能写出语法完美的句子,但毫无意义,而这正是有趣之处。

Reddit r/AI_Agents · 2026-06-08

作者从零构建了Joey,一个1.7亿参数的掩码扩散语言模型,在FineWeb-Edu上训练并在DailyDialog上微调,由于容量限制,模型能生成流畅但不连贯的句子。该项目突出了与自回归LLM的差异,以及从构建和调试系统中获得的经验教训。

0 人收藏 0 人点赞
#diffusion-language-model

迈向光速文本生成:Nemotron-Labs扩散语言模型

Hugging Face Blog · 2026-05-23 缓存

NVIDIA推出Nemotron-Labs Diffusion,这是一系列扩散语言模型,可并行生成文本并迭代优化,从而提供更快的生成速度并支持修订之前的令牌。

0 人收藏 0 人点赞
#diffusion-language-model

@probablynotaz9: ICML 单作者论文警报:是否曾想用经典策略梯度对扩散 LLM 进行后训练,而无需……

X AI KOLs Following · 2026-05-09 缓存

这篇 ICML 单作者论文介绍了摊销式组相对策略优化(AGRPO),旨在为扩散语言模型实现高效的强化学习后训练。

0 人收藏 0 人点赞
#diffusion-language-model

Chainwash:扩散语言模型水印的多步重写攻击

arXiv cs.CL · 2026-05-08 缓存

本研究论文介绍了Chainwash,一种多步重写攻击,能够有效删除扩散语言模型(LLaDA-8B-Instruct)输出中的统计水印,经过五次链式重写后,检测率从87.9%降至4.86%。

0 人收藏 0 人点赞
#diffusion-language-model

令牌时间连续扩散用于语言建模

Hugging Face Daily Papers · 2026-05-07 缓存

本文介绍了令牌时间连续扩散(Token Time Continuous Diffusion,简称TTCD),这是一种新型扩散语言模型,它在连续空间中运行,采用每个令牌的时间步,在条件生成和数独求解方面以高加速比优于离散模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈