Masked Diffusion Language Models 是强大且可操控的基于文本的世界模型,用于智能体强化学习 [R]
摘要
本文提出将 Masked Diffusion Language Models (MDLMs) 作为基于文本的世界模型用于智能体强化学习,表明其任意顺序去噪目标避免了前缀模式崩溃,并且相比自回归基线模型带来了更强的性能。
自回归 LLM 世界模型将下一状态生成从左到右进行因式分解,使其无法以全局相互依赖的锚点(工具模式、尾部状态字段、预期结果)为条件,产生前缀一致但全局不一致的轨迹。MDLMs 的任意顺序去噪目标通过学习来自相同训练信号的每个条件方向来规避这一问题。实验上,微调的 MDLMs(SDAR-8B, WeDLM-8B)在领域内和领域外划分的 BLEU-1、ROUGE-L 和 MAUVE 指标上,超过了参数总量高达其4倍的自回归基线模型。更低的 Self-BLEU 和更高的 Distinct-N 证实了前缀模式崩溃的减少。在零样本迁移设置下,针对 1.2B–7B 骨干模型(LFM2.5, Qwen3, Mistral),在 MDLM 生成的轨迹上进行 GRPO 训练,相比在 AR 生成的轨迹上训练的模型,在保留的 ScienceWorld、ALFWorld 和 AppWorld 上显示出高达 +15% 的绝对任务成功率提升。
相似文章
PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
掩码语言流模型
本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。
服务掩码扩散大语言模型:基于真实硬件的特性分析与设计原则
本文利用真实硬件测量,表征了掩码扩散语言模型(dLLMs)的服务行为,识别了与自回归模型的关键区别,并推导出高效推理系统的设计原则。
基于轨迹的在策略蒸馏用于掩码扩散语言模型
一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。
迷失在插值中:为什么预测性反馈在扩散语言模型中失效
本文分析了掩码扩散语言模型(MDLMs)的嵌入空间,发现其呈超球面几何结构,导致线性插值并非最优。作者引入了球面软掩码(S-SM),在超球面上使用SLERP和Fréchet均值,相较于之前的软掩码方法,在MAUVE和困惑度指标上均有提升。