标签
本文提出HERO(历史增强展开训练),一种通过模型自身优化历史的相对监督来增强自回归神经算子的标准轨迹监督的方法,提高了PDE基准上的长时程精度和稳定性。
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
LLaDA2.2背后的实验室发布了一个扩散模型,并将其与自家的自回归模型进行基准测试,结果显示扩散模型在通用知识和编程方面落后,但在速度和智能体任务上胜出,提供了一个清晰的权衡数据点。
CEDAR提出了一种基于约束的方法,用于稀疏自回归时间序列中的滞后因果边发现,该方法使用AR(1)残差化的距离相关和定向条件独立性检验,在筛选后通过O(d²)次检验实现了高效的边级别可解释性。
本文介绍了一种可处理的方法,用于控制自回归大语言模型的生成,使其在多项式时间内满足LR(k)上下文无关文法,相比之前指数时间的方法有所改进。文中证明,当前的大语言模型常常无法生成满足简单嵌套约束的序列,从而凸显了高效约束生成的必要性。
WorldWeaver (W²) 将跨智能体世界状态寄存器引入多智能体视频扩散模型,实现跨智能体和视图的共享世界状态持久化,提升了双智能体 Minecraft 视频生成的逻辑一致性。
提出自梯度强制(SGF),一种用于自回归视频扩散模型的双通训练策略,为写入有用的上下文记忆提供缺失的监督,即使在短训练窗口下也能实现强大的长视频外推。
介绍了DiffARFNO,一个两阶段框架,结合了自回归Fourier-MIONet与条件DDIM校正器,用于喷墨打印中的长时间跨度液滴演化预测,在ANSYS Fluent数据集上实现了最先进的性能。
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。
Inkling is a 975B-parameter sparse mixture-of-experts multimodal model accepting text, image and audio inputs and generating text outputs. Released with open weights for research, fine-tuning, and integration.
NVIDIA推出了TwoTower,这是一种在扩散语言模型中解耦上下文表示和去噪的方法,在30B MoE主干上实现了2.42倍的吞吐量,同时保留了98.7%的自回归质量。
OPSD-V 通过使用真实长视频数据作为训练时的时间上下文,提供密集的轨迹级监督,从而增强视觉质量和运动动态,同时不改变推理机制,改进了少步自回归视频扩散模型。
UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。
本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。
Set Diffusion 引入了一类新的语言模型,通过在灵活位置、灵活长度的令牌集合上分解令牌生成,在自回归模型和扩散模型之间进行插值。这使得解码速度更快,令牌排序更灵活,在推理、摘要和无条件生成任务上实现了更好的速度-质量权衡。
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
GEAR提出了一种通过表示对齐共同训练向量量化分词器和自回归生成器的方法,实现端到端训练,在ImageNet gFID上相比强基线实现高达10倍的收敛速度提升。
介绍了 Speculative Refinement (SpecRef),一种无需训练的混合解码策略,它通过熵引导的选择性掩码,从自回归草稿中热启动掩码扩散语言模型。在六个基准测试上的评估表明,代码基准测试混淆了结构发现与逻辑正确性,识别出了一种精炼张力现象,并显示评估协议可能产生不同的模型排名。
MultiHashFormer是一种基于哈希的生成式语言模型,它通过将每个词元表示为独特的哈希签名,实现了参数高效的自回归。在1亿、10亿和30亿参数规模上,该模型均优于标准Transformer语言模型,并且能够在参数不变的情况下支持多语言词汇扩展。