标签
Tacit-TTS 将 IndexTTS2 的自回归文本到语义解码替换为掩码非自回归生成,并结合免训练的声学长度估计与 ReFlow 蒸馏,实现了无需参考文本的零样本语音克隆;在时长超过 5 秒的语音上,其生成速度比 IndexTTS2 快 10 倍以上,同时支持跨语言以及非语音(如婴儿咿呀学语、合成乱码)参考音频的克隆。
Laya是一款322M参数非自回归决策引擎,旨在取代LLM评判,无需生成令牌即可提供快速且确定的类型化决策,使其在分类任务中具有成本效益。
作者描述了其早期在非自回归决策模型上的工作,并批评一个前沿实验室将类似概念称为突破,同时宣布了自己更快、开源的RL代理模型。
Laya 是一个开源的快速多语言决策引擎,为结构化模式提供非自回归、校准概率,声称比 Jev 快 6-8 倍,并且完全开放。
一位个人声称在一年前就开发并开源了一个类似于Jev的非自回归AI架构,比其公开发布早了一年,对缺乏来自前沿实验室的认可和支持表示沮丧。
本文提出了一种离散扩散框架,用于高效的一对多机器翻译,实现了随目标语言数量次线性延迟扩展,并支持对未见源语言的零样本迁移。
ACache为扩散大语言模型引入了一种缓存机制,该机制通过选择性重新计算关键标记来提高推理效率,同时不损失准确性。
本文提出了一种基于CTC的非自回归方法,用于阿拉伯语语音到文本的变音符号恢复,在解码过程中引入硬约束以提高效率并降低错误率。
FreyaTTS 是一款紧凑型、无需分词器的土耳其语优先文本转语音模型,基于非自回归条件流匹配扩散变换器,以远小于大型系统的参数量实现了最先进的性能,并基于 Apache-2.0 许可发布。
iLLaDA是一个80亿参数的掩码扩散语言模型,具有完全双向注意力机制,从头开始在12万亿token上训练。与LLaDA相比,它在多个方面都有显著改进,并在多个基准测试上与Qwen2.5 7B保持竞争力。模型和代码已开源。
一项系统性的实验分析,评估了八种最先进的扩散语言模型在多个基准测试上的表现,分析了生成质量与计算效率之间的权衡。
提出一种用于流式ASR标点恢复的非自回归评分方法,该方法保留输入转录,并在有限前瞻预算下优于基于提示和微调的基线。
研究人员提出一种名为“后缀锚定置信度调制”的无训练方法,通过解决EOT标记和过早解码的问题,改进扩散语言模型中基于置信度的解码。
本文介绍了一种扩散语言模型,将文本视为二进制比特流上的连续过程,利用熵门控随机采样来缩小与自回归模型的性能差距。该模型在 LM1B 和 OWT 基准测试中取得了最先进的结果,同时降低了内存占用。
Meta 的 FAIR 团队发布了 Flowception 的代码,这是 CVPR 2026 的一篇论文,介绍了一种非自回归视频生成框架。该框架通过交错帧插入与连续去噪,减少了误差累积和计算成本。
Cola DLM 是一种分层潜在扩散语言模型,它通过文本到潜空间的映射以及条件解码,实现高效且非自回归的文本生成。
CRoCoDiL提出了一种用于语言的连续且鲁棒的条件扩散方法,将掩码扩散模型转移到连续语义空间中,相比LLaDA等离散方法,生成质量更优,采样速度快10倍。