NVAlign:连续自回归流匹配文本到语音中非语言控制的直接梯度优化

Hugging Face Daily Papers 论文

摘要

NVAlign是一种直接梯度优化方法,用于微调文本到语音模型,以可靠地产生非语言声音如笑声和叹息,提高性能优于标准微调和flow-GRPO,同时保持自然度。

虽然现代文本到语音(TTS)系统能够生成高度自然的语音,并支持内联非语言发声(NVV)标签,但对这些事件的精确控制仍然具有挑战性。一个关键缺口是在连续自回归流匹配TTS中缺乏成熟的非语言控制后训练方法。为此,我们提出了NVAlign,一个直接梯度后训练框架,用于该架构中的NVV标签跟随。我们首先在NVV注释的语音上对TTS模型和NVV感知的自动语音识别(NV-ASR)模型进行监督微调(SFT),然后冻结NV-ASR模型作为后训练的奖励模型。一个两步梯度代理使得通过流匹配采样器高效进行奖励反向传播,以联合更新自回归主干和声学流头。保真度惩罚和参考速度正则化有助于保持说话者相似性和语音质量。来自NVV-SuperBench和人类听评的结果表明,NVAlign提高了标签跟随准确率,优于SFT和Flow-GRPO基线。这些发现表明,直接奖励梯度优化可以改善连续自回归流匹配TTS中的非语言控制。音频样本可在 https://nvalign.github.io/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/30 00:13

论文页面 - NVAlign:连续自回归流匹配文本转语音中非言语控制的直接梯度优化

来源:https://huggingface.co/papers/2609.31892 让TTS模型在句子中间加入[笑声]或[叹气],它常常…就直接跳过了。

内联的非言语标签现在已很常见,但即使经过微调,模型仍会忽略或混淆这些声音,尤其是那些训练数据稀少的罕见声音。而连续自回归流匹配TTS(如VoxCPM2和dots.tts)没有词元概率,因此GRPO风格的RL无法直接应用。

NVAlign采取了直接路径:我们微调一个能识别非言语声音的ASR模型(NV-ASR),将其冻结,然后通过一个两步梯度代理,将其判断直接反向传播到流匹配采样器中,同时更新自回归骨干网络和流头部。

在盲测人类听测中,NVAlign在VoxCPM2、dots.tts和一个英文生产系统上,比SFT和Flow-GRPO更可靠地遵循非言语标签,同时保持了说话人相似度和自然度。

问题在于:识别器可能被“玩坏”。如果没有速度正则化,它的分数会不断攀升,而声音质量却在下降。正是这些约束将更高的分数转化为了人们实际能听到的声音。

NVAlign概览(https://cdn-uploads.huggingface.co/production/uploads/68fc33d3705bf8aa76ef5215/ELwjhjBxGBApIB_HQ55zS.png)

相似文章

LeapAlign:通过构建两步轨迹在任意生成步骤后训练流匹配模型

Hugging Face Daily Papers

LeapAlign是一种后训练方法,通过两步轨迹捷径降低计算成本,同时实现梯度稳定传播到早期生成步骤,从而改善流匹配模型与人类偏好的对齐。在微调Flux模型时,该方法在多种图像质量和文本对齐指标上均优于现有最先进方法。