NVAlign:连续自回归流匹配文本到语音中非语言控制的直接梯度优化
摘要
NVAlign是一种直接梯度优化方法,用于微调文本到语音模型,以可靠地产生非语言声音如笑声和叹息,提高性能优于标准微调和flow-GRPO,同时保持自然度。
查看缓存全文
缓存时间: 2026/09/30 00:13
论文页面 - NVAlign:连续自回归流匹配文本转语音中非言语控制的直接梯度优化
来源:https://huggingface.co/papers/2609.31892 让TTS模型在句子中间加入[笑声]或[叹气],它常常…就直接跳过了。
内联的非言语标签现在已很常见,但即使经过微调,模型仍会忽略或混淆这些声音,尤其是那些训练数据稀少的罕见声音。而连续自回归流匹配TTS(如VoxCPM2和dots.tts)没有词元概率,因此GRPO风格的RL无法直接应用。
NVAlign采取了直接路径:我们微调一个能识别非言语声音的ASR模型(NV-ASR),将其冻结,然后通过一个两步梯度代理,将其判断直接反向传播到流匹配采样器中,同时更新自回归骨干网络和流头部。
在盲测人类听测中,NVAlign在VoxCPM2、dots.tts和一个英文生产系统上,比SFT和Flow-GRPO更可靠地遵循非言语标签,同时保持了说话人相似度和自然度。
问题在于:识别器可能被“玩坏”。如果没有速度正则化,它的分数会不断攀升,而声音质量却在下降。正是这些约束将更高的分数转化为了人们实际能听到的声音。
NVAlign概览(https://cdn-uploads.huggingface.co/production/uploads/68fc33d3705bf8aa76ef5215/ELwjhjBxGBApIB_HQ55zS.png)
相似文章
easyaligner: 支持GPU加速和灵活文本归一化的强制对齐工具(兼容HF Hub上的所有w2v2模型)[P]
easyaligner是一个开源强制对齐库,具有GPU加速和灵活的文本归一化功能,适配Hugging Face Hub上的所有wav2vec2模型。它针对实际工作流进行了优化,可以处理部分转录、无关语音段落和长音频(无需分块),同时保留原始文本格式。
WavAlign:通过自适应混合后训练提升口语对话模型的智能与表现力
WavAlign 提出一种模态感知的自适应后训练方法,利用受限偏好更新与显式锚定,在端到端口语对话模型中同步提升语义质量与语音表现力。
基于梯度的语音到文本对齐方法,适用于任何ASR模型:从CTC到语音大语言模型
本文介绍了一种基于梯度的语音到文本对齐方法,适用于任何可微分的ASR模型,包括CTC、transducer、基于注意力的编码器-解码器以及语音大语言模型,无需训练或模型修改。
LeapAlign:通过构建两步轨迹在任意生成步骤后训练流匹配模型
LeapAlign是一种后训练方法,通过两步轨迹捷径降低计算成本,同时实现梯度稳定传播到早期生成步骤,从而改善流匹配模型与人类偏好的对齐。在微调Flux模型时,该方法在多种图像质量和文本对齐指标上均优于现有最先进方法。
@HuggingPapers: Stable-GFlowNet:通过对比轨迹平衡实现多样化且鲁棒的 LLM 红队测试 Naver AI 消除了不稳定的…
Naver AI 推出了 Stable-GFlowNet,这是一种通过对比轨迹平衡来消除生成流网络中不稳定的配分函数估计,从而改善 LLM 红队测试的方法。