MoVE:通过语音专家混合模型在语音到语音翻译中保留笑声与哭泣
摘要
MoVE 提出一种 Mixture-of-LoRA-Experts 架构,在仅 30 分钟精选数据下即可在语音到语音翻译中保留 76% 的非语言发声(笑声、哭泣)。
查看缓存全文
缓存时间: 2026/04/22 14:41
论文页面 - MoVE:通过混合发声专家在语音到语音翻译中传递笑声与泪水
来源:https://huggingface.co/papers/2604.17435
发布于 4 月 19 日
·
由 https://huggingface.co/47z 提交
陳思齊 (https://huggingface.co/47z) 于 4 月 22 日
摘要
MoVE 采用“混合 LoRA 专家”架构,配备情感专用适配器与软加权路由器,可在仅使用极少精选数据的前提下,实现高自然度、高情感保真的语音到语音翻译,同时保留非语言发声。
近期语音到语音翻译(Speech-to-Speech Translation, S2ST)系统虽语义准确,却普遍滤除笑声、哭泣等传递语用意图的非语言发声(non-verbal vocalizations, NVs),严重削弱其实用性。我们提出三项贡献:
- 构建可扩展情感数据集的合成管线,解决数据稀缺难题;
- 提出 MoVE——混合 LoRA 专家架构,含情感专用适配器与软加权路由器,融合多位专家以捕捉复合情感状态;
- 证明预训练 AudioLLM 具备惊人数据效率:仅需 30 分钟精选数据即可取得强劲表现。
在英中 S2ST 任务上,与强基线对比,MoVE 在 76% 的样本中成功再现目标 NVs,人类评分自然度与情感保真度均居首位,而现有 S2ST 系统最多仅保留 14% 的 NVs。
查看 arXiv 页面 (https://arxiv.org/abs/2604.17435)
查看 PDF (https://arxiv.org/pdf/2604.17435)
GitHub0 (https://github.com/47zzz/MoVE)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.17435)
在智能体中阅读本文:
hf papers read 2604.17435
未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2604.17435 即可在此显示。
引用该论文的数据集 0
暂无数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.17435 即可在此显示。
引用该论文的 Spaces 0
暂无 Space 链接该论文
在 Space README.md 中引用 arxiv.org/abs/2604.17435 即可在此显示。
收录该论文的合集 0
暂无合集收录该论文
将该论文加入合集 (https://huggingface.co/new-collection) 即可在此显示。
相似文章
基于资源感知的语音编码器混合体打破多对多语音到文本翻译中的多语言诅咒
本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。
MoLGE:混合语言组专家实现大规模多语言语音识别的高效扩展
MoLGE在混合专家框架中为相似语言簇分配专用专家模块,用于大规模多语言ASR,在参数增加极小的情况下提升495种语言的性能。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
VTaMo: 用于手语翻译的视频-文本对齐模型
VTaMo 引入了显式的多粒度视频-文本对齐方法,通过最优传输和对比学习实现手语翻译,在四个基准测试上取得了最先进的性能。
Mixture-of-Translators: 跨异构大语言模型的KV缓存翻译
本文介绍了Mixture-of-Translators(MoT),一个跨异构大语言模型翻译KV缓存的框架,使得不同架构之间能够复用缓存。实验表明,在Qwen2.5、GPT-2和OPT模型上,问答性能和长上下文质量得以保持。