真没想到文本归一化在流式 TTS 里被忽视得这么彻底 [D]
摘要
作者指出流式语音合成中文本归一化被严重低估,并分享了一份厂商基准:用 1000+ 句子、31 个类别(日期、网址、缩写等)测评主流实时 TTS 服务。
挺震惊的,流式 TTS 模型在这种低级错误上居然没人聊。大家天天追求自然度、音质、情感,结果模型一到价格、日期、URL、优惠码、手机号就翻车。我搜资料时发现一个基准,把各家商用实时流式 TTS 拉出来,比它们怎么念日期、网址、缩写等,共 1000 多句、31 类,再用 Gemini 打分判断对错。[https://async-vocie-ai-text-to-speech-normalization-benchmark.static.hf.space/index.html](https://async-vocie-ai-text-to-speech-normalization-benchmark.static.hf.space/index.html) 看着挺靠谱。毕竟是厂商做的,我不会全信,但选题确实扎心——我们在生产环境里被这问题坑惨了。好奇各位实战里都怎么搞?
相似文章
面向语音代理构建者的TTS精选列表 — 聚焦于流式延迟和流中取消
一份面向语音代理构建者的文本转语音资源精选列表,围绕实时流式合成与离线高保真合成之间的选择进行组织,重点强调流式延迟和流中取消。
文本转语音(TTS)基准测试更新:引入客观标准和盲投票(已涵盖46个模型,持续增加中)
更新后的TTS基准测试引入了客观标准和实时盲投票机制,为46+模型创建ELO排名,并向社区开放参与。
TTS基准对比(截至2026年5月的所有已知TTS)
一个用户创建的用于比较本地TTS工具的基准测试,包含Windows和Mac的结果,Linux测试待完成。包含HTML结果页面和GitHub仓库。
ASR-Roundtrip Evaluation Can Mask Context- and Convention-Dependent Reading Errors in Chinese News TTS
This paper studies a failure mode in ASR-roundtrip evaluation for Chinese news TTS, showing that fluency errors in context-dependent reading decisions can be masked by ASR surface recovery. A targeted audit across TTS and ASR systems quantifies these false negatives and proposes a human-audited protocol.
简单的语言归一化方法获胜:面向TidyVoice 2026挑战的跨语言说话人验证
本文提出了一种简单的语言归一化方法,使用干扰属性投影(NAP)进行跨语言说话人验证,在TidyVoice2026挑战中实现了显著的错误率降低。