在 Coval 的公开基准测试中运行我们的 Apache 2.0 Gepard TTS,在单个 RTX 4090 上首次音频延迟为 68.7 毫秒。

Reddit r/LocalLLaMA 新闻

摘要

本文报告了对 Gepard 1.0 文本转语音模型的基准测试,在单个 RTX 4090 GPU 上实现了 68.7 毫秒的首次音频延迟,在延迟方面优于多个商业 API,同时基于 Apache 2.0 开源。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/26 17:25

# Coval TTS基准测试:Gepard 对比25个API 来源:https://www.nineninesix.ai/blog/gepard-coval-tts-leaderboard 我们使用Coval公开的TTS测试工具,将Gepard 1.0与列表中的25个API进行了对比测试。首次音频出现时间为68.7毫秒,开头静默20.5毫秒,30个样本中零错误。 Coval维护着一个公开的文本转语音排行榜,其背后的测试工具是开源的。2025年8月25日,我们用它测试了自己的生产环境API,看看在公开榜单的25个API面前,Gepard 1.0的实际表现如何。 以下是测试结果,30个样本,零错误:**首次音频出现时间中位数68.7毫秒,90分位数85.8毫秒,最差情况104.8毫秒,音频开头静默20.5毫秒,词错率5.23%。** 这些数据由我们自己测量,从`us-west-1`区域访问位于加利福尼亚的端点。公开榜单的数据由Coval从`us-east1`区域测量,访问其他厂商的端点。阅读时请注意一个不对称点:我们的数据已归一化了网络往返时间(在我的路径上为2.8毫秒),而公开行的数据没有归一化,因此仍包含Coval运行器所在路径的延迟。这对我们两端都有利。虽然相比表格中的差距这是个小效应,但你应知道其存在。 有一点需要明确说明,而不是埋没在方法说明中:生产环境的所有服务都运行在单张RTX 4090显卡上。不是机架,不是数据中心加速器,而是一张可以在零售店花几千美元买到的显卡。这是结果中真正可复制的部分,因为权重采用Apache 2.0许可,硬件也唾手可得。 **比所有公开结果都低,且网络路径更短。**这句话的两部分都很重要,因此用一张表格同时列出,而非排名。表格展示了26行中的14行,包括排行榜中最快的几个以及大多数人实际在比较的名称。表格数据来源于Coval公开端点2025年8月25日的读数,窗口期为滚动7天,因此数据每天会有毫秒级的微小波动。 模型|首次音频时间中位数|首次音频时间90分位数|开头静默|词错率 ---|---|---|---|--- **nineninesix/gepard-1.0**<br>(我们,us-west-1,Apache 2.0)|**68.7**|**85.8**|**20.5**|5.23% fluxions/vui (Apache 2.0)|102|144|21|6.20% palabra/palabra-tts-v1|105|132|1|5.96% inworld/inworld-tts-2-flash|111|156|484|4.81% inworld/inworld-tts-2|162|210|554|4.65% lmnt/blizzard2|183|395|97|7.72% soniox/tts-rt-v2|228|253|773|3.94% soniox/tts-rt-v1|229|261|753|3.72% rime/mistv3|253|273|1345|5.86% cartesia/sonic-3.5|272|328|131|5.89% deepgram/aura-2-thalia-en|288|503|148|5.48% google/chirp-3-hd|494|807|344|5.11% murf/falcon-25|576|734|585|5.37% openai/gpt-4o-mini-tts|778|2854|334|4.81% 26个文本转语音模型首次音频时间中位数水平条形图,nineninesix gepard-1.0位于顶部,标注为从us-west-1测量 对延迟列的诚实解读:我们这行的网络跳转已归一化(在我的路径上为2.8毫秒),而其他行仍包含从`us-east1`到各厂商端点的路径成本。我方68.7毫秒与Cartesia的272毫秒之间的差异是真实的,但不能简单视为4倍差距。最右侧两列可以直接比较,因为它们不受你所在位置的影响。 需要说明的是,未知因素双向存在。榜单上没有厂商公布每个请求由哪个区域提供服务,其中几家是加利福尼亚的公司,因此一些灰色行是在短路径上测量,一些是在长路径上测量。从公开数据(包括我们自己)都无法得知具体情况。 13个最快模型首次音频时间90分位数水平条形图 90分位数列值得重点关注。Deepgram从288毫秒(中位数)到503毫秒(90分位数);OpenAI从778毫秒到2854毫秒;Gepard从68.7毫秒到85.8毫秒,30个样本中最差的单次测试为104.8毫秒。尾部延迟保持在105毫秒左右,这区分了总感觉即时的语音代理和只在多数时候感觉即时的语音代理。 **开头静默和词错率。**两者都是事后从音频文件中读取的,因此无论从哪里运行测试工具,结果都相同。 这不是断言,而是我们验证过的。从第三个位置运行测试工具访问Cartesia和Gradium,其静默数据与公开数据误差在5毫秒内:Cartesia测得127毫秒(榜单为131毫秒),Gradium测得164毫秒(榜单为167毫秒)。相同工具,相同答案,来自完全不同的位置。 26个模型开头静默水平条形图,nineninesix为20.5毫秒,位于第五名 因此,这两个排名我们当仁不让: - **开头静默20.5毫秒,26个模型中排名第五。**优于Cartesia(131毫秒)、Deepgram(148毫秒)、Google(344毫秒)和Murf(458毫秒)。逊于Palabra(1毫秒)、三个Fish Audio实例中的两个(7毫秒)和Speechify Simba 3.2(20毫秒)。Murf在说话前有近半秒的静默。 - **词错率5.23%,26个模型中排名第十八。**中游水平。优于Cartesia(5.89%)和Deepgram(5.48%),逊于Soniox v1(3.72%)和Gradium(4.57%)。该数字的具体含义将在下文详述。 **首次音频到达时间包含开头任何静默。**几乎所有厂商的延迟页面都计算到第一个字节为止就停止。这种差异不是学术性的,我们曾因此栽过跟头。 感知首次音频时间分解时间轴图,分为48.6毫秒服务器计算和20.5毫秒开头静默,字节到达标记位于听众实际听到声音之前 我们一个中间构建版本在所有传输指标上都看似胜出。字节到达速度前所未有,第一个数据块用时52.9毫秒。但这些字节的前289毫秒是静音,因此感知首次音频时间上升至382毫秒,所有30个样本都比上一个版本更差。词错率不变,为5.29%,证实语音本身完好,只是音频被填充了静音。 那个构建版本会在我们自己的延迟基准测试(https://www.nineninesix.ai/blog/tts-latency-benchmark-websocket-2026)中提升头条数字,同时使产品对呼叫者而言糟糕5.6倍。只有度量首次可听能量的指标才能发现这点。我们用独立的RMS扫描验证了该发现,而非仅信任测试工具自身的静音检测器,两者结果在2毫秒内一致。 如果你正在评估厂商,这是最值得借鉴的一点:度量首次可听能量,而非首个字节。 **我们移动了方框。**这是完整答案,也是榜单上灰色行厂商无法反驳的一点。 68.7毫秒在网络归一化后构成的水平条形图:48.6毫秒由硬件驱动的服务器计算,20.5毫秒由模型驱动的开头静默 从68.7毫秒的构成开始,因为它比你想象的更简单。48.6毫秒是服务器端成本,从请求发出到首个字节返回;20.5毫秒是音频开头的静默。两者相加就是完整数字。网络不是第三部分,它已经归一化了,在我的路径上只有2.8毫秒,因为测试工具主机和生产环境位于同一区域。 因此,加利福尼亚端点不是数字小的原因。从另一海岸运行相同测试工具访问同一个盒子,会增加真实的跨大陆跳转,大约相当于我们测量到的49毫秒往返时间,但你那时是在测量两台计算机之间的距离,而非模型。公开行恰恰存在这个未标记的问题:Coval为每个模型记录一个粗略区域,本表所有行都是`us`,没有更细粒度。 因此,与其争论,不如提供这个方案。指定一个区域。我们将在该区域部署一个盒子,你可以在任何地方运行Coval的测试工具,访问靠近你而非靠近我们的端点。计算和静默保持不变,因为它们属于模型本身。对我们而言,这是部署,而非路线图项目。如果你完全不想等我们,权重是Apache 2.0许可,盒子可以属于你。 **它会正好削减一半数字,而更有趣的一半不会移动。**将68.7拆分为48.6的计算和20.5的静默不仅是记账,它告诉你金钱能买来什么。 计算是硬件买来的。我们在数据中心级Blackwell部件上运行相同构建版本,计算部分减少约18毫秒,使中位数接近53毫秒。开头静默完全不动,因为那是模型决定何时开始说话,再多GPU也修不好一个先清嗓子的模型。 生产环境有意停留在4090上。开放权重模型的意义不在于我们买得起好硬件,而在于你不需要任何好硬件。一张零售价几千美元的显卡已处于此表顶部,其上的上限真实存在,但争论点不在那里。 **有一个,而且它就在排行榜顶部。**公开TTS排行榜上最快的公开行是fluxions/vui,耗时101.7毫秒,而Vui是一个300M模型,其代码和检查点都在Hugging Face上,采用Apache 2.0许可。不是拥有私有检查点的融资API厂商。一个小开放模型,击败了榜单上它与之对比的所有商业行。 Coval自己的注册表可能会显示不同,了解原因后再引用为宜。注册表有一个`licensing`字段,默认为专有,只有一个TTS条目明确设置了它:通过Baseten提供的阿里巴巴Qwen3-TTS,该服务处于早期访问状态,在公开网站上隐藏。Vui根本没有这行,因此继承默认值,显示为专有。这个字段是有人记得设置的标签,而非关于模型的事实。 Fish Audio是另一个需要仔细考量的案例。他们确实发布了权重:s1-mini采用CC BY-NC-SA许可,s2-pro采用Fish Audio研究许可。两者都在没有单独书面协议的情况下禁止商业使用,而且榜单上都不是它们,而是托管的s1和s2.1-pro。阿里巴巴情况类似,一边是开放的Qwen3-TTS检查点,另一边是封闭的托管行。发布权重和可用权重是不同的主张,我们对自己较老的模型也不得不做此区分。 因此,诚实计数是26行中有2行Apache 2.0(Vui和Gepard),24个封闭API。这是本次练习中经得起任何关于网络路径争论的部分。你可以质疑从不同区域测量的延迟数字,但无法质疑许可证。你通过我们API测试的模型,与你可以在自己硬件上运行的模型是同一个。榜单上大多数其他行是租赁:如果厂商改变声音、提高价格或淘汰模型,你只能迁移。 在两个不受测量位置影响的指标上,两个开放行接近。我们开头静默20.5毫秒,Vui为21毫秒,平局。词错率5.23%对6.20%,是真实差距但非溃败。我们宁愿是两个中的一个,而非唯一一个:开放条目具有竞争力的排行榜,比我们任何单一结果都更能证明开放权重的价值。 硬件也不是护城河。本文开头所有内容都来自一张消费级GPU,因此“自己运行”是周二下午的消遣,而非采购周期。 我们另文撰写了开放权重真正给你带来什么(https://www.nineninesix.ai/blog/open-weights-vs-closed-tts-vendors)以及Gepard为何运行在vLLM上(https://www.nineninesix.ai/blog/why-gepard-runs-on-vllm),后者使自托管成为常规部署而非研究项目。 我们的词错率为5.23%,30个提示中18个转录完全正确。在深入解读此数字或他人数字前,看看评分器对时钟时间的处理: ``` 来源 ...yesterday around 11:30 PM. whisper-1 ...yesterday around 11.30 p.m. -> 35.7% WER gpt-4o ...yesterday around 11:30 PM. -> 0.0% WER ``` 相同音频,两次评分,其中一个数字是拼写惯例。基准测试将Whisper转录稿与归一化后的源文本比较,而归一化器不协调时钟时间格式。使用两种转录器重新评分所有30个提示,`whisper-1`为4.57%,`gpt-4o-transcribe`为2.41%。大约一半测量误差来自仪器本身。 我们仍认为`whisper-1`是合适的公开评分器,因为排行榜上所有数字都使用它,更改会使我们的结果无法与场内其他数据比较。纯属拼写差异的2个百分点提升不是真正胜利。第二个转录器的更实用角色是作为分歧检测器:当两个独立识别器都认为某个词错误时,去听一下。 测试工具位于`github.com/coval-ai/benchmarks`,数据集包含在wheel文件中,因此如果你绕过协调器,无需云存储或数据库。 ``` git clone https://github.com/coval-ai/benchmarks # 添加 runner/src/coval_bench/providers/tts/nineninesix.py export NINENINESIX_API_KEY=... uv run python -m coval_bench run --benchmark TTS --dataset tts-v1 \ --only nineninesix/gepard-1.0 ``` 在读取自己的数字前,有一点值得了解:我们的API网关在快速路径上增加0.0毫秒延迟(通过与模型服务器直接连接的中位数测量),因此测试工具测量的是模型而非我们的管道。 测试工具不计算(对我们和榜单上其他人一样):计时从WebSocket打开时开始。所有流式提供商都以此方式测量,因此行间比较是公平的,但为每轮通话打开新连接的呼叫者将比此页任何数字多支付约150毫秒。保持套接字打开。这对榜单上所有厂商都成立,它将比顶部几行之间的选择消耗更多延迟。 提供商是官方`cartesia`SDK指向不同主机,因为我们的API使用Cartesia线路协议(https://www.nineninesix.ai/blog/tts-api-pricing-comparison-2026)。有两点不同:请求音频时使用Gepard原生的22050 Hz采样率,因为请求8000或16000 Hz会让服务器重采样;不发送`language`字段,因为此处的语言是声音属性而非请求属性。 公开聚合端点本身值得了解: ``` GET https://benchmarks-api-6wxgp27p2a-ue.a.run.app/v1/results/aggregates ?benchmark=TTS&window=7d&dataset=tts-v1 ``` `benchmark`必须大写。这个单一调用返回所有竞争者的中位数、90分位数、95分位数、开头静默和词错率,这是厂商候选名单比任何厂商自身页面(包括我们)更好的起点。 我们的延迟数字是我们从自己区域测量的。它们是跟踪我们自身时间漂移以及比较不同构建版本的正确基础,这正是发现上述填充静音构建的方法。它们不是在Coval榜单上的立场,我们不会将其包装成那样。解决办法是让Coval来运行,这是我们待办事项的下一项。 我们这行样本数n=30。公开行每个最多汇集约3350个样本,最新几个远少于此。30个样本能清晰解析大效应,比如预期的4个慢请求实际为0,但它们只能将罕见失败率约束到约11%以下。罕见不等于固定,我们不会假装30个样本能确定尾部行为。更多样本是我们希望Coval而非我们自己运行的另一个原因。 表格最右侧两列是争论点。开头静默和词错率从音频文件读取,因此无论谁从哪里运行测试工具,数字都相同。如果你想验证其中一个,

相似文章