Granite Speech 5.0 Turbo CTC: 极快且准确的转录

Reddit r/LocalLLaMA 模型

摘要

IBM发布两款新的紧凑型AI模型Granite Speech 5.0 Turbo CTC,用于极快且准确的英语语音转录,在NVIDIA H200 GPU上实现超过12,600 RTFx。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/25 19:56

Granite Speech 5.0 Turbo CTC 带来极速精准的语音转写

来源: https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc

https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#tldr 摘要

今天,我们很高兴宣布在 Granite Speech 家族 (https://huggingface.co/collections/ibm-granite/granite-speech) 中发布两款新模型:紧凑的 470M 参数英语语音识别模型,兼具高准确率和前所未有的速度——在 NVIDIA H200 GPU 上超过 12,600 RTFx,意味着使用批量推理时,每秒可转写超过 3.5 小时的语音。

  1. granite-speech-5.0-470m-turboctc (https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctc)
  2. granite-speech-5.0-470m-turboctc-nc (https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctc-nc)

想体验模型的响应速度,请查看我们的 WebGPU 流式语音识别演示 (https://huggingface.co/spaces/ibm-granite/granite-speech-streaming-webgpu)。请注意,该演示仅支持 Chrome 或 Edge 浏览器。

这两款模型的主要区别在于训练数据和许可证:granite-speech-5.0-470m-turboctc-nc 在额外数据上训练,采用 CC-BY-NC-SA-4.0 (https://creativecommons.org/licenses/by-nc-sa/4.0/deed.en) 许可证;而 granite-speech-5.0-470m-turboctc 在较小的数据集上训练,采用 Apache 2.0 (https://www.apache.org/licenses/LICENSE-2.0) 许可证。

https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#performance 性能

以下是在 公开 的英语短语测试集上的官方结果,数据来自 OpenASR 排行榜 (https://huggingface.co/spaces/hf-audio/open_asr_leaderboard)。如需包含私有数据集的结果,请查看排行榜。

我们提供了柱状图,展示了 ibm-granite/granite-speech-5.0-470m-turboctc-ncibm-granite/granite-speech-5.0-470m-turboctc 的性能,以及用于衡量速度与准确率权衡、模型大小与准确率权衡的帕累托图。两款模型都提供了高准确率,非商业模型的综合词错误率为 4.85%,Apache 2.0 模型为 5.00%,并且两者都拥有超过 12,600 RTFx 的前所未有的综合吞吐量。非商业模型在大多数测试集上的准确率略高于 Apache 2.0 模型,在 SPGI Speech 上优势更明显,但在新的分块 Earnings22 测试上则稍逊一筹。

granite-speech-5.0-470m-turboctc (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/DD6mfdeFY1CimiVmTM-De.png) granite-speech-5.0-470m-turboctc-nc (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/87-ntEjsOlo8gNFFdfgHo.png) 图 1: 截至 2026 年 8 月 25 日,OpenASR 排行榜所用公开测试集的结果。

en_shortform_rtfx_wer_delta (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/PownDm4rkRmUgkQiCDmJz.png) en_shortform_size_wer_delta (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/IL-1QHKG2UJkmMwCXQoH8.png) 图 2: 基于截至 2026 年 8 月 25 日 OpenASR 排行榜公开测试集结果的帕累托图(速度与准确率、模型大小与准确率)。

在 FFASR 排行榜 (https://huggingface.co/spaces/treble-technologies/ffasr) 衡量的远场语音识别方面,两款模型也表现出色。截至 2026 年 8 月 25 日,ibm-granite/granite-speech-5.0-470m-turboctc 在准确率方面排名第九,而 ibm-granite/granite-speech-5.0-470m-turboctc-nc 排名第五,同时两者也是速度最快的模型。请注意,这些是官方结果。

https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#model-architecture 模型架构

这些新模型是纯编码器模型,不同于之前的 Granite Speech 模型 (https://huggingface.co/papers/2505.08699)(后者包含声学编码器、投影器和带有 LoRA 适配器的 Granite LM)。纯编码器设计提供了强大的转写性能、仅 470M 参数的小内存占用,以及比之前 Granite Speech 模型高出 20 多倍的吞吐量。新模型放弃了 LM 模型的一些能力,例如语音翻译和关键词偏置,但它们非常适合在边缘设备上执行语音转文本任务。

Granite 5.0 Speech 模型与之前 Granite Speech 模型中使用的编码器有许多共同点。它们都:

  • 由 16 个 Conformer (https://www.isca-archive.org/interspeech_2020/gulati20_interspeech.html) 块堆叠而成,
  • 在第 8 个块的输出处使用自条件 (self-conditioning) (https://www.isca-archive.org/interspeech_2021/nozaki21_interspeech.html),
  • 采用分块 (chunkwise) (https://arxiv.org/abs/2303.01037) 注意力机制,以避免标准点积注意力中随序列长度呈二次方增长的计算量,并且
  • 在训练期间优化连接主义时序分类 (CTC) (https://dl.acm.org/doi/abs/10.1145/1143844.1143891) 损失。

Granite 5.0 Speech 模型的新颖之处在于,其词元生成率远低于我们之前的编码器,并使用了不同的输出词元化方式。我们之前的编码器每秒生成 50 个字符,而 Granite 5.0 模型每秒生成 12.5 个词元,其中 ibm-granite/granite-speech-5.0-470m-turboctc-nc 使用 SentencePiece 词元化,ibm-granite/granite-speech-5.0-470m-turboctc 使用 BPE 词元化。两种情况下的词元化器都是在语音转录文本上训练的。

为了将对数梅尔频谱图前端 100 帧/秒的速率降至 12.5 词元/秒,我们依赖三个阶段的 2 倍下采样,如下所示。第一阶段(也用于之前 Granite Speech 模型的编码器)通过一个简单的 reshape() 操作,将连续的对数梅尔特征向量堆叠在一起。第二和第三阶段内置于堆叠的前两个 Conformer 块中,它们使用步进卷积来执行时间下采样。

architecture (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/8VKqBxd1eiwsunuagAhvl.png) 图 3: 在构成编码器的 16 个 Conformer 块堆叠中下采样操作的位置。请注意,为清晰起见,此图中省略了自条件部分。

下图展示了执行时间下采样的 Conformer 块与标准 Conformer 块的实现对比。两处更改是:(1)卷积块执行 stride=2 的时间卷积;(2)卷积块的残差通过取连续成对位置的均值来进行时间下采样。标准 Conformer 块遵循 Phil Wang(lucidrains)的实现 (https://github.com/lucidrains/conformer),但使用了分块注意力,并依赖 PyTorch 的 scaled_dot_product_attention() 而非原始的 einsum() 实现。

conformerblocks_inline (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/VA17sLsxu7tkF8YQ7qwlu.png) 图 4: 标准 Conformer 块与下采样 Conformer 块的对比。

https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#training-data 训练数据

Granite Speech 5.0 模型使用自然数据和合成数据的组合进行训练。下表列出了训练中使用的自然数据集,并指明该数据集是用于训练两个模型还是仅用于训练非商业模型。

两款模型还使用三个合成数据集进行训练:

  1. 2000 小时的多说话人数据,通过拼接来自 MLS、YODAS、CommonVoice-17、VoxPopuli 和 AMI 的单说话人片段生成;
  2. 500 小时的多说话人数据,通过拼接来自 Earnings-22 的单说话人片段生成;
  3. 240 小时的语音,包含数字、货币、网站名称、电话号码、地址以及包含小数点或点的项目,使用 gpt-oss-120bgpt-oss-20b 生成,并使用 StyleTTS2 合成。

https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#usage 用法

Granite Speech 5.0 TurboCTC 原生支持于 transformers 库。在下一次 Transformers 版本发布之前,请从源码安装:

pip install git+https://github.com/huggingface/transformers.git datasets
from datasets import Audio, load_dataset
from transformers import AutoModelForCTC, AutoProcessor

model_id = "ibm-granite/granite-speech-5.0-470m-turboctc"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForCTC.from_pretrained(model_id, device_map="auto")

ds = load_dataset("hf-internal-testing/librispeech_asr_dummy", "clean", split="validation")
ds = ds.cast_column("audio", Audio(sampling_rate=processor.feature_extractor.sampling_rate))
speech_samples = [el["array"] for el in ds["audio"][:5]]

# `device` 在模型加速器上计算对数梅尔前端,节省主机到设备的拷贝
inputs = processor(
    speech_samples, sampling_rate=processor.feature_extractor.sampling_rate, device=model.device
)
inputs.to(model.device, dtype=model.dtype)
outputs = model.generate(**inputs)
print(processor.batch_decode(outputs, skip_special_tokens=True))

相似文章

Gemini 3.5 Transcribe 智能转录

Google DeepMind Blog

Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。

handy-computer/transcribe.cpp

GitHub Trending (daily)

transcribe.cpp是一个C/C++语音转文本推理库,通过GGUF格式在ggml运行时上支持16个模型家族和60多种变体,提供GPU后端(Metal、Vulkan、CUDA)和CPU推理。

@NFTCPS: 电诈园区又有新武器用了,语音克隆这块又被卷到新高度了。 LuxTTS,一个轻量级 TTS 模型,我看完只想说三个字:真离谱。 快:单卡 150 倍实时,连 CPU 都能跑得比真人说话还快 清:直接 48khz,大部分模型还卡在 24khz…

X AI KOLs Timeline

LuxTTS 是一个轻量级语音克隆 TTS 模型,支持 48kHz 高清输出,单 GPU 可达 150 倍实时速度,仅需 1GB 显存即可本地运行,性能媲美十倍大的模型。