Granite Speech 5.0 Turbo CTC: 极快且准确的转录
摘要
IBM发布两款新的紧凑型AI模型Granite Speech 5.0 Turbo CTC,用于极快且准确的英语语音转录,在NVIDIA H200 GPU上实现超过12,600 RTFx。
查看缓存全文
缓存时间: 2026/08/25 19:56
Granite Speech 5.0 Turbo CTC 带来极速精准的语音转写
来源: https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc
https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#tldr 摘要
今天,我们很高兴宣布在 Granite Speech 家族 (https://huggingface.co/collections/ibm-granite/granite-speech) 中发布两款新模型:紧凑的 470M 参数英语语音识别模型,兼具高准确率和前所未有的速度——在 NVIDIA H200 GPU 上超过 12,600 RTFx,意味着使用批量推理时,每秒可转写超过 3.5 小时的语音。
- granite-speech-5.0-470m-turboctc (https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctc)
- granite-speech-5.0-470m-turboctc-nc (https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctc-nc)
想体验模型的响应速度,请查看我们的 WebGPU 流式语音识别演示 (https://huggingface.co/spaces/ibm-granite/granite-speech-streaming-webgpu)。请注意,该演示仅支持 Chrome 或 Edge 浏览器。
这两款模型的主要区别在于训练数据和许可证:granite-speech-5.0-470m-turboctc-nc 在额外数据上训练,采用 CC-BY-NC-SA-4.0 (https://creativecommons.org/licenses/by-nc-sa/4.0/deed.en) 许可证;而 granite-speech-5.0-470m-turboctc 在较小的数据集上训练,采用 Apache 2.0 (https://www.apache.org/licenses/LICENSE-2.0) 许可证。
https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#performance 性能
以下是在 公开 的英语短语测试集上的官方结果,数据来自 OpenASR 排行榜 (https://huggingface.co/spaces/hf-audio/open_asr_leaderboard)。如需包含私有数据集的结果,请查看排行榜。
我们提供了柱状图,展示了 ibm-granite/granite-speech-5.0-470m-turboctc-nc 和 ibm-granite/granite-speech-5.0-470m-turboctc 的性能,以及用于衡量速度与准确率权衡、模型大小与准确率权衡的帕累托图。两款模型都提供了高准确率,非商业模型的综合词错误率为 4.85%,Apache 2.0 模型为 5.00%,并且两者都拥有超过 12,600 RTFx 的前所未有的综合吞吐量。非商业模型在大多数测试集上的准确率略高于 Apache 2.0 模型,在 SPGI Speech 上优势更明显,但在新的分块 Earnings22 测试上则稍逊一筹。
granite-speech-5.0-470m-turboctc (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/DD6mfdeFY1CimiVmTM-De.png) granite-speech-5.0-470m-turboctc-nc (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/87-ntEjsOlo8gNFFdfgHo.png) 图 1: 截至 2026 年 8 月 25 日,OpenASR 排行榜所用公开测试集的结果。
en_shortform_rtfx_wer_delta (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/PownDm4rkRmUgkQiCDmJz.png) en_shortform_size_wer_delta (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/IL-1QHKG2UJkmMwCXQoH8.png) 图 2: 基于截至 2026 年 8 月 25 日 OpenASR 排行榜公开测试集结果的帕累托图(速度与准确率、模型大小与准确率)。
在 FFASR 排行榜 (https://huggingface.co/spaces/treble-technologies/ffasr) 衡量的远场语音识别方面,两款模型也表现出色。截至 2026 年 8 月 25 日,ibm-granite/granite-speech-5.0-470m-turboctc 在准确率方面排名第九,而 ibm-granite/granite-speech-5.0-470m-turboctc-nc 排名第五,同时两者也是速度最快的模型。请注意,这些是官方结果。
https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#model-architecture 模型架构
这些新模型是纯编码器模型,不同于之前的 Granite Speech 模型 (https://huggingface.co/papers/2505.08699)(后者包含声学编码器、投影器和带有 LoRA 适配器的 Granite LM)。纯编码器设计提供了强大的转写性能、仅 470M 参数的小内存占用,以及比之前 Granite Speech 模型高出 20 多倍的吞吐量。新模型放弃了 LM 模型的一些能力,例如语音翻译和关键词偏置,但它们非常适合在边缘设备上执行语音转文本任务。
Granite 5.0 Speech 模型与之前 Granite Speech 模型中使用的编码器有许多共同点。它们都:
- 由 16 个 Conformer (https://www.isca-archive.org/interspeech_2020/gulati20_interspeech.html) 块堆叠而成,
- 在第 8 个块的输出处使用自条件 (self-conditioning) (https://www.isca-archive.org/interspeech_2021/nozaki21_interspeech.html),
- 采用分块 (chunkwise) (https://arxiv.org/abs/2303.01037) 注意力机制,以避免标准点积注意力中随序列长度呈二次方增长的计算量,并且
- 在训练期间优化连接主义时序分类 (CTC) (https://dl.acm.org/doi/abs/10.1145/1143844.1143891) 损失。
Granite 5.0 Speech 模型的新颖之处在于,其词元生成率远低于我们之前的编码器,并使用了不同的输出词元化方式。我们之前的编码器每秒生成 50 个字符,而 Granite 5.0 模型每秒生成 12.5 个词元,其中 ibm-granite/granite-speech-5.0-470m-turboctc-nc 使用 SentencePiece 词元化,ibm-granite/granite-speech-5.0-470m-turboctc 使用 BPE 词元化。两种情况下的词元化器都是在语音转录文本上训练的。
为了将对数梅尔频谱图前端 100 帧/秒的速率降至 12.5 词元/秒,我们依赖三个阶段的 2 倍下采样,如下所示。第一阶段(也用于之前 Granite Speech 模型的编码器)通过一个简单的 reshape() 操作,将连续的对数梅尔特征向量堆叠在一起。第二和第三阶段内置于堆叠的前两个 Conformer 块中,它们使用步进卷积来执行时间下采样。
architecture (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/8VKqBxd1eiwsunuagAhvl.png) 图 3: 在构成编码器的 16 个 Conformer 块堆叠中下采样操作的位置。请注意,为清晰起见,此图中省略了自条件部分。
下图展示了执行时间下采样的 Conformer 块与标准 Conformer 块的实现对比。两处更改是:(1)卷积块执行 stride=2 的时间卷积;(2)卷积块的残差通过取连续成对位置的均值来进行时间下采样。标准 Conformer 块遵循 Phil Wang(lucidrains)的实现 (https://github.com/lucidrains/conformer),但使用了分块注意力,并依赖 PyTorch 的 scaled_dot_product_attention() 而非原始的 einsum() 实现。
conformerblocks_inline (https://cdn-uploads.huggingface.co/production/uploads/66f1769e8da6d3e95420fb6d/VA17sLsxu7tkF8YQ7qwlu.png) 图 4: 标准 Conformer 块与下采样 Conformer 块的对比。
https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#training-data 训练数据
Granite Speech 5.0 模型使用自然数据和合成数据的组合进行训练。下表列出了训练中使用的自然数据集,并指明该数据集是用于训练两个模型还是仅用于训练非商业模型。
两款模型还使用三个合成数据集进行训练:
- 2000 小时的多说话人数据,通过拼接来自 MLS、YODAS、CommonVoice-17、VoxPopuli 和 AMI 的单说话人片段生成;
- 500 小时的多说话人数据,通过拼接来自 Earnings-22 的单说话人片段生成;
- 240 小时的语音,包含数字、货币、网站名称、电话号码、地址以及包含小数点或点的项目,使用
gpt-oss-120b或gpt-oss-20b生成,并使用StyleTTS2合成。
https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc#usage 用法
Granite Speech 5.0 TurboCTC 原生支持于 transformers 库。在下一次 Transformers 版本发布之前,请从源码安装:
pip install git+https://github.com/huggingface/transformers.git datasets
from datasets import Audio, load_dataset
from transformers import AutoModelForCTC, AutoProcessor
model_id = "ibm-granite/granite-speech-5.0-470m-turboctc"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForCTC.from_pretrained(model_id, device_map="auto")
ds = load_dataset("hf-internal-testing/librispeech_asr_dummy", "clean", split="validation")
ds = ds.cast_column("audio", Audio(sampling_rate=processor.feature_extractor.sampling_rate))
speech_samples = [el["array"] for el in ds["audio"][:5]]
# `device` 在模型加速器上计算对数梅尔前端,节省主机到设备的拷贝
inputs = processor(
speech_samples, sampling_rate=processor.feature_extractor.sampling_rate, device=model.device
)
inputs.to(model.device, dtype=model.dtype)
outputs = model.generate(**inputs)
print(processor.batch_decode(outputs, skip_special_tokens=True))
相似文章
Gemini 3.5 Transcribe 智能转录
Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。
handy-computer/transcribe.cpp
transcribe.cpp是一个C/C++语音转文本推理库,通过GGUF格式在ggml运行时上支持16个模型家族和60多种变体,提供GPU后端(Metal、Vulkan、CUDA)和CPU推理。
@thesupermanmx: NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,而且成本为零。这真是太快了……
NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,支持从单一检查点进行多种语言转录,并内置标点和大小写功能。
@NFTCPS: 电诈园区又有新武器用了,语音克隆这块又被卷到新高度了。 LuxTTS,一个轻量级 TTS 模型,我看完只想说三个字:真离谱。 快:单卡 150 倍实时,连 CPU 都能跑得比真人说话还快 清:直接 48khz,大部分模型还卡在 24khz…
LuxTTS 是一个轻量级语音克隆 TTS 模型,支持 48kHz 高清输出,单 GPU 可达 150 倍实时速度,仅需 1GB 显存即可本地运行,性能媲美十倍大的模型。
Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能模型
IBM 发布 Granite 4.0 3B Vision,这是一款专为理解企业文档而设计的紧凑型视觉语言模型,具备表格提取、基于 ChartNet 的图表解读以及键值对 grounding 等专业能力。