@DanKornas: 当训练代码、预训练模型和部署运行时分别放在不同地方时,语音识别工作会变得混乱…

X AI KOLs Timeline 工具

摘要

WeNet 是一个开源端到端语音识别工具包,它将训练代码、预训练模型和部署运行时统一在一个项目中,支持多种模型架构和运行时后端。

当训练代码、预训练模型和部署运行时分别存放在不同地方时,语音识别工作会变得混乱。 WeNet 是一个面向构建和部署 ASR 系统的工程师的端到端语音识别工具包。 它通过将 Python 接口、模型选项、训练设置和运行时实现整合到一个项目中,帮助你从音频转录过渡到自定义训练和部署。 主要特性: • CLI 和 Python API – 从命令行转录音频文件,或在代码中调用 load_model 并进行转录。 • 预训练模型选择 – README 中列出了 Paraformer、FireRed、WeNetSpeech 以及 Whisper Large V3 等变体。 • 训练工作流 – 文档记录了 Conda、CUDA、PyTorch、torchaudio 及依赖设置。 • 部署运行时 – 构建 x86 运行时,并在需要时添加语言模型图工具。 • 运行时选项 – 仓库文档中记录了 LibTorch、ONNX Runtime、TensorRT、OpenVINO、Raspberry Pi 及其他目标。 它是开源的(Apache 2.0 许可证)。 链接在回复中
查看原文
查看缓存全文

缓存时间: 2026/07/24 17:18

语音识别工作会变得混乱——当训练代码、预训练模型和部署运行环境各自散落在不同地方时。

WeNet 是一个端到端语音识别工具包,专为构建和部署 ASR 系统的工程师设计。

它将音频转录、自定义训练和部署整合在一个项目中,提供 Python 接口、模型选择、训练流程和运行时实现。

主要特性: • CLI 和 Python API – 可从命令行转录音频文件,或在代码中调用 load_model 和 transcribe 进行转录。 • 预训练模型选择 – README 列出了 Paraformer、FireRed、WeNetSpeech 以及 Whisper Large V3 变体。 • 训练流程 – 文档说明了 Conda、CUDA、PyTorch、torchaudio 及依赖项的安装步骤。 • 部署运行时 – 可构建 x86 运行时,并在需要时添加语言模型图工具。 • 运行时选项 – 该仓库提供了 LibTorch、ONNX Runtime、TensorRT、OpenVINO、Raspberry Pi 及其他目标平台的文档。

该项目基于 Apache 2.0 开源许可证发布。

链接见回复

相似文章

@kwindla: https://x.com/kwindla/status/2062544580105359686

X AI KOLs Timeline

NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。