@DanKornas: 当训练代码、预训练模型和部署运行时分别放在不同地方时,语音识别工作会变得混乱…
摘要
WeNet 是一个开源端到端语音识别工具包,它将训练代码、预训练模型和部署运行时统一在一个项目中,支持多种模型架构和运行时后端。
查看缓存全文
缓存时间: 2026/07/24 17:18
语音识别工作会变得混乱——当训练代码、预训练模型和部署运行环境各自散落在不同地方时。
WeNet 是一个端到端语音识别工具包,专为构建和部署 ASR 系统的工程师设计。
它将音频转录、自定义训练和部署整合在一个项目中,提供 Python 接口、模型选择、训练流程和运行时实现。
主要特性: • CLI 和 Python API – 可从命令行转录音频文件,或在代码中调用 load_model 和 transcribe 进行转录。 • 预训练模型选择 – README 列出了 Paraformer、FireRed、WeNetSpeech 以及 Whisper Large V3 变体。 • 训练流程 – 文档说明了 Conda、CUDA、PyTorch、torchaudio 及依赖项的安装步骤。 • 部署运行时 – 可构建 x86 运行时,并在需要时添加语言模型图工具。 • 运行时选项 – 该仓库提供了 LibTorch、ONNX Runtime、TensorRT、OpenVINO、Raspberry Pi 及其他目标平台的文档。
该项目基于 Apache 2.0 开源许可证发布。
链接见回复
相似文章
@kwindla: https://x.com/kwindla/status/2062544580105359686
NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。
@DanKornas:构建个性化数字人不应需要从不同项目中拼凑预处理、训练和推理……
Ultralight Digital Human 是一个开源 Python 项目,支持从 3-5 分钟的视频中训练一个面向特定人物的音频驱动数字人,并支持 HuBERT/WeNet 音频特征、ONNX 导出和流式推理。
@DanKornas:微调新模型不应意味着从头重建相同的训练笔记本。Unsloth Notebooks 是一个收集…
Unsloth Notebooks 是一个包含 250 多个开源微调和强化学习笔记本的集合,适用于文本、视觉、音频、嵌入和语音模型,提供即用型的 Colab 笔记本,包含数据准备、训练和推理步骤。
@DanKornas:每当每个模型提供者、工具调用、追踪和部署路径都需要单独对接时,构建AI功能就会变得混乱。
Genkit 是一个开源框架,提供统一的模型 API、结构化工作流和多语言 SDK,以简化构建全栈 AI 应用的过程。
@Thom_Wolf: 大多数人都应该更新他们对开源语音到语音技术现状的认知。老实说,这有点令人…
Thom Wolf 和 Cerebras 发布了一个完全开源、带有模型和代码的实时语音演示,展示了最先进的语音到语音能力。