@svpino: 这个新模型做了一件很酷的事:它能在你说话时将语音转换为文本。这与其他所有a…
摘要
R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。
查看缓存全文
缓存时间: 2026/09/21 05:31
这款新模型实现了一个非常酷的功能:在说话时将语音实时转换为文本。这与其他所有音频模型都不同。该模型名为R2T2。它能分块处理音频,并判断哪些词汇需要立即发布,哪些需要更多上下文信息。Hugging Face链接:https://huggingface.co/netease-youdao/Confucius4-R2T2…
netease-youdao/Confucius4-R2T2 · Hugging Face
来源:https://huggingface.co/netease-youdao/Confucius4-R2T2
Confucius4-R2T2
Confucius4-R2T2:低延迟高精度实时语音识别模型
真正的实时转录
GitHub仓库:https://github.com/netease-youdao/Confucius4-R2T2
中文README:https://github.com/netease-youdao/Confucius4-R2T2/blob/master/README.zh.md
模型许可:网易模型使用许可协议:https://raw.githubusercontent.com/netease-youdao/Confucius4-R2T2/refs/heads/master/MODEL_LICENSE
代码许可:Apache 2.0:https://github.com/netease-youdao/Confucius4-R2T2/blob/master/LICENSE
在线演示:https://r2t2.youdao.com/demo
Hugging Face模型:https://huggingface.co/netease-youdao/Confucius4-R2T2
ModelScope模型:https://modelscope.cn/models/netease-youdao/Confucius4-R2T2
R2T2官网:https://r2t2.ai/
Confucius4-R2T2 是一款低延迟、高精度的真正流式自动语音识别(ASR)模型,支持从 80 毫秒到 2 秒的细粒度、可配置解码块。该模型采用仅追加输出模式:转录文本一旦输出即永久确认,不会修改先前输出的词语。这对于文本需要即时处理或执行的应用至关重要,能够提供更流畅的用户体验,避免在实时应用(如实时字幕与字幕制作、下游自然语言处理流程与大语言模型智能体、同步语音翻译等)中出现破坏性的文本修订和视觉闪烁。
R2T2 是 Real Real-Time Transcription(真正的实时转录)的缩写,基于 Qwen3-ASR 模型构建。它使用了一套独特的数据构建技术进行训练,包括稳定前缀数据、强制时间对齐数据和 token 级音频分割。结合最长稳定前缀(LSP)学习范式(技术报告即将发布),R2T2 能够动态判断何时可以安全输出稳定前缀,以及何时需要更多音频上下文。通过仅暴露稳定前缀,模型提供了高质量的上下文来调节后续预测,同时保证先前输出的文本保持不变。尽管采用了流式设计,R2T2 在离线识别中仍保持高精度。
- 低延迟高精度流式识别 —— 模型精度接近离线识别,平均延迟仅为 200 至 600 毫秒。
- 稳定的流式输出 —— 文本输出即确认,保持不变。
- 可配置的低延迟分块 —— 支持从 80 毫秒到 2 秒的解码块,以适应不同的延迟/精度权衡。
- 离线精度无损失 —— 添加流式支持不会降低离线识别精度。
- vLLM 后端 —— 提供高吞吐量推理。也可使用 Hugging Face
transformers后端。 - 上下文与热词提示 —— 原生支持。
- 多语言支持 —— 针对中文和英文优化,同时支持广泛的其他语言。
实验结果表明,R2T2 在一系列开源模型中,在延迟和识别质量方面均达到最先进(SOTA)水平,同时与领先的闭源系统相比也具有竞争力。
GitHub仓库(https://github.com/netease-youdao/Confucius4-R2T2)提供推理代码、最小使用示例以及支持离线和实时流式推理的基于 vLLM 的后端。
目录
概述
Confucius4-R2T2 框架
图 1. R2T2 整体框架。
演示
与 GPT-Live-Transcribe 并排对比
您的浏览器不支持内嵌视频。
图 2. GPT-Live-Transcribe 和 R2T2 处理同一音频的实时并排对比。
附加资源
更多演示、对比和支持资源将陆续添加至此处。
评估
如果您是这些对比中包含的模型的作者或维护者,对结果有任何疑问或关注,请随时通过 GitHub issue tracker 联系我们。我们很乐意分享评估细节并与您合作验证或修正它们。
流式性能
流式 API 支持从 80 毫秒到 2 秒的解码块;下图展示了在 160 毫秒下的代表性词错误率(WER)/延迟权衡。
英文 WER 与不同 ASR 模型和配置的回溯分块延迟对比
图 3. 不同模型和配置下的英文 WER 和回溯分块延迟。
中文字错误率(CER)与不同 ASR 模型和配置的回溯分块延迟对比
图 4. 不同模型和配置下的中文 CER 和回溯分块延迟。
代表性流式 ASR 配置的英文和中文精度-延迟帕累托前沿
图 5. 精度-延迟帕累托前沿。越靠近左下角越好;前沿使用回溯分块平均模糊延迟。
精度
英文结果使用 WER(%),中文结果使用 CER(%);数值越低越好。
※ 伪流式模型:其部分转录可能修改先前输出的文本;未标注的模型使用真正的流式、仅追加输出。
英文
| 数据集 | Qwen | R2T2 (Ours) 160ms | 开源 2s/u2/t5 | 专有 Qwen3-ASR※ | Qwen3-ASR base 160ms | X-ASR 160ms | WhisperRT※ 200ms | Nemotron 160ms | Voxtral 160ms | AssemblyAI※ min_latency | 商业 A※ | 商业 B※ |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AMI | 9.25 | 11.37 | 24.79 | 14.41 | 24.19 | 18.11 | 15.94 | 12.00 | 13.27 | 8.44 | - | - |
| Giga-clean | 8.61 | 9.60 | 24.37 | 10.26 | 13.81 | 12.67 | 11.13 | 9.21 | 8.84 | 9.46 | - | - |
| LS-clean | 1.67 | 2.13 | 22.30 | 3.86 | 4.70 | 3.71 | 2.49 | 1.89 | 1.73 | 1.25 | - | - |
| LS-other | 3.54 | 4.88 | 25.74 | 9.64 | 9.86 | 8.27 | 7.15 | 3.37 | 3.57 | 2.48 | - | - |
| SPGI | 2.90 | 3.00 | 22.25 | 5.14 | 8.66 | 3.93 | 3.06 | 2.14 | 3.06 | 1.74 | - | - |
| VoxPopuli | 3.02 | 3.07 | 20.71 | 5.68 | 8.28 | 5.69 | 6.30 | 4.75 | 3.17 | 3.14 | - | - |
| Earnings22 | 6.68 | 9.36 | 29.72 | 15.95 | 35.08 | 17.22 | 11.66 | 7.47 | 10.32 | 8.96 | - | - |
| TED-LIUM | 2.33 | 3.34 | 19.18 | 3.75 | 6.67 | 5.11 | 4.60 | 3.23 | 3.08 | 3.30 | - | - |
| EN-RealSI | 6.54 | 8.40 | 13.75 | 8.97 | 35.36 | 10.69 | 14.75 | 9.73 | 8.73 | 17.05 | - | - |
中文
| 数据集 | Qwen | R2T2 (Ours) 160ms | 开源 2s/u2/t5 | 专有 Qwen3-ASR※ | Qwen3-ASR base 160ms | X-ASR 160ms | WhisperRT※ 200ms | Nemotron 160ms | Voxtral 160ms | AssemblyAI※ min_latency | 商业 A※ | 商业 B※ |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Wenet-net | 4.94 | 5.87 | 19.79 | 8.81 | U2 | 4.70 | 23.53 | 12.91 | 5.13 | 4.79 | - | - |
| Wenet-meeting | 5.97 | 7.27 | 20.38 | 11.33 | U20.18 | 60.54 | 11.84 | 7.07 | 3.75 | - | - | - |
| SPEECHIO-06 | 6.10 | 7.30 | 24.50 | 7.86 | U2 | 2.52 | 32.16 | 15.08 | 5.67 | 5.34 | - | - |
| SPEECHIO-07 | 6.19 | 8.20 | 21.16 | 11.22 | U2 | 4.28 | 22.97 | 10.84 | 6.45 | 6.46 | - | - |
| CN-RealSI | 3.34 | 3.48 | 39.72 | 4.92 | U11.52 | 8.74 | 5.15 | 3.99 | 3.64 | - | - | - |
安装
我们建议使用一个全新的隔离环境。对于本地开发和源码安装,请使用下面的 Conda 或 uv 环境。Docker 推荐用于快速运行预配置了 CUDA 和运行时环境的项目——参见 Docker。
克隆仓库
git clone https://github.com/netease-youdao/Confucius4-R2T2.git
cd Confucius4-R2T2
选项 1:Conda
conda create -n confucius4-r2t2 python=3.12 -y
conda activate confucius4-r2t2
# 安装包含 vLLM 后端的包
pip install -e .
选项 2:uv
uv venv --python 3.12
source .venv/bin/activate
# 安装包含 vLLM 后端的包
uv pip install -e .
Python 3.10+ 受支持。我们测试使用的是 Python 3.12。vLLM 对 CUDA / PyTorch 兼容性有严格要求。如果安装无法解析,请检查 vLLM 网站上的版本矩阵,并固定一个与您的 CUDA 运行时匹配的组合。
Docker(推荐)
R2T2 可直接在官方的 Qwen3-ASR Docker 镜像上运行,该镜像已包含我们所需的所有运行时库。
预构建镜像:qwenllm/qwen3-asr。
在开始之前,请安装 NVIDIA Container Toolkit 以启用从 Docker 访问 GPU。如果您所在地区访问 Docker Hub 较慢或不稳定,可能需要配置镜像仓库。
1. 启动容器
LOCAL_WORKDIR=/path/to/your/workspace # 将挂载到容器中的主机路径
HOST_PORT=8000
CONTAINER_PORT=80
docker run --gpus all --name confucius4-r2t2 \
-v /var/run/docker.sock:/var/run/docker.sock \
-p $HOST_PORT:$CONTAINER_PORT \
--mount type=bind,source=$LOCAL_WORKDIR,target=/data/shared/confucius4-r2t2 \
--shm-size=4gb \
-it qwenllm/qwen3-asr:latest
您的本地工作区($LOCAL_WORKDIR)——包括本仓库的检出和 R2T2 检查点——将被挂载到容器内的 /data/shared/confucius4-r2t2。主机端口 8000 映射到容器端口 80;容器内运行的服务必须绑定到 0.0.0.0(而不是 127.0.0.1)才能使端口转发正常工作。
2. 在容器内运行示例
进入容器 shell 后:
cd /data/shared/confucius4-r2t2/Confucius4-R2T2
MODEL_PATH=/data/shared/confucius4-r2t2/Confucius4-R2T2 \
./run_example.sh /path/to/audio.wav
3. 管理容器
# 退出后重新进入
docker start confucius4-r2t2
docker exec -it confucius4-r2t2 bash
# 完全移除
docker rm -f confucius4-r2t2
快速开始
获取任何音频文件(单声道或立体声,任何采样率——内部会重采样到 16 kHz)并运行:
./run_example.sh /path/to/audio.wav \
--model_path /path/to/Confucius4-R2T2 \
--infer_mode stream_vllm \
--language Chinese \
--chunk_size_ms 160
日志默认写入 run_example.log。运行 ./run_example.sh --help 查看完整的标志列表。
配置
run_example.sh 读取以下环境变量(均为可选):
| 变量 | 默认值 | 描述 |
|---|---|---|
MODEL_PATH | (必需) | R2T2 检查点的路径或 HF 仓库 ID |
AUDIO | 第一个 CLI 参数 | 输入音频文件的路径 |
INFER_MODE | stream_vllm | stream_vllm 或 onetime_vllm |
LANGUAGE | Chinese | 语言提示(例如 Chinese, English…) |
CHUNK_SIZE_MS | 160 | 流式块大小(支持 80 毫秒–2 秒) |
UNFIXED_TOKEN_NUM | 1 | 未固定的尾随 token 数量(回滚窗口) |
CONTEXT | "" | 附加在提示前的上下文/热词提示 |
CUDA_VISIBLE_DEVICES | 0 | 暴露的 GPU ID |
LOG_FILE | run_example.log | 日志写入位置 |
您也可以直接调用 example.py 并将任何这些作为标志传递(--audio, --model_path, --infer_mode, --language, --chunk_size_ms, --lookahead_ms, --unfixed_token_num, --context)。
相似文章
@kwindla:OpenAI 今天发布了一款新的语音到语音模型:gpt-realtime-2 这是首个足够好的语音到语音模型……
OpenAI 发布了 gpt-realtime-2,一款新的语音到语音模型,针对实时语音代理交互和低延迟工具调用进行了优化。
@NetEaseYouDaoAI: 大多数流式ASR能快速给你文本。R2T2 给你可操作的文本。我们正在开源 Confucius4-R2T2,一个1.7B…
NetEase Youdao AI 正在开源 Confucius4-R2T2,一个1.7B的前沿实时流式ASR模型,专为语音代理设计,具有低延迟、高准确度和可配置解码块的特点。
netease-youdao/Confucius4-R2T2
Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。
@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。
@rohanpaul_ai:我没想到 Soniox TTS v2(一个文本转语音模型)会听起来这么自然。他们刚刚发布这个 TTS v2 > 真…
Soniox TTS v2 是一款新的文本转语音模型,提供优质语音质量、通过音频标签实现的表现力控制、高保真语音克隆、支持 60 多种语言,以及低延迟流式传输,定价为每生成小时 0.70 美元。