@svpino: 这个新模型做了一件很酷的事:它能在你说话时将语音转换为文本。这与其他所有a…

X AI KOLs Timeline 模型

摘要

R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。

这个新模型做了一件很酷的事: 它能在你说话时将语音转换为文本。这与其他所有音频模型都不同。 这个模型叫做 R2T2。它以小块处理音频,并知道哪些词需要立即发布,哪些需要更多上下文。 Hugging Face 链接:https://huggingface.co/netease-youdao/Confucius4-R2T2…
查看原文
查看缓存全文

缓存时间: 2026/09/21 05:31

这款新模型实现了一个非常酷的功能:在说话时将语音实时转换为文本。这与其他所有音频模型都不同。该模型名为R2T2。它能分块处理音频,并判断哪些词汇需要立即发布,哪些需要更多上下文信息。Hugging Face链接:https://huggingface.co/netease-youdao/Confucius4-R2T2…


netease-youdao/Confucius4-R2T2 · Hugging Face

来源:https://huggingface.co/netease-youdao/Confucius4-R2T2

Confucius4-R2T2

Confucius4-R2T2:低延迟高精度实时语音识别模型

真正的实时转录

GitHub仓库:https://github.com/netease-youdao/Confucius4-R2T2
中文README:https://github.com/netease-youdao/Confucius4-R2T2/blob/master/README.zh.md
模型许可:网易模型使用许可协议:https://raw.githubusercontent.com/netease-youdao/Confucius4-R2T2/refs/heads/master/MODEL_LICENSE
代码许可:Apache 2.0:https://github.com/netease-youdao/Confucius4-R2T2/blob/master/LICENSE
在线演示:https://r2t2.youdao.com/demo
Hugging Face模型:https://huggingface.co/netease-youdao/Confucius4-R2T2
ModelScope模型:https://modelscope.cn/models/netease-youdao/Confucius4-R2T2
R2T2官网:https://r2t2.ai/

Confucius4-R2T2 是一款低延迟、高精度的真正流式自动语音识别(ASR)模型,支持从 80 毫秒到 2 秒的细粒度、可配置解码块。该模型采用仅追加输出模式:转录文本一旦输出即永久确认,不会修改先前输出的词语。这对于文本需要即时处理或执行的应用至关重要,能够提供更流畅的用户体验,避免在实时应用(如实时字幕与字幕制作、下游自然语言处理流程与大语言模型智能体、同步语音翻译等)中出现破坏性的文本修订和视觉闪烁。

R2T2 是 Real Real-Time Transcription(真正的实时转录)的缩写,基于 Qwen3-ASR 模型构建。它使用了一套独特的数据构建技术进行训练,包括稳定前缀数据、强制时间对齐数据和 token 级音频分割。结合最长稳定前缀(LSP)学习范式(技术报告即将发布),R2T2 能够动态判断何时可以安全输出稳定前缀,以及何时需要更多音频上下文。通过仅暴露稳定前缀,模型提供了高质量的上下文来调节后续预测,同时保证先前输出的文本保持不变。尽管采用了流式设计,R2T2 在离线识别中仍保持高精度。

  • 低延迟高精度流式识别 —— 模型精度接近离线识别,平均延迟仅为 200 至 600 毫秒。
  • 稳定的流式输出 —— 文本输出即确认,保持不变。
  • 可配置的低延迟分块 —— 支持从 80 毫秒到 2 秒的解码块,以适应不同的延迟/精度权衡。
  • 离线精度无损失 —— 添加流式支持不会降低离线识别精度。
  • vLLM 后端 —— 提供高吞吐量推理。也可使用 Hugging Face transformers 后端。
  • 上下文与热词提示 —— 原生支持。
  • 多语言支持 —— 针对中文和英文优化,同时支持广泛的其他语言。

实验结果表明,R2T2 在一系列开源模型中,在延迟和识别质量方面均达到最先进(SOTA)水平,同时与领先的闭源系统相比也具有竞争力。

GitHub仓库(https://github.com/netease-youdao/Confucius4-R2T2)提供推理代码、最小使用示例以及支持离线和实时流式推理的基于 vLLM 的后端。


目录


概述

Confucius4-R2T2 框架

图 1. R2T2 整体框架。

演示

与 GPT-Live-Transcribe 并排对比

您的浏览器不支持内嵌视频。

观看对比视频

图 2. GPT-Live-Transcribe 和 R2T2 处理同一音频的实时并排对比。

附加资源

更多演示、对比和支持资源将陆续添加至此处。

评估

如果您是这些对比中包含的模型的作者或维护者,对结果有任何疑问或关注,请随时通过 GitHub issue tracker 联系我们。我们很乐意分享评估细节并与您合作验证或修正它们。

流式性能

流式 API 支持从 80 毫秒到 2 秒的解码块;下图展示了在 160 毫秒下的代表性词错误率(WER)/延迟权衡。

英文 WER 与不同 ASR 模型和配置的回溯分块延迟对比

图 3. 不同模型和配置下的英文 WER 和回溯分块延迟。

中文字错误率(CER)与不同 ASR 模型和配置的回溯分块延迟对比

图 4. 不同模型和配置下的中文 CER 和回溯分块延迟。

代表性流式 ASR 配置的英文和中文精度-延迟帕累托前沿

图 5. 精度-延迟帕累托前沿。越靠近左下角越好;前沿使用回溯分块平均模糊延迟。

精度

英文结果使用 WER(%),中文结果使用 CER(%);数值越低越好。

※ 伪流式模型:其部分转录可能修改先前输出的文本;未标注的模型使用真正的流式、仅追加输出。

英文

数据集QwenR2T2 (Ours) 160ms开源 2s/u2/t5专有 Qwen3-ASR※Qwen3-ASR base 160msX-ASR 160msWhisperRT※ 200msNemotron 160msVoxtral 160msAssemblyAI※ min_latency商业 A※商业 B※
AMI9.2511.3724.7914.4124.1918.1115.9412.0013.278.44--
Giga-clean8.619.6024.3710.2613.8112.6711.139.218.849.46--
LS-clean1.672.1322.303.864.703.712.491.891.731.25--
LS-other3.544.8825.749.649.868.277.153.373.572.48--
SPGI2.903.0022.255.148.663.933.062.143.061.74--
VoxPopuli3.023.0720.715.688.285.696.304.753.173.14--
Earnings226.689.3629.7215.9535.0817.2211.667.4710.328.96--
TED-LIUM2.333.3419.183.756.675.114.603.233.083.30--
EN-RealSI6.548.4013.758.9735.3610.6914.759.738.7317.05--

中文

数据集QwenR2T2 (Ours) 160ms开源 2s/u2/t5专有 Qwen3-ASR※Qwen3-ASR base 160msX-ASR 160msWhisperRT※ 200msNemotron 160msVoxtral 160msAssemblyAI※ min_latency商业 A※商业 B※
Wenet-net4.945.8719.798.81U24.7023.5312.915.134.79--
Wenet-meeting5.977.2720.3811.33U20.1860.5411.847.073.75---
SPEECHIO-066.107.3024.507.86U22.5232.1615.085.675.34--
SPEECHIO-076.198.2021.1611.22U24.2822.9710.846.456.46--
CN-RealSI3.343.4839.724.92U11.528.745.153.993.64---

安装

我们建议使用一个全新的隔离环境。对于本地开发和源码安装,请使用下面的 Condauv 环境。Docker 推荐用于快速运行预配置了 CUDA 和运行时环境的项目——参见 Docker

克隆仓库

git clone https://github.com/netease-youdao/Confucius4-R2T2.git
cd Confucius4-R2T2

选项 1:Conda

conda create -n confucius4-r2t2 python=3.12 -y
conda activate confucius4-r2t2
# 安装包含 vLLM 后端的包
pip install -e .

选项 2:uv

uv venv --python 3.12
source .venv/bin/activate
# 安装包含 vLLM 后端的包
uv pip install -e .

Python 3.10+ 受支持。我们测试使用的是 Python 3.12。vLLM 对 CUDA / PyTorch 兼容性有严格要求。如果安装无法解析,请检查 vLLM 网站上的版本矩阵,并固定一个与您的 CUDA 运行时匹配的组合。

Docker(推荐)

R2T2 可直接在官方的 Qwen3-ASR Docker 镜像上运行,该镜像已包含我们所需的所有运行时库。

预构建镜像:qwenllm/qwen3-asr

在开始之前,请安装 NVIDIA Container Toolkit 以启用从 Docker 访问 GPU。如果您所在地区访问 Docker Hub 较慢或不稳定,可能需要配置镜像仓库。

1. 启动容器

LOCAL_WORKDIR=/path/to/your/workspace  # 将挂载到容器中的主机路径
HOST_PORT=8000
CONTAINER_PORT=80
docker run --gpus all --name confucius4-r2t2 \
  -v /var/run/docker.sock:/var/run/docker.sock \
  -p $HOST_PORT:$CONTAINER_PORT \
  --mount type=bind,source=$LOCAL_WORKDIR,target=/data/shared/confucius4-r2t2 \
  --shm-size=4gb \
  -it qwenllm/qwen3-asr:latest

您的本地工作区($LOCAL_WORKDIR)——包括本仓库的检出和 R2T2 检查点——将被挂载到容器内的 /data/shared/confucius4-r2t2。主机端口 8000 映射到容器端口 80;容器内运行的服务必须绑定到 0.0.0.0(而不是 127.0.0.1)才能使端口转发正常工作。

2. 在容器内运行示例

进入容器 shell 后:

cd /data/shared/confucius4-r2t2/Confucius4-R2T2
MODEL_PATH=/data/shared/confucius4-r2t2/Confucius4-R2T2 \
./run_example.sh /path/to/audio.wav

3. 管理容器

# 退出后重新进入
docker start confucius4-r2t2
docker exec -it confucius4-r2t2 bash

# 完全移除
docker rm -f confucius4-r2t2

快速开始

获取任何音频文件(单声道或立体声,任何采样率——内部会重采样到 16 kHz)并运行:

./run_example.sh /path/to/audio.wav \
  --model_path /path/to/Confucius4-R2T2 \
  --infer_mode stream_vllm \
  --language Chinese \
  --chunk_size_ms 160

日志默认写入 run_example.log。运行 ./run_example.sh --help 查看完整的标志列表。

配置

run_example.sh 读取以下环境变量(均为可选):

变量默认值描述
MODEL_PATH(必需)R2T2 检查点的路径或 HF 仓库 ID
AUDIO第一个 CLI 参数输入音频文件的路径
INFER_MODEstream_vllmstream_vllmonetime_vllm
LANGUAGEChinese语言提示(例如 Chinese, English…)
CHUNK_SIZE_MS160流式块大小(支持 80 毫秒–2 秒)
UNFIXED_TOKEN_NUM1未固定的尾随 token 数量(回滚窗口)
CONTEXT""附加在提示前的上下文/热词提示
CUDA_VISIBLE_DEVICES0暴露的 GPU ID
LOG_FILErun_example.log日志写入位置

您也可以直接调用 example.py 并将任何这些作为标志传递(--audio, --model_path, --infer_mode, --language, --chunk_size_ms, --lookahead_ms, --unfixed_token_num, --context)。

相似文章

netease-youdao/Confucius4-R2T2

Hugging Face Models Trending

Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。