nvidia/NVIDIA-NemotronLabs-VoiceChat-11B · Hugging Face(全双工)
摘要
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款开放的端到端全双工语音模型,可实现实时对话式AI,轮转延迟约450毫秒,支持打断(barge-in)和实时工具调用,是首款支持工具调用的开放全双工模型。
查看缓存全文
缓存时间: 2026/08/03 23:52
nvidia/NVIDIA-NemotronLabs-VoiceChat-11B · Hugging Face
来源:https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
▶**先来听听。**自然的轮流说话、打断插入和实时工具调用。示例
| 试听要点 | 播放器 |
|---|---|
| 自然的轮流说话 | 流畅的你来我往,约 450 毫秒响应 |
| 打断 / 插入 | 用户插话时,模型立即让出话语权 |
| 实时工具调用 | 在需要时调用工具 |
▶**代码:**在GitHub上 (https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat)
模型概述
描述
NVIDIA NemotronLabs VoiceChat 是一个11B 端到端、实时全双工(FD)语音对话 AI 模型,可联合执行流式语音理解与语音生成 [1, 2]。与传统的级联架构(ASR → LLM → TTS)不同,该模型在统一架构中实现了全双工、实时、无缝的语音交互,无需多个模型或 API 切换,从而降低了端到端延迟。它带来了开放、鲁棒且高度自然的对话能力,树立了新的基准。此外,NVIDIA NemotronLabs VoiceChat 是首个支持工具调用的开源全双工模型,并且在工具执行过程中仍能保持自然的对话流。每个工具都可以定义特定的“保持”消息,当 LLM 生成将触发工具调用与响应的文本时,智能体就会说出该消息。
该模型基于音频信号运行,并采用快速 conformer 模块进行编码。生成的音频 token 输入到 Nemotron Nano V2 9B LLM 主干网络,以预测文本 token;这些文本 token 再送入 TTS 解码器 [2] 来预测音频编码,从而生成智能体的语音。另外使用单独的输出通道来预测工具调用脚本。如下方的基准测试结果 (https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B#testingevaluation-dataset) 所示,NemotronLabs VoiceChat 在开源语音智能体领域提供了前所未有的智能与延迟的权衡。
此模型仅供研究用途。
亮点
| 参数 | 轮流说话延迟 | VoiceBench(开源全双工) | 工具调用 | 架构 |
|---|---|---|---|---|
| 11B | ~450 ms | #2 开源全双工 | 支持 | 统一模型 |
许可证/使用条款
**管理条款:**本模型的使用受 OpenMDW 许可证协议 1.1 版 (https://github.com/OpenMDW/OpenMDW/blob/main/1.1/LICENSE.OpenMDW-1.1) 约束。
使用场景
NemotronLabs VoiceChat 面向自然语言处理(NLP)和语音技术领域的研究人员、开发者和专业人士,用于自动语音识别(ASR)、文本到语音合成(TTS)和语音助手开发等用途。
部署地域
全球
发布日期
2026 年 8 月 3 日。
模型架构
**架构类型:**混合 Mamba/Transformer
**参数:**11B
**网络架构:**NemotronLabs VoiceChat 使用:
- 来自 Nemotron-Speech-Streaming-En-0.6b 的快速 Conformer 语音编码器 (https://huggingface.co/nvidia/nemotron-speech-streaming-en-0.6b)
- NVIDIA Nemotron Nano v2 LLM 主干网络 (https://huggingface.co/nvidia/NVIDIA-Nemotron-Nano-9B-v2)
- NVIDIA TTS 解码器和编解码器 [3]
- 用于工具调用脚本的独立输出通道
NemotronLabs VoiceChat 架构 (https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B/blob/main/VoiceChat-v1-TC%20voicechatv1.png)
输入
| 属性 | 值 |
|---|---|
| 输入类型 | 文本(提示词)、音频(用户语音) |
| 输入格式 | String,WAV/WebAudio |
| 采样率 | 16 kHz |
输出
| 属性 | 值 |
|---|---|
| 输出类型 | 文本(智能体)、音频(智能体语音)、文本(用户转录) |
| 输出格式 | String,WAV/WebAudio |
| 采样率 | 22.05 kHz |
NemotronLabs VoiceChat 与其他开源全双工模型的对比
| 模型 | 参数 | 工具调用 |
|---|---|---|
| NemotronLabs VoiceChat | 11B | ✔ |
| PersonaPlex | 7B | ✘ |
| Moshi | 7B | ✘ |
| Freeze-Omni | 7B | ✘ |
软件集成
我们的 AI 模型设计用于(或优化用于)在 NVIDIA GPU 加速系统上运行。通过利用 NVIDIA 的硬件(如 GPU 核心)和软件框架(如 CUDA 库),该模型与纯 CPU 方案相比可实现更快的训练和推理速度。
**运行时引擎:**vLLM
支持的硬件微架构兼容性:
- NVIDIA A100
- NVIDIA H100
- NVIDIA H200
- NVIDIA B100
- NVIDIA B200
- NVIDIA RTX-6000
首选/支持的操作系统:
- Linux
将基础模型和微调模型集成到 AI 系统中需要使用特定于用例的数据进行额外测试,以确保安全有效的部署。遵循 V 模型方法论,在单元和系统层面进行迭代测试与验证,对于降低风险、满足技术和功能需求、并确保部署前符合安全和道德标准至关重要。
模型版本
- v1.0
快速开始
要尝试使用该模型进行推理,请参阅以下说明:
- 离线推理 —— 加载此 Hugging Face 检查点,用于非交互式批处理语音到语音测试(离线推理 (https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B#offline-inference))。
- 交互式流式处理 —— 部署优化的 NVIDIA 推理容器,用于实时 WebSocket 对话(交互式流式部署 (https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B#interactive-streaming-deployment))。
完整的设置细节也可在 GitHub 仓库中找到 (https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat)。
训练、测试与评估数据集
训练数据集
**数据模态:**音频(语音)和文本
**音频训练数据规模:**约 55 万小时
VoiceChat 使用多种数据集的混合进行训练,既包含真实音频数据集,也包含使用各种 TTS 系统在文本训练语料上生成的合成语音数据集,包括:
- Nemotron 5.5 预训练和 SFT 文本数据
- Brainy-mantis 文本数据
- Greteal AI v1 和 v2 文本数据
- Ultrachat 文本数据 (https://huggingface.co/datasets/HuggingFaceH4/ultrachat_200k)
- Blackwell 录音棚真实语音数据
- Fisher 真实语音数据 (https://catalog.ldc.upenn.edu/LDC2004S13)
- LibriVox (https://librivox.org/)
- LibriTTS (https://www.openslr.org/60/)
- HiFi-TTS (https://www.openslr.org/109/)
- Riva Speakers:内部数据集
- 公开互联网规模数据
- PromptTTS (https://speechresearch.github.io/prompttts/)
- VCTK (https://datashare.ed.ac.uk/handle/10283/3443)
- Voxmovies (https://mmai.io/datasets/voxmovies/)
- JL-Corpus (https://huggingface.co/datasets/CLAPv2/JL-Corpus)
- Nemotron Nano v3 函数调用数据
- Persona Plex 训练数据集
**各数据集采集方式:**混合:人工、合成、自动化。
**各数据集标注方式:**自动化。
测试/评估数据集
VoiceBench
VoiceBench 是一个用于评估基于 LLM 的语音助手的基准数据集,重点关注真实世界的口语交互,而不仅仅是文本或干净语音识别。它结合了音频和文本数据。该数据集包含多个子集,涵盖开放式问答、多项选择 QA、指令跟随和对抗性用例等任务——数据来源包括真实人类语音和合成 TTS 示例。
**链接:**VoiceBench (https://github.com/MatthewCYM/VoiceBench)
**数据采集方式:**混合:人工、合成、自动化。
**标注方式:**自动化。
**特性:**VoiceChat 在 VoiceBench (https://arxiv.org/abs/2410.17196) 的所有开源全双工模型中排名第 2。
Full-Duplex-Bench 1.0
Full-Duplex-Bench 1.0 是一个用于评估类似 VoiceChat 的全双工对话模型交互能力的基准。它专注于衡量自然的类人对话行为,如停顿处理、反馈回应、平滑轮流说话和用户打断管理,并使用自动指标提供一致、可复现的模型性能评估。
**链接:**Full-Duplex-Bench 1.0 (https://arxiv.org/abs/2503.04721)
**数据采集方式:**混合:人工、合成、自动化。
**标注方式:**自动化。
**特性:**NemotronLabs VoiceChat 在 FullDuplexBench 1.0 (https://arxiv.org/abs/2503.04721) 的所有开源模型中排名第 2。
基准分数:
| 指标 | 值 |
|---|---|
| 停顿处理(合成):TOR↓ | 0.153 |
| 停顿处理(Candor):TOR↓ | 0.255 |
| 平滑轮流说话:TOR↑ | 0.82 |
| 平滑轮流说话:延迟↓ | 448 ms |
| 用户打断:TOR↑ | 1 |
| 用户打断:延迟↓ | 480 ms |
| 用户打断:GPT-4o↑ | 4.33 |
AU Harness BFCL-v3(工具调用)
这是 AU Harness 基准 (https://github.com/ServiceNow/AU-Harness) 中专注于音频对话内工具调用评估的子集。它通过将原始 BFCL-v3 (https://openreview.net/pdf?id=2GmDdhBdDk) 的文本指令系统性地转换为对应的口语版本而构建。
**链接:**AU Harness (https://github.com/ServiceNow/AU-Harness)
**数据采集方式:**混合:人工、合成、自动化。
**特性:**NemotronLabs VoiceChat 是首个在工具执行过程中保持自然对话流的开源全双工工具调用模型。
基准分数:
| 指标 | 值 |
|---|---|
| 简单 | 58.5% |
| 多重 | 62.5% |
| 并行 | 42.5% |
| 并行多重 | 27.5% |
| 无关性 | 89.6% |
| 平均 | 56.1% |
Full-Duplex-Bench v3(工具调用)
Full-Duplex-Bench-v3(FDB-v3)(https://arxiv.org/abs/2604.04847) 是一个在自然语音条件和多步骤工具使用下评估口语语言模型的基准。
**链接:**Full-Duplex-Bench v3 (https://daniellin94144.github.io/FDB-v3-demo/)
**数据采集方式:**人工。
**特性:**NemotronLabs VoiceChat 在该基准上的工具选择准确率方面与前沿模型相当。
基准分数:
| 指标 | 值 |
|---|---|
| 工具选择 | 82.5% |
| 参数准确率 | 44.2% |
| Pass@1 | 33% |
推理
**加速引擎:**vLLM
**测试硬件:**NVIDIA H100
本节介绍如何使用以下任一方法测试 NVIDIA Nemotron Labs VoiceChat:
- 离线推理 —— 在 conda 环境中进行快速、非交互式的语音到语音检查(离线推理 (https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B#offline-inference))。
- 交互式流式处理 —— 通过优化的 NVIDIA 推理容器进行实时 WebSocket 语音对话(交互式流式部署 (https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B#interactive-streaming-deployment))。
离线推理
从此 Hugging Face 检查点运行离线的语音到语音推理。需要 NVIDIA GPU、conda 以及 nemotron-labs-voicechat (https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat) 分支上的 Speech 仓库。
1. 克隆并配置环境
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 \
huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 \
torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
2. 下载检查点
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B \
--local-dir /path/to/checkpoint
3. 运行推理
conda activate voicechat
export NEMO_DIR=/path/to/Speech
# 通用对话
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" \
--checkpoint /path/to/checkpoint \
--wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" \
--output-dir /path/to/output
使用自定义音频文件时,请在末尾加入足够长的静音,以便智能体有时间回应。离线函数调用不会实际调用实时工具。--api-response-json 指向一个包含预先编写好的工具响应的 JSON 文件。其中的 tool_name 必须与可用的工具匹配,且 response 必须是纯 ASCII 且适合 TTS 朗读的文本。如需带实时工具执行的交互式函数调用,请参阅交互式流式部署 (https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B#interactive-streaming-deployment)。
# 函数调用
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_fc_infer.py" \
--checkpoint /path/to/checkpoint \
--wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_fc.wav" \
--api-response-json "$NEMO_DIR/examples/speechlm2/function_calling/random_number_response.json" \
--output-dir /path/to/output
运行后,检查输出目录中的 JSON 文件,可以看到预测的函数调用,例如:
[{"name": "generate_random_number", "arguments": {"min": 1, "max": 50}}]
交互式流式部署
如需与此 Hugging Face 检查点进行交互式低延迟语音对话,请使用优化的 NVIDIA 推理容器。它将模型与 NVIDIA 推理栈(CUDA、Triton、vLLM)打包在一起,并暴露了支持函数调用的双向 WebSocket 接口。
完整说明见 GitHub 仓库 (https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat/voicechat_realtime_instructions):
- 前置条件 (https://github.com/NVIDIA-NeMo/Speech/blob/nemotron-labs-voicechat/voicechat_realtime_instructions/prerequisites.md)——硬件、软件和驱动程序要求
- 部署与运行 (https://github.com/NVIDIA-NeMo/
相似文章
nvidia/Nemotron-Labs-Audex-30B-A3B · Hugging Face
NVIDIA 发布了 Nemotron-Labs-Audex-30B-A3B,这是一个统一的音频-文本大语言模型,基于 30B MoE 主干网,激活参数量为 3B。该模型在音频理解、语音识别/翻译和生成方面表现出色,同时保留了文本推理和对齐能力。
@kwindla: https://x.com/kwindla/status/2062544580105359686
NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。
@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。
@oliviscusAI:NVIDIA 刚刚移除了语音AI最大的痛点。他们开源了 PersonaPlex 7B,一个实时对话…
NVIDIA 开源了 PersonaPlex 7B,一个实时对话模型,能够同时聆听和说话,与大多数语音模型不同,它可以处理自然的打断和重叠。
nvidia/nemotron-3.5-asr-streaming-0.6b
NVIDIA 发布 Nemotron 3.5 ASR,这是一个6亿参数的多语言流式语音识别模型,支持40种语言区域,采用缓存感知的FastConformer-RNNT架构实现低延迟转录。该模型支持可配置的块大小,并已在OpenMDW-1.1许可证下准备商业化使用。