rafaelgalle/whisper-diarization-advanced
摘要
一个可自定义的语音说话人日志流水线,基于Replicate平台,使用Whisper和Pyannote实现快速的多人转录,具备高级音频预处理、降噪和声道分离功能。
rafaelgalle / whisper-diarization-advanced
查看缓存全文
缓存时间: 2026/07/09 23:35
# rafaelgalle/whisper-diarization-advanced – Replicate
来源:https://replicate.com/rafaelgalle/whisper-diarization-advanced
**针对嘈杂、多人音频的最快、最经济且可定制的语音活动检测流水线。**
---
图片
## 为什么选择这个项目?
- **超快且经济高效:** 针对 Replicate.com (http://replicate.com/) 以及 GPU/CPU 环境进行了优化,以极低成本实现快速结果。
- **高度可定制:** 选择模型、设备和音频预处理级别。根据您的使用场景(呼叫中心、访谈、播客、会议等)进行微调。
- **高级音频处理:** 内置选项用于音频清理、高/低通滤波、激进降噪和 RMS 归一化。即使是最糟糕的音频也能处理!
- **立体声通道支持:** 非常适合呼叫中心录音——分别转录每个通道,实现最高说话人准确度。
- **多输入灵活性:** 接受直接文件上传、URL 或 base64 字符串。轻松集成到任何工作流中。
- **说话人分离与转录:** 采用最先进的 Whisper 和 Pyannote 模型,实现准确的语音转文字和说话人分离。
- **翻译与语言检测:** 自动检测语言,并可将语音翻译成英语,适用于全球应用。
- **可扩展且生产就绪:** 专为批量处理、API 集成和大规模部署而设计。
---
## 功能特性
- **降噪 + 语音增强**
- **高/低通滤波**
- **音频清理(单声道、16kHz、PCM)**
- **基于通道的说话人分离**
- **RMS 归一化**
- **情感分析(路线图中)**
- **自定义词汇/热词**
- **灵活的预处理级别(0-4)**
---
### 输入参数
- `file_string: str`: 提供 Base64 编码的音频文件。
- `file_url: str`: 提供直接的音频文件 URL。
- `file: Path`: 提供音频文件。
- `num_speakers: int`: 说话人数量。留空则自动检测。必须介于 1 到 50 之间。
- `translate: bool`: 将语音翻译成英语。
- `language: str`: 语音的语言代码,例如“en”。留空则自动检测语言。
- `prompt: str`: 词汇表:以列表形式提供名称、缩写和外来词。使用标点符号可获得最佳准确性。现在也用作转录中的“热词”参数。
- `preprocess: int`: 音频预处理级别:
- 0 → 无预处理(原始音频)。
- 1 → 仅清理(单声道、16kHz、PCM)。
- 2 → 清理 + 滤波(高通和低通)。
- 3 → 清理 + 滤波 + 降噪。
- 4 → 清理 + 滤波 + 降噪 + 归一化。
- `highpass_freq: int`: 高通滤波器频率(Hz),去除低于此值的低频。
- `lowpass_freq: int`: 低通滤波器频率(Hz),去除高于此值的高频。
- `prop_decrease: float`: 降噪强度(0.0 到 1.0),1.0 最为激进。
- `stationary: bool`: 如果为 True,假设噪声是平稳的(恒定背景噪声)。
- `target_dBFS: float`: RMS 归一化的目标响度水平(例如 -18.0)。
### 输出结果
- `segments: List[Dict]`: 包含说话人、开始和结束时间的片段列表。
- 每个片段包含 `avg_logprob`,每个词级别片段包含 `probability`。
- `num_speakers: int`: 说话人数量(除非在输入中指定,否则为自动检测)。
- `language: str`: 语音的语言代码,例如“en”(除非在输入中指定,否则为自动检测)。
### 注意事项与提示
降噪级别越高,丢失的语音特征越多,这可能会使说话人分离变得更困难。(这也是未来更新将支持基于通道的说话人分离的原因。)
降噪主要用于改善停顿时间检测。有时,背景噪声可能导致错误的时间戳。
---
## 理想使用场景
- **呼叫中心:** 坐席/客户立体声通道分离
- **会议与访谈:** 多人说话人分离
- **播客与广播:** 从嘈杂源中获取干净的转录
- **VoIP 与低质量音频:** 高级噪声处理
---
## 路线图 / 后续步骤
- 情感分析:将语音分类为中性、负面或正面
- 内容摘要
- PII 屏蔽
---
## 费用
- **每执行一秒 $0.000975**
## 速度与费用
- **单声道** 使用 *Nvidia L40S GPU*,转录 **5 分钟** 音频(2 个说话人)耗时 **8.1 秒**——费用:**$0.0079**
- **立体声** 使用 *Nvidia L40S GPU*,转录 **5 分钟** 音频(2 个说话人)耗时 **4.6 秒**——费用:**$0.0044**
模型创建于 10 个月 3 周前
模型更新于 1 周 3 天前
相似文章
@tom_doerr: 以70倍实时速度转录音频 https://github.com/m-bain/whisperX
WhisperX是一个用于快速自动语音识别的工具,提供词级时间戳和说话人分离,使用Whisper large-v2实现70倍实时转录。
vaibhavs10/incredibly-fast-whisper
一个高度优化的OpenAI Whisper Large v3版本,使用Transformers、Optimum和Flash Attention 2,能够在Replicate上在2分钟内转录150分钟的音频。
基于说话人日志引导的Qwen-ASR多语言双人对话语音自适应
本文介绍了为MLC-SLM 2026挑战赛设计的系统,该系统结合了说话人日志与微调后的Qwen-ASR,采用监督式全参数微调、合成语音上的LoRA以及GRPO强化学习,在最终评测集上实现了17.97的tcpMER。
Whisper 介绍
OpenAI 推出 Whisper,这是一个端到端的编码器-解码器 Transformer 模型,在大规模多样化音频数据上进行训练,可提供强大的多语言语音识别、语言识别和语音到英文翻译功能。Whisper 在多样化数据集上的错误率比专业模型低 50%,并且在语音翻译方面优于有监督基准,尽管未针对特定数据集进行微调。
我微调了Cohere Transcribe以支持说话人分离和时间戳
微调了最佳开源语音转文字模型Cohere Transcribe,使其支持说话人分离和时间戳。新模型已在Hugging Face上发布。