rafaelgalle/whisper-diarization-advanced

Replicate Explore 工具

摘要

一个可自定义的语音说话人日志流水线,基于Replicate平台,使用Whisper和Pyannote实现快速的多人转录,具备高级音频预处理、降噪和声道分离功能。

rafaelgalle / whisper-diarization-advanced
查看原文
查看缓存全文

缓存时间: 2026/07/09 23:35

# rafaelgalle/whisper-diarization-advanced – Replicate 来源:https://replicate.com/rafaelgalle/whisper-diarization-advanced **针对嘈杂、多人音频的最快、最经济且可定制的语音活动检测流水线。** --- 图片 ## 为什么选择这个项目? - **超快且经济高效:** 针对 Replicate.com (http://replicate.com/) 以及 GPU/CPU 环境进行了优化,以极低成本实现快速结果。 - **高度可定制:** 选择模型、设备和音频预处理级别。根据您的使用场景(呼叫中心、访谈、播客、会议等)进行微调。 - **高级音频处理:** 内置选项用于音频清理、高/低通滤波、激进降噪和 RMS 归一化。即使是最糟糕的音频也能处理! - **立体声通道支持:** 非常适合呼叫中心录音——分别转录每个通道,实现最高说话人准确度。 - **多输入灵活性:** 接受直接文件上传、URL 或 base64 字符串。轻松集成到任何工作流中。 - **说话人分离与转录:** 采用最先进的 Whisper 和 Pyannote 模型,实现准确的语音转文字和说话人分离。 - **翻译与语言检测:** 自动检测语言,并可将语音翻译成英语,适用于全球应用。 - **可扩展且生产就绪:** 专为批量处理、API 集成和大规模部署而设计。 --- ## 功能特性 - **降噪 + 语音增强** - **高/低通滤波** - **音频清理(单声道、16kHz、PCM)** - **基于通道的说话人分离** - **RMS 归一化** - **情感分析(路线图中)** - **自定义词汇/热词** - **灵活的预处理级别(0-4)** --- ### 输入参数 - `file_string: str`: 提供 Base64 编码的音频文件。 - `file_url: str`: 提供直接的音频文件 URL。 - `file: Path`: 提供音频文件。 - `num_speakers: int`: 说话人数量。留空则自动检测。必须介于 1 到 50 之间。 - `translate: bool`: 将语音翻译成英语。 - `language: str`: 语音的语言代码,例如“en”。留空则自动检测语言。 - `prompt: str`: 词汇表:以列表形式提供名称、缩写和外来词。使用标点符号可获得最佳准确性。现在也用作转录中的“热词”参数。 - `preprocess: int`: 音频预处理级别: - 0 → 无预处理(原始音频)。 - 1 → 仅清理(单声道、16kHz、PCM)。 - 2 → 清理 + 滤波(高通和低通)。 - 3 → 清理 + 滤波 + 降噪。 - 4 → 清理 + 滤波 + 降噪 + 归一化。 - `highpass_freq: int`: 高通滤波器频率(Hz),去除低于此值的低频。 - `lowpass_freq: int`: 低通滤波器频率(Hz),去除高于此值的高频。 - `prop_decrease: float`: 降噪强度(0.0 到 1.0),1.0 最为激进。 - `stationary: bool`: 如果为 True,假设噪声是平稳的(恒定背景噪声)。 - `target_dBFS: float`: RMS 归一化的目标响度水平(例如 -18.0)。 ### 输出结果 - `segments: List[Dict]`: 包含说话人、开始和结束时间的片段列表。 - 每个片段包含 `avg_logprob`,每个词级别片段包含 `probability`。 - `num_speakers: int`: 说话人数量(除非在输入中指定,否则为自动检测)。 - `language: str`: 语音的语言代码,例如“en”(除非在输入中指定,否则为自动检测)。 ### 注意事项与提示 降噪级别越高,丢失的语音特征越多,这可能会使说话人分离变得更困难。(这也是未来更新将支持基于通道的说话人分离的原因。) 降噪主要用于改善停顿时间检测。有时,背景噪声可能导致错误的时间戳。 --- ## 理想使用场景 - **呼叫中心:** 坐席/客户立体声通道分离 - **会议与访谈:** 多人说话人分离 - **播客与广播:** 从嘈杂源中获取干净的转录 - **VoIP 与低质量音频:** 高级噪声处理 --- ## 路线图 / 后续步骤 - 情感分析:将语音分类为中性、负面或正面 - 内容摘要 - PII 屏蔽 --- ## 费用 - **每执行一秒 $0.000975** ## 速度与费用 - **单声道** 使用 *Nvidia L40S GPU*,转录 **5 分钟** 音频(2 个说话人)耗时 **8.1 秒**——费用:**$0.0079** - **立体声** 使用 *Nvidia L40S GPU*,转录 **5 分钟** 音频(2 个说话人)耗时 **4.6 秒**——费用:**$0.0044** 模型创建于 10 个月 3 周前 模型更新于 1 周 3 天前

相似文章

vaibhavs10/incredibly-fast-whisper

Replicate Explore

一个高度优化的OpenAI Whisper Large v3版本,使用Transformers、Optimum和Flash Attention 2,能够在Replicate上在2分钟内转录150分钟的音频。

Whisper 介绍

OpenAI Blog

OpenAI 推出 Whisper,这是一个端到端的编码器-解码器 Transformer 模型,在大规模多样化音频数据上进行训练,可提供强大的多语言语音识别、语言识别和语音到英文翻译功能。Whisper 在多样化数据集上的错误率比专业模型低 50%,并且在语音翻译方面优于有监督基准,尽管未针对特定数据集进行微调。