parakeet.wgsl – 通过原生 WebGPU 与 SIMD WASM 在浏览器中实现快速准确的语音识别
摘要
parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。
在浏览器中高性能推理 NVIDIA Parakeet TDT 0.6B V2 英语转录模型。查看在线演示:https://parakeet.narcotic.sh/ 这是一个完全定制、无依赖的实现,使用原生 WebGPU 计算着色器和 SIMD WebAssembly 音频前端。1 小时音频仅需 20 秒即可转录完成(Apple M5,Google Chrome 151.0.7922.72)。查看源代码并在你自己的项目中使用!https://github.com/narcotic-sh/parakeet.wgsl https://www.npmjs.com/package/parakeet.wgsl 这可能是首次在浏览器本地实现快速且准确的转录。只要你的设备有 GPU 并且能运行支持 WebGPU 的浏览器,parakeet.wgsl 就能在上面运行。而且由于 WebGPU 可以转译到几乎任何 GPU,这也为 parakeet.wgsl 通过 Dawn 或 wgpu 在离线/浏览器之外运行开辟了道路,从而将快速、准确的转录带到离线程序中,并支持 GPU 加速和几乎所有硬件/设备。很想知道大家对这个项目的看法。最后,我正在找工作。如果你喜欢我的工作并认为我适合你的团队,我很乐意聊聊。我还做了一些其他工作,你可以在 https://hamzaq.com 找到。谢谢大家!享受快速、跨平台、GPU 加速的本地转录吧!
相似文章
@mudler_it:parakeet.cpp 现已在 OpenAI API 背后运行 NVIDIA Parakeet。将任何 OpenAI 客户端指向本地服务器,发送音频,……
parakeet.cpp 能够在本地的 OpenAI API 背后运行 NVIDIA Parakeet ASR,提供预构建的 Docker 镜像,支持 CPU 和 CUDA(包括 arm64),实现带有词级时间戳的实时转录。
@badlogicgames: 一个很棒的项目:parakeet.cpp https://github.com/mudler/parakeet.cpp… 基于GGML的parakeet推理管道…
parakeet.cpp 是一个快速、轻依赖的C++17推理管道,用于NVIDIA的NeMo Parakeet语音识别模型,基于ggml构建。它能实现与NeMo字节相同的转录结果,并在CPU和GPU上显著提升速度。
我对Parakeet 0.6B进行了医学ASR微调——开放权重,本地运行于Mac/CUDA/CPU
Omi Health创始人微调了NVIDIA的Parakeet TDT 0.6B用于医学ASR,发布了开放权重的模型Omi Med STT v1,在本地Mac、CUDA或CPU上运行时实现了有竞争力的医学WER。
我将 NVIDIA Parakeet(语音转文本)移植到 ggml:与 NeMo 输出相同,速度更快,GGUF 量化,无需 Python
NVIDIA 的 Parakeet 语音转文本模型已被移植到纯 C++/ggml,实现了与 NeMo 字节完全相同的输出,GPU 上推理速度提升高达 5 倍,并提供量化的 GGUF 变体,无需 Python 或 PyTorch 即可在任何地方高效部署。
Parrot Speech-to-text API
Parrot Speech-to-text API 为生产级语音代理提供快速准确的转写服务。