S1-mini 由 Superwhisper 开发,在浏览器中通过 WebGPU 和 Transformers.js 100%本地运行
摘要
S1-mini 是一个拥有600M参数的大语言模型,用于清理语音转文本的记录,通过移除错误和添加标点,在浏览器中通过 WebGPU 和 Transformers.js 本地运行。
这是一个600M参数的大语言模型,旨在将原始的语音转文本记录转换为干净的书面文本。它移除错误起始和自我纠正,添加标点和大小写,并格式化口语中的数字、日期、时间和货币。亲自尝试一下: - 模型:https://huggingface.co/superwhisper/s1-mini - 演示:https://huggingface.co/spaces/webml-community/s1-mini-webgpu
相似文章
superwhisper/s1-mini (阅读约8分钟)
superwhisper/s1-mini 是一个从Qwen3-0.6B微调而来的0.6B参数文本规范化模型,用于清理语音转文本记录,通过去除填充词、纠正错误并应用标点和格式,在英语数据上达到94.8%的准确率。
parakeet.wgsl – 通过原生 WebGPU 与 SIMD WASM 在浏览器中实现快速准确的语音识别
parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。
@AlphaSignalAI:一个66M参数的模型刚刚在树莓派上击败了ElevenLabs。文本转语音多年来一直存在于云端。每个语音…
Supertonic 3是一个99M参数的开源TTS模型,完全在设备上运行,在树莓派上击败了ElevenLabs,在笔记本电脑CPU上的性能是实时的167倍。
@FeitengLi: 99M 参数的 TTS 跑在 CPU 上,比 2B 大模型跑在 A100 上还快。 Supertone 新开源的 supertonic-3 ONNX Runtime,完全本地,浏览器能跑,手机能跑,树莓派也能跑。
Supertone released Supertonic 3, an open-source TTS model with 99M parameters that runs faster on CPU than a 2B model on A100, supporting 31 languages and ONNX Runtime for fully local inference.
Bonsai 27B:使用自定义WebGPU内核在浏览器中本地运行的1比特密集型大语言模型
Bonsai 27B是一个1比特密集型大语言模型,通过使用自定义WebGPU内核可以在浏览器中本地运行,实现高效的设备端推理。