@denziideng: 不安装、不注册,开源离线免费用,Windows离线语音输入值得拥有! 打字慢手酸?语音输入又怕隐私泄露,还得联网? 分享一个 CapsWriter-Offline,GitHub 6.2k的Windows离线语音输入神器,按住CapsLoc…
摘要
CapsWriter-Offline 是一款Windows平台的完全离线语音输入工具,按住CapsLock键说话即可自动识别上屏,支持多种模型(SenseVoice、Paraformer等),无需联网和安装,高度自定义且低延迟。
查看缓存全文
缓存时间: 2026/07/15 15:57
不安装、不注册,开源离线免费用,Windows离线语音输入值得拥有!
打字慢手酸?语音输入又怕隐私泄露,还得联网?
分享一个 CapsWriter-Offline,GitHub 6.2k的Windows离线语音输入神器,按住CapsLock键说话,松手自动上屏,完全本地运行,无网络、无广告、延迟极低,彻底解决隐私和速度双重痛点。
极简操作:默认按住CapsLock(或鼠标侧键)说话,松开即自动识别上屏
彻底离线:所有识别本地完成,不传云端,适合办公和内网环境
多模型适配:支持SenseVoice、Paraformer、Qwen3-ASR等,集显和独显电脑都能流畅高准
高度自定义:音素热词、LLM润色、文件转录生成SRT字幕、开机自启全都有
便携免安装:C/S架构,解压即用,一个U盘就能带走
低延迟体验:说完就出字,几乎感觉不到等待
使用方法超级简单!下载解压后,把模型文件放进models文件夹,双击start_server.exe启动服务,再双击start_client.exe启动客户端。按住CapsLock试一句说话,松手文字就自动输入了。
GitHub地址:https://github.com/HaujetZhao/CapsWriter-Offline…
强烈推荐给打字慢、经常需要语音输入的朋友,离线也能这么丝滑,后悔发现太晚,冲冲冲~
#开源工具 #语音输入 #Windows效率 #CapsWriter
HaujetZhao/CapsWriter-Offline
Source: https://github.com/HaujetZhao/CapsWriter-Offline
CapsWriter-Offline

按住 CapsLock 说话,松开就上屏。就这么简单。
CapsWriter-Offline 是一个专为 Windows 打造的完全离线语音输入工具。
✨ 核心特性
- 语音输入:按住
CapsLock键或鼠标侧键X2说话,松开即输入,超低延迟,默认去除末尾逗句号。支持对讲机模式和单击录音模式。 - 文件转录:音视频文件往客户端 exe 一丢,字幕 (
.srt)、文本 (.txt)、时间戳 (.json) 统统都有。 - 数字 ITN:自动将「十五六个」转为「15~16个」,支持各种复杂数字格式。
- 热词替换:在
hot.txt记下偏僻词,通过音素模糊匹配,相似度大于阈值则强制替换。 - 正则替换:在
hot-rule.txt用正则或简单等号规则,精准强制替换。 - LLM 角色:预置了润色、小助理等角色,当识别结果的开头匹配任一角色名字时,将交由该角色处理。
- 托盘菜单:右键托盘图标即可添加热词、复制结果、清除LLM记忆。
- C/S 架构:服务端与客户端分离,虽然 Win7 老电脑跑不了服务端模型,但最少能用客户端输入。
- 日记归档:按日期保存你的每一句语音及其识别结果。
- 录音保存:所有语音均保存为本地音频文件,隐私安全,永不丢失。
CapsWriter-Offline 的精髓在于:完全离线(不受网络限制)、响应极快、高准确率 且 高度自定义。我追求的是一种「如臂使指」的流畅感,让它成为一个专属的一体化输入利器。无需安装,一个U盘就能带走,随插随用,保密电脑也能用。
以下为支持的模型:
| 引擎名 | 准确性 | 速度 | 格式 | 显卡加速 |
|---|---|---|---|---|
| Paraformer | ★★★☆☆ | ★★★★★ | ONNX | ❌ |
| SenseVoice-Small | ★★★☆☆ | ★★★★★ | ONNX | ✅ |
| Fun-ASR-Nano | ★★★★☆ | ★★★★☆ | ONNX + GGUF | ✅ |
| Qwen3-ASR | ★★★★★ | ★★★☆☆ | ONNX + GGUF | ✅ |
性能参考(20s 音频转录延迟):
| 模型 | CPU U9-285H | GPU RTX5050 |
|---|---|---|
| Paraformer | 0.6s | - |
| SenseVoice-Small | 0.6s | 0.15s |
| Fun-ASR-Nano | 2.0s | 0.5s |
| Qwen3-ASR-1.7B | 4.0s | 1.0s |
详细功能说明请参考 docs/ 目录:
- 环境依赖安装说明 — VC++ 运行库、FFmpeg 安装
- 热词功能如何使用 — 热词替换、规则替换、自定义短语
- 角色功能如何使用 — LLM 角色配置、输出模式、创建新角色
- 识别语言如何配置 — 各引擎语言支持范围与配置方法
- 文件转录功能如何使用 — 拖拽转字幕、时间戳对齐
- 显卡加速的若干问题 — DirectML、Vulkan 加速配置
- 模型下载的若干问题 — 引擎选择、模型下载、目录结构
- 常见问题 — FAQ
- 更新日志
💻 平台支持
目前仅能保证在 Windows 10/11 (64位) 下完美运行。
- Linux:暂无环境进行测试和打包,无法保证兼容性。
- MacOS:由于底层的
keyboard库已放弃支持 MacOS,且系统限制极多,暂时无法支持。
LazyTyper 和 闪电说 也是很优秀的作品,都有离线引擎,都支持 Windows Linux 与 MacOS,并都有漂亮的图形化页面,推荐使用。
CapsWriter 的特别之处在于追求:
- 无感输入
- 完全离线,不受网络约束
- 低延迟,尽量做到硬件极限的最快速度
- 高度自定义的热词系统
🎬 快速开始
- 准备环境:确保安装了 VC++ 运行库。若要使用文件转录功能,还需安装 ffmpeg 并确保其在系统 PATH 中。
- 下载解压:下载 Latest Release 里的软件本体,再到 Models Release 下载模型压缩包,将模型解压,放入
models文件夹中对应模型的文件夹里。 - 启动服务:双击
start_server.exe,它会自动最小化到托盘菜单。 - 启动听写:双击
start_client.exe,它会自动最小化到托盘菜单。 - 开始录音:按住
CapsLock键或鼠标侧键X2就可以说话了!
⚙️ 个性化配置
所有的设置都在根目录的 config_server.py 和 config_client.py 里,可直接编辑。
🛠️ 常见问题
Q: 为什么按了没反应?
A: 请确认 start_client.exe 的黑窗口还在运行。若想在管理员权限运行的程序中输入,也需以管理员权限运行客户端。
Q: 为什么识别结果没字?
A: 到 年/月/assets 文件夹中检查录音文件,看是不是没有录到音;听听录音效果,是不是麦克风太差,建议使用桌面 USB 麦克风;检查麦克风权限。
Q: 想要隐藏黑窗口?
A: 点击托盘菜单即可隐藏黑窗口。
Q: 如何开机启动?
A: Win+R 输入 shell:startup 打开启动文件夹,将服务端、客户端的快捷方式放进去即可。
更多问题请参阅 docs/常见问题.md。
🚀 我的其他优质项目推荐
| 项目名称 | 说明 | 体验地址 |
|---|---|---|
| IME_Indicator | Windows 输入法中英状态指示器 | 下载即用 |
| Rust-Tray | 将控制台最小化到托盘图标的工具 | 下载即用 |
| Gallery-Viewer | 网页端图库查看器,纯 HTML 实现 | 点击即用 |
| 全景图片查看器 | 单个网页实现全景照片、视频查看 | 点击即用 |
| 图标生成器 | 使用 Font-Awesome 生成网站 Icon | 点击即用 |
| 五笔编码反查 | 86 五笔编码在线反查 | 点击即用 |
| 快捷键映射图 | 可视化、交互式的快捷键映射图 (中文版) | 点击即用 |
❤️ 致谢
本项目基于以下优秀的开源项目:
感谢 Google Antigravity、Anthropic Claude、GLM、DeepSeek,如果不是这些编程助手,许多功能(例如基于音素的热词检索算法)我是无力实现的。
特别感谢那些慷慨解囊的捐助者,你们的捐助让我用在了购买这些优质的 AI 编程助手服务,并最终将这些成果反馈到了软件的更新里。
如果觉得好用,欢迎点个 Star 或者打赏支持:

Denzii 🕊️ (@denziideng): 25k Star,港大开源一款 AI 个性化辅导私教神器,在 GitHub 上杀疯了!🔥
今天带来DeepTutor,港大开源的AI个性化辅导私教!GitHub 25k🌟,100天内爆火了。它把出题、解题、研究、测验、知识管理全整合成一个智能体工作区,让AI真正陪你终身学习。
📌
相似文章
@cevenif: 兄弟们,那些还得掏钱才能用的语音工具,是时候跟它们说88了! 开源免费的 Voicebox 已经杀出来了,直接把 ElevenLabs 和 WisprFlow 这两家付费巨头按在地上摩擦。 功能: 声音克隆,秒变任何人 全局语音输入,随时…
一个开源免费的本地语音AI工作室,支持声音克隆、语音生成、全局听写,无需API密钥,完全本地运行,是ElevenLabs和WisprFlow的免费替代品。
@GitHub_Daily: 用电脑写东西的时候,脑子里想法很清楚,但打字组织语言就是慢。 尤其写 AI 提示词,说起来一句话的事,打出来还得反复调整格式。 在 GitHub 上看到 OpenLess 这个开源语音输入工具,可作为 Typeless、Wispr Flo…
OpenLess 是一款开源语音输入工具,支持 macOS 和 Windows,可语音转文字并自动润色,特别适合编写 AI 提示词。
@Huahuazo: 这声音克隆工具我试完直接愣住了。 随手截了8秒自己说话的录音扔进去,出来的声音——语气、停顿、那种欠欠的调调,简直跟我本人在抬杠一模一样。 最绝的是完全本地跑,音频不用上传,隐私安全直接拉满。说实话第一反应不是厉害,是头皮发麻:以后光凭一…
介绍本地声音克隆工具VoiceStudio,只需8秒录音即可高度还原声音,完全本地运行保护隐私,支持多种语言和平台。
@amiaoapp: Mac 用户终于有救了!这可能是今年最让我相见恨晚的 Mac 工具。 有没有被输入法逼疯过? 明明切到英文准备敲代码,下一秒又莫名变回中文; 打开 ChatGPT 是英文,切到微信要中文,来回切几十次; 更离谱的是,有些软件还会偷偷帮你切…
LockIME 是一款免费开源的 Mac 工具,可以锁定输入法,支持全局、按应用和按网址自动切换,避免手动切换输入法的烦恼。
@FeitengLi: 由 Fable 5 领衔(仅半天)Codex 接力开发历时一周 #EdgeSpeak 正式上线,转发的朋友联系我收邀请码 https://edgespeak.com/zh
EdgeSpeak 桌面端语音转录工具正式上线,搭载本地 Lattice-2 语音大模型,支持离线音视频转录、多种语言和口音,并提供本地 API 接口以便开发者集成。