构建一款完全本地的PDF朗读与PDF转有声书桌面应用(基于Kokoro 82M、Qwen和llama.cpp)
摘要
Speechfony是一款全新的完全本地桌面应用,可朗读PDF和EPUB,支持句子高亮、语义搜索和MP3有声书导出,使用Kokoro TTS和设备端嵌入模型。它优先考虑隐私和离线使用,采用开源MIT许可证。
大家好,我一直在开发 Speechfony——一款支持离线文本转语音的桌面应用,用于阅读 PDF(和 EPUB)。打开文档,逐句收听并高亮显示,或将选中的页面导出为 MP3。一切都本地运行:Kokoro 负责语音,设备端嵌入模型负责语义搜索。我想要一个不会把文档发送到云端 TTS 服务、首次下载模型后即可离线使用,并且更接近“边读边听”而非“把整个 PDF 扔进通用 TTS 盒子”的工具。
目前可用的功能:
- PDF + EPUB 阅读
- 逐句播放,实时高亮
- 可调页眉/页脚边距(避免重复的页面装饰被朗读)
- 从上次停下的位置继续
- 语义搜索(含义 + 关键词),本地嵌入
- 导出 MP3 有声书(仅限桌面端)
- 在可用时启用硬件加速(CoreML / DirectML / CUDA)
请做好遇到粗糙边缘的心理准备。我已在跟踪的已知缺口:
- 多栏布局、表格、代码、公式
- 脚注/引用、目录/索引页、标题/侧栏
- 扫描版 PDF(暂无 OCR)
- 非英语 / 从右到左语言
- 语音与语速控制有限
- 公司名称 / 小众技术术语的发音可能错误(这主要是 Kokoro 词表的问题——我自己正在编写 Rust 绑定)
平台:macOS Apple Silicon、Windows x64、Linux x64(glibc ≥ 2.38)。目前暂无 Intel Mac 构建。首次启动时会下载语音模型(约 130 MB,来自 Hugging Face)。之后即可离线使用。
链接
GitHub: https://github.com/pguso/speechfony
下载: https://github.com/pguso/speechfony/releases
如果你在真正会去听的实际文档(论文、手册、书籍、报告)上试过,请告诉我:
- 哪些地方出错了或听起来不对?
- 哪些 PDF/EPUB 版式让提取或播放变得混乱?
- 缺少什么会让你经常使用它?
欢迎提交 Issue 和 PR。完全开源(MIT 许可证)。
相似文章
使用Kokoro实现本地、CPU友好、高质量的文本转语音(TTS)
本文介绍Kokoro,一个轻量级82M参数的文本转语音模型,可在本地CPU上运行,提供跨多种语言的高质量语音合成,同时保护隐私。文章解释了如何通过Docker容器设置Kokoro,并使用兼容OpenAI的API进行简单集成。
@0x0SojalSec: 别再为ElevenLabs或云端TTS付费了。只需3秒即可在笔记本电脑上完全本地克隆声音,将你的文档转…
一个免费、完全本地的语音克隆和TTS工具,由Qwen3-TTS和Kokoro驱动,通过MLX在Apple Silicon上运行,无需云服务即可从PDF生成工作室级有声书。
@Honcia13: 电子书秒变有声书的开源神器来了——Audiblez! 把 EPUB 直接扔进去, 几分钟就吐出高质量 M4B 有声书! 用的 Kokoro 语音模型,仅82M参数,但听感自然到离谱。 亮点: T4 GPU跑《动物庄园》只要5分钟 支持中英…
Audiblez 是一个开源工具,能将 EPUB 电子书快速转换为高质量的 M4B 有声书,使用 Kokoro-82M 语音模型,支持多种语言和图形界面,通过 pip 一键安装。
@wsl8297: 想把电子书或文档做成有声书?很多工具不是声音太“机器人”,就是不支持字幕同步,折腾一圈还是不满意。 我后来发现了开源项目 Abogen:支持 ePub、PDF、纯文本等,一键转高质量音频,还能自动生成同步字幕。 它底层用 Kokoro 语…
Abogen 是一个开源工具,可将 ePub、PDF 等文档一键转为高质量音频,并自动生成同步字幕,支持语音混合器和多种部署方式。
通过持久化流在Jetson上部署本地AI服务
一位开发者记录了在NVIDIA Jetson Orin Nano上使用Kokoro-82M和持久化流构建自托管文本转语音应用的过程,实现了可靠的本地AI推理和可共享的音频输出。