构建一款完全本地的PDF朗读与PDF转有声书桌面应用(基于Kokoro 82M、Qwen和llama.cpp)

Reddit r/LocalLLaMA 产品

摘要

Speechfony是一款全新的完全本地桌面应用,可朗读PDF和EPUB,支持句子高亮、语义搜索和MP3有声书导出,使用Kokoro TTS和设备端嵌入模型。它优先考虑隐私和离线使用,采用开源MIT许可证。

大家好,我一直在开发 Speechfony——一款支持离线文本转语音的桌面应用,用于阅读 PDF(和 EPUB)。打开文档,逐句收听并高亮显示,或将选中的页面导出为 MP3。一切都本地运行:Kokoro 负责语音,设备端嵌入模型负责语义搜索。我想要一个不会把文档发送到云端 TTS 服务、首次下载模型后即可离线使用,并且更接近“边读边听”而非“把整个 PDF 扔进通用 TTS 盒子”的工具。 目前可用的功能: - PDF + EPUB 阅读 - 逐句播放,实时高亮 - 可调页眉/页脚边距(避免重复的页面装饰被朗读) - 从上次停下的位置继续 - 语义搜索(含义 + 关键词),本地嵌入 - 导出 MP3 有声书(仅限桌面端) - 在可用时启用硬件加速(CoreML / DirectML / CUDA) 请做好遇到粗糙边缘的心理准备。我已在跟踪的已知缺口: - 多栏布局、表格、代码、公式 - 脚注/引用、目录/索引页、标题/侧栏 - 扫描版 PDF(暂无 OCR) - 非英语 / 从右到左语言 - 语音与语速控制有限 - 公司名称 / 小众技术术语的发音可能错误(这主要是 Kokoro 词表的问题——我自己正在编写 Rust 绑定) 平台:macOS Apple Silicon、Windows x64、Linux x64(glibc ≥ 2.38)。目前暂无 Intel Mac 构建。首次启动时会下载语音模型(约 130 MB,来自 Hugging Face)。之后即可离线使用。 链接 GitHub: https://github.com/pguso/speechfony 下载: https://github.com/pguso/speechfony/releases 如果你在真正会去听的实际文档(论文、手册、书籍、报告)上试过,请告诉我: - 哪些地方出错了或听起来不对? - 哪些 PDF/EPUB 版式让提取或播放变得混乱? - 缺少什么会让你经常使用它? 欢迎提交 Issue 和 PR。完全开源(MIT 许可证)。
查看原文

相似文章

@wsl8297: 想把电子书或文档做成有声书?很多工具不是声音太“机器人”,就是不支持字幕同步,折腾一圈还是不满意。 我后来发现了开源项目 Abogen:支持 ePub、PDF、纯文本等,一键转高质量音频,还能自动生成同步字幕。 它底层用 Kokoro 语…

X AI KOLs Timeline

Abogen 是一个开源工具,可将 ePub、PDF 等文档一键转为高质量音频,并自动生成同步字幕,支持语音混合器和多种部署方式。

通过持久化流在Jetson上部署本地AI服务

Lobsters Hottest

一位开发者记录了在NVIDIA Jetson Orin Nano上使用Kokoro-82M和持久化流构建自托管文本转语音应用的过程,实现了可靠的本地AI推理和可共享的音频输出。