为任意代理/工具提供自托管语音(开源)

Reddit r/LocalLLaMA 工具

摘要

Cicero 项目支持与 AI 代理进行自托管、双向语音对话,可本地运行 TTS/STT,并能集成多种代理协议和工具(如 Claude Code 和 Hermes Agent)。

一直以来,我都在维护 tts-bench(https://github.com/5uck1ess/tts-bench)和一个盲测投票竞技场(https://5uck1ess-tts-arena.hf.space),用户可以在不知道模型名称的情况下进行开放文本转语音(TTS)模型的 A/B 测试。我一直想解决的一个问题是:让代理在完成任务后与我对话(或直接打电话给我)。/voice(Claude Code 的功能)或任何听写工具(如 wispr flow 等)都是单向的。因此,这个项目实现了双向对话:https://github.com/5uck1ess/cicero。它与 Hermes Agent(https://github.com/nousresearch/hermes-agent)配合得很好,支持多个配置文件(每个配置文件可以有自己的 TTS 语音和个性)。它还可与 Claude Code、Codex、Gemini CLI、任何支持 ACP(Agent Client Protocol)的工具,或者任何兼容 OpenAI 的端点配合使用。如果你在本地运行语音转文本(STT)和 TTS,你的音频数据绝不会离开你的设备。它可以通过 Telegram 机器人发送消息或直接通过 Telegram 打电话给你。你也可以在本地或通过浏览器(远程服务器)进行交互。可能还有一些 bug,欢迎提交拉取请求(PR)或 issue。构建过程中让我感到惊讶的几点:约 1 秒的响应时间来自于逐句流式回复,而不是选择更快的 TTS 语音。克隆的声音效果差是因为参考片段的问题,而不是模型本身。去掉开头的 1 秒静音比更换模型带来的提升更大。使用基于能量 VAD(仅监测音量的语音活动检测)的打断功能(在句子中间打断代理)毫无用处,因为打字声也会触发它。需要在前面加一个小型语音模型,使其仅在实际语音时触发。
查看原文

相似文章

jamiepine/voicebox

GitHub Trending (daily)

Voicebox 是一个开源的、本地优先的 AI 语音工作室,支持语音克隆、语音生成、听写和 AI 代理集成,提供隐私保护和多引擎 TTS 支持。