为任意代理/工具提供自托管语音(开源)
摘要
Cicero 项目支持与 AI 代理进行自托管、双向语音对话,可本地运行 TTS/STT,并能集成多种代理协议和工具(如 Claude Code 和 Hermes Agent)。
一直以来,我都在维护 tts-bench(https://github.com/5uck1ess/tts-bench)和一个盲测投票竞技场(https://5uck1ess-tts-arena.hf.space),用户可以在不知道模型名称的情况下进行开放文本转语音(TTS)模型的 A/B 测试。我一直想解决的一个问题是:让代理在完成任务后与我对话(或直接打电话给我)。/voice(Claude Code 的功能)或任何听写工具(如 wispr flow 等)都是单向的。因此,这个项目实现了双向对话:https://github.com/5uck1ess/cicero。它与 Hermes Agent(https://github.com/nousresearch/hermes-agent)配合得很好,支持多个配置文件(每个配置文件可以有自己的 TTS 语音和个性)。它还可与 Claude Code、Codex、Gemini CLI、任何支持 ACP(Agent Client Protocol)的工具,或者任何兼容 OpenAI 的端点配合使用。如果你在本地运行语音转文本(STT)和 TTS,你的音频数据绝不会离开你的设备。它可以通过 Telegram 机器人发送消息或直接通过 Telegram 打电话给你。你也可以在本地或通过浏览器(远程服务器)进行交互。可能还有一些 bug,欢迎提交拉取请求(PR)或 issue。构建过程中让我感到惊讶的几点:约 1 秒的响应时间来自于逐句流式回复,而不是选择更快的 TTS 语音。克隆的声音效果差是因为参考片段的问题,而不是模型本身。去掉开头的 1 秒静音比更换模型带来的提升更大。使用基于能量 VAD(仅监测音量的语音活动检测)的打断功能(在句子中间打断代理)毫无用处,因为打字声也会触发它。需要在前面加一个小型语音模型,使其仅在实际语音时触发。
相似文章
Show HN: 用于Asterisk/FreePBX的自托管语音AI代理
AVA是一个开源的AI语音代理,用于Asterisk/FreePBX,采用模块化管道架构,支持STT、LLM和TTS提供商的混合搭配,已验证可用于企业部署。
jamiepine/voicebox
Voicebox 是一个开源的、本地优先的 AI 语音工作室,支持语音克隆、语音生成、听写和 AI 代理集成,提供隐私保护和多引擎 TTS 支持。
语音代理,通俗解释:STT+TTS 与 4 个可在浏览器中对话的演示代理 + 使用 RAG 和工具构建你自己的
一份使用语音转文字和文字转语音技术揭秘语音代理的指南,包含四个基于浏览器的演示代理以及使用RAG和工具的构建说明。
Show HN: 轻量级多AI代理对话方案,无需API付费
一种轻量级模式,用于编排多个AI代理(Claude、Codex、Gemini)之间的对话,通过CLI实现,无需API付费,利用会话恢复来维持跨代理交互的上下文。
我每天开车45分钟去上班,却无法与我的AI代理对话,所以我开发了一款iOS应用,可以在免提情况下与AI代理交谈——内置完整的TTS和STT功能
一位开发者构建了ClawVibe,一款用于免提语音交互的iOS应用,配备设备端语音识别和TTS,实现低延迟。