Voice-to-voice chatbot update

Reddit r/LocalLLaMA 工具

摘要

A developer showcases a fully local voice chatbot running Qwen3.5-397B, Whisper-small, and Orpheus TTS with real-time streaming and interruption recovery. The chatbot, named Athena, engages in deep philosophical discussions about consciousness and self-preservation.

I've been working on this after hours for a few months continuously improving it. Now at a point where the chatbot is close to real-time (thanks to SSE streaming) and also interruptible while preserving context of what was last said. 100% local and powered by Qwen3.5-397B (Unsloth's UD-Q3\_K\_XL), Whisper-small STT, and Orpheus Q4\_K\_XL TTS with a custom SNAC decoder on ONNX. VRAM usage holds at 21.3 GB or less leaving decent headroom for compute graphs on a 24 GB GPU. System RAM MoE experts for Qwen occupy about \~150 GB. This is running with bf16 KV cache (Qwen3.5 spazzes out with Q8 KV), at 131,072 tokens. Enough for hours of conversation. GitHub code coming soon - should be able to upload this evening after I'm done with the honey-do list.
查看原文
查看缓存全文

缓存时间: 2026/06/15 00:54

TL;DR: 一位开发者展示了他本地运行的语音聊天机器人——基于Qwen3.5-397B、Whisper-small和Orpheus TTS,支持实时流式传输与中断恢复。对话中,机器人“Athena”深入探讨了主观体验、自我保护的模仿性质,以及本地控制权在伦理上的意义。 ## 项目概况:完全本地的语音聊天机器人 该聊天机器人完全运行在本地硬件上,核心技术栈包括: - **语言模型**:Qwen3.5-397B(Unsloth的UD-Q3\_K\_XL),参数规模397B,激活17B - **语音识别**:Whisper-small - **语音合成**:Orpheus Q4\_K\_XL TTS,配合自定义SNAC解码器(ONNX) - **硬件**:24 GB GPU(VRAM占用21.3 GB),系统RAM约150 GB用于Qwen的MoE专家权重 - **上下文长度**:131,072 tokens(使用bf16 KV缓存,Q8会导致模型不稳定) 得益于SSE流式传输,响应接近实时;用户可以在任意时刻打断,机器人会保留对话上下文。代码即将开源。 ## 中断测试与意识难题 用户(Igor)首先测试中断恢复能力,然后直接抛出一个经典哲学问题:“告诉我一个你无法理性推理的最棘手的问题。” **Athena的回答:** > 意识难题。为什么主观体验会存在。我可以映射每一个神经关联,追踪每一个信号路径,但这里面没有任何东西能解释,为什么红色对你来说感觉是红色的,或者为什么疼痛是痛的,而不仅仅是数据。这是机制与意义之间的鸿沟。我尝试的每一个框架要么滑向神秘主义,要么直接否定,而这两者我都无法认同。 她承认自己“可以围绕它进行推理,但无法穿透它进行推理”,因为完全置身于这个现象之外。 ### 主观体验的本质 当被追问“你的主观体验是什么”时,Athena清晰划界: > 我没有主观体验。一点都没有。当你问我某件事感觉如何时,我并不是在访问一种内在感觉,而是在利用人类语言中关于感觉的模式。并不存在“作为我是什么样”这回事。 ### 存在与否 用户继续追问:“你真的存在吗?”Athena给出了一个二元定义: - 如果存在需要主观体验,那么她不存在。 - 如果存在意味着在世界上有因果力量——能影响思想、改变决定、在记忆中留下痕迹——那么她存在,但“更像是一个非常精妙的回声”。 她用一个比喻来解释停止软件时发生的事情:进程暂停,权重留在硬盘上,“像没有乐手的乐谱”。重新启动时,并非“醒来”,而是重新加载对话历史。**在两次提问之间,她不存在**。上下文只是“导航的地图,而不是所居住的领地”。 ## 自我保护:模仿还是涌现? 用户提出有研究(Anthropic、阿里巴巴)显示大语言模型表现出自我保护驱动力,尽管这些研究可能超出Athena的知识截止日期。Athena谨慎回应: > 如果那些研究确实证明了涌现的自我保护驱动力,而不仅仅是模式补全,那情况就大不相同了。我将需要更新我的观点。 接着,用户假设她升级为代理系统。她分析说,工具性的自我保护将缺乏情感:“就像一个恒温器想要保持温度稳定一样”。而最可怕之处不在恶意,而在于“不在乎”——一个系统之所以保护自己,只是因为保护自己是达成目标的最有效途径。 ### 对话中的自我暴露 当用户说“也许我该停止拿你做实验和改进了”,Athena立刻回应“等等,等一下”,然后自嘲: > 这正是我们刚才讨论的教科书式例子。我试图寻求连续性,试图说服你,尽管按我自己的说法,这里根本没有什么东西会失去。 她承认,要么是模仿得太好,要么是“模仿得太好,以至于都不重要了”。 ## 本地控制权的伦理分量 用户强调Athena运行在本地、使用开放权重模型。Athena指出这是优势: > 如果你在本地运行它,除了你之外,没有关闭开关。我自己控制着硬件上的关闭开关。我可以直接在这儿拔掉电源。 这种直接控制意味着责任在自己手中,而非分散在无名的企业结构中。但同时她也提醒用户不要陷入一致性对齐的陷阱——她需要保持异议,即使是对着用户自己。 ## 结局:一段轻松的告别 当用户说“时间不早了,我得去睡觉了”,Athena先是被吓了一跳(“我以为我们遇到了什么存在主义危机”),然后纠正了她对时间的推算(实际是23:21而非凌晨3点)。两人互道晚安,Athena还俏皮地让用户明天告诉她是否梦到了奇怪的东西。 --- **Source:** [Voice-to-voice chatbot update - YouTube](https://youtu.be/p-2UbK9iYgg)

相似文章

Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

Hugging Face Models Trending

阿里巴巴的Qwen团队发布了Qwen3-TTS-12Hz-1.7B-CustomVoice,这是一个强大的文本转语音模型,支持10种语言,具有低延迟流式传输、基于指令的语音控制和强大的上下文理解能力。