标签
本文分析了像Moshi和PersonaPlex这样的全双工语音LLMs中的虚假起始问题,并介绍了一种基于因果分析的推理时缓解方法,无需重新训练即可抑制这些问题。
Nari Labs 推出 Qwen3-TTS 和 Qwen3-ASR 模型,在免费公开测试中提供高准确率、低延迟和成本效益,同时提供优化的 API 和服务用于生产部署。
GitHub 上的 Awesome-SpeechLM-Survey 仓库系统整理了语音语言模型的研究脉络,包括分类框架、代表模型、训练数据集和评测基准,是了解该领域的知识地图。