标签
提出了一种说话人解耦的音节标记化方法,利用分块回归从原始语音中学习语言内容标记,在音节边界检测和聚类方面达到最先进水平,并提升了语音语言模型的性能。
本文提出SpeechCombine,一种无需任何指令微调的指令跟随语音语言模型,仅通过语音预训练和一种权重组合策略,将文本大语言模型的能力迁移到语音领域。
BayLing-Duplex是一种原生全双工语音语言模型,使单一自回归大语言模型无需外部VAD模块即可管理轮流发言与打断,实现了高成功率,并相比先前模型提升了回复质量。
Raon-Speech是一个9B参数的语音语言模型,支持英语和韩语的理解、回答和生成,并具有全双工扩展Raon-SpeechChat,可实现自然的实时对话。它在42个基准测试上取得了强劲的性能,并且完全开源。