标签
本文介绍了Lychee-FD,一种原生端到端全双工口语语言模型,通过层次化参数分离策略缓解模态干扰,在语音智能和交互流畅性方面取得了显著提升。
FlexiSLM 为语音语言模型引入动态帧率能力,适用于语音输入与输出,性能优于固定帧率模型,并实现可控推理速度。
VITA-QinYu 是一个具有表现力的端到端口语语言模型,支持角色扮演和唱歌功能。该模型在 15.8 万小时的数据集上进行训练,在表现力和对话准确性方面均优于同类模型。