标签
本文分析了像Moshi和PersonaPlex这样的全双工语音LLMs中的虚假起始问题,并介绍了一种基于因果分析的推理时缓解方法,无需重新训练即可抑制这些问题。
本文详细介绍了Eloquence团队在Interspeech 2026 MLC-SLM挑战赛任务2中的方法,该任务涉及使用语音LLMs进行多语言多选问答,结合微调、上下文学习和检索系统。
本文比较了上下文偏置方法和语音大语言模型在自动语音识别中识别罕见词和新词的表现,报告了在朗读语音和非朗读语音中词错误率的权衡。
介绍了Latent-IM,一个从冻结的语音LLM中恢复交互管理的框架,利用基于激活的选择和引导来进行会话动作。相比未引导的主干模型,它将端到端动作准确率提升了12.5个百分点。
本文通过模拟两个Moshi模型实例之间的对话,利用CKA测量表征对齐并使用LSTM探针预测话轮边界,分析了全双工语音对话模型中的同步与话轮转换动态。