标签
本文分析了针对CHiME-9 MCoRec鸡尾酒会场景的多模态系统,比较了音视频目标语音分离、改进的识别、基于大语言模型的对话分组等设计策略,发现仅语音重叠并不能解释性能差异。
本文介绍了使用来自wav2vec 2.0的语音熵对RAMPHO情节缓冲区进行计算机模拟,以分离多说话人环境中的信息掩蔽和能量掩蔽,揭示了一个认知-声学帕累托优化问题。
OpenAI 展示了新语音模型在嘈杂环境下的背景鲁棒性,能准确识别对话对象、理解上下文,并允许用户自然打断,实现流畅的多人互动。