标签
微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。
本文介绍了 HEAR,一个用于评估语音语言模型中说话人归属推理的基准测试,并提出了 A2R,一个使用反事实数据优化的 30B 模型,以提升在多说话人任务上的性能。
本文分析了针对CHiME-9 MCoRec鸡尾酒会场景的多模态系统,比较了音视频目标语音分离、改进的识别、基于大语言模型的对话分组等设计策略,发现仅语音重叠并不能解释性能差异。