speaker-attribution

标签

Cards List
#speaker-attribution

微软发布VibeVoice-ASR-Streaming流式语音识别模型

Reddit r/LocalLLaMA · 5小时前 缓存

微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。

0 人收藏 0 人点赞
#speaker-attribution

HEAR 谁说了什么:通过反事实语音锚定解锁说话人归属推理

arXiv cs.CL · 2天前 缓存

本文介绍了 HEAR,一个用于评估语音语言模型中说话人归属推理的基准测试,并提出了 A2R,一个使用反事实数据优化的 30B 模型,以提升在多说话人任务上的性能。

0 人收藏 0 人点赞
#speaker-attribution

从语音到交互:鸡尾酒会场景中的多模态系统分析

arXiv cs.CL · 2026-08-11 缓存

本文分析了针对CHiME-9 MCoRec鸡尾酒会场景的多模态系统,比较了音视频目标语音分离、改进的识别、基于大语言模型的对话分组等设计策略,发现仅语音重叠并不能解释性能差异。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈