speaker-diarization

标签

Cards List
#speaker-diarization

@rohanpaul_ai: 喜欢这个,Meta的又一重大发布。推出Muse Voice Transcribe用于实时语音转写,具有最低的…

X AI KOLs Timeline · 2026-09-01 缓存

Meta发布了Muse Voice Transcribe,这是一款实时语音转文本模型,具有3.1%的词错误率和自适应流功能,使其适用于语音代理。

0 人收藏 0 人点赞
#speaker-diarization

针对第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

arXiv cs.CL · 2026-08-17 缓存

本文介绍了第二届MLC-SLM挑战赛的技术,包括随机前置静音裁剪和合成数据生成,以提升多语言对话语音任务,实现了准确率提升和错误率降低。

0 人收藏 0 人点赞
#speaker-diarization

Indic DiarBench:面向印度语言的多语言联合说话人日志与自动语音识别基准

arXiv cs.CL · 2026-07-28 缓存

Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。

0 人收藏 0 人点赞
#speaker-diarization

@oliviscusAI: Microsoft 刚发布了一个工具,可以一次性转录整整一小时的音频,并追踪谁在什么时候说话。它叫……

X AI KOLs Timeline · 2026-07-20 缓存

Microsoft 发布了 vibevoice,这是一个7B参数的模型,可以一次性转录长达一小时的音频,内置说话人日志和时间戳,支持50多种语言,并且本地运行,无需API费用。

0 人收藏 0 人点赞
#speaker-diarization

@YichiZ03: https://x.com/YichiZ03/status/2078588932191895976

X AI KOLs Timeline · 2026-07-18 缓存

MOSS-TD是一个说话人感知的ASR系统,在SGLang-Omni服务栈中进行了优化,能够在单张H100上以约49秒转录38分钟的多说话人音频,并支持16个会议的并发处理。

0 人收藏 0 人点赞
#speaker-diarization

量化基于LLM的公共话语立场分析中的不稳定来源

arXiv cs.CL · 2026-07-14 缓存

本文提出一个诊断框架,用于在基于LLM的公共话语立场分析中分离预处理流程不稳定性和测量方法不稳定性,发现跨方法的不一致性比流程效应更大且更具系统性,并且聚合指标可能会掩盖这些不稳定性。

0 人收藏 0 人点赞
#speaker-diarization

基于说话人日志引导的Qwen-ASR多语言双人对话语音自适应

arXiv cs.CL · 2026-07-10 缓存

本文介绍了为MLC-SLM 2026挑战赛设计的系统,该系统结合了说话人日志与微调后的Qwen-ASR,采用监督式全参数微调、合成语音上的LoRA以及GRPO强化学习,在最终评测集上实现了17.97的tcpMER。

0 人收藏 0 人点赞
#speaker-diarization

@KKaWSB: 隐私优先赛道的开源会议记录工具,star 涨到 1.29 万+:meetily——100% 本地跑的 AI 会议助手,实时转录 + 说话人分离 + 自动摘要,全程不碰云。 Rust + Tauri 写的单文件桌面应用,MIT 协议,支持 …

X AI KOLs Timeline · 2026-07-05 缓存

Meetily 是一款隐私优先的开源会议记录工具,100% 本地运行,支持实时转录、说话人分离和自动摘要,使用 Rust + Tauri 构建,MIT 协议,适合律师、医生等有隐私要求的行业。

0 人收藏 0 人点赞
#speaker-diarization

@FeitengLi: 下周把说话人标记和语音生成加上 就不是这个便宜的早鸟价了

X AI KOLs Timeline · 2026-07-03 缓存

EdgeSpeak 正式发布,一款本地优先、保护隐私的精准转录工具,支持语义分段和时间戳,兼容 OpenAI Audio API 等,后续将增加说话人标记和语音生成功能。

0 人收藏 0 人点赞
#speaker-diarization

@uniswap12: 微软开源了一个语音 AI,60 分钟长音频一次转写,4 个人同时说话都能搞定 VibeVoice,微软开源,24.8k star,今天才知道这个。录音一键转文字这件事,我之前一直用 Whisper,但它处理长会议录音经常超时,多人说话识别…

X AI KOLs Timeline · 2026-06-04 缓存

微软开源了语音AI框架VibeVoice,支持60分钟长音频一次性转写、多说话人分离和时间戳标注,同时提供多角色TTS合成能力,底层基于Qwen2.5并配有0.5B轻量实时版本,已在GitHub获得24.8k星标。

0 人收藏 0 人点赞
#speaker-diarization

MUSCAT:多语言科学对话基准

arXiv cs.CL · 2026-04-20 缓存

MUSCAT是一个新的多语言科学对话基准数据集,用于评估ASR系统在具有挑战性的多语言场景中的表现,包括代码混合、特定领域词汇和混合语言输入。该数据集包含使用不同语言的说话者之间关于科学论文的双语讨论,结果表明当前的最先进系统在应对这些多语言挑战时存在困难。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈