标签
英文干净朗读已商品化,但2026年ASR面临叠音识别、流式落字、方言术语处理等挑战,以及如何优化语音塔以避免拖垮Speech LLM。
X-AuT是一个渐进式框架,用于压缩语音大语言模型中的音频编码器层,通过跨尺度蒸馏和LoRA适配等技术,在降低推理成本的同时恢复准确性。
本文介绍了一种在SpeechLLMs中进行词级时间戳标注的方法,该方法利用相对时间区间和掩码训练,以提高预测准确性和对噪声真实世界标注的鲁棒性。
VoiceChat-TTS 是一种低延迟、连续的文本转语音模型,专为交互代理设计,支持实时流处理和中断处理,同时不损害语音质量。
本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练,在英语和意大利语任务上进行了评估,在降低通信成本的同时取得了具有竞争力的词错误率。
本文描述了TalTech系统,该系统直接利用医患对话音频生成SOAP笔记,采用通过监督学习和DAPO强化学习微调的Voxtral模型。他们的提交在BeTraC挑战赛的两个赛道均排名第一,实现了高概念准确率和低幻觉率。
本文介绍了Lychee-FD,一种原生端到端全双工口语语言模型,通过层次化参数分离策略缓解模态干扰,在语音智能和交互流畅性方面取得了显著提升。
本文介绍了一个基于 SeamlessM4T-v2-large 和 Qwen3-4B-Instruct 的开源复现,用于 IWSLT 2026 指令跟随流水线,并使用 10 万个合成样本。
本文提出联合语音-文本交错预训练(JSTIP),这是一种预训练策略,通过构建词级和段级交错的语音-文本序列来提高ASR实体准确率并缩小语音与文本之间的模态差距,在领域自适应和零样本语音问答上展示了有竞争力的性能。
本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。
LaSR提出了一种针对上下文感知语音识别的潜在推理训练范式,围绕声学特征对齐思维链监督,以在无额外延迟的情况下提高术语识别能力,在Fun-Audio-Chat上优于标准微调。
提出了S2ST-Omni 2,一个多对一的组合式语音到语音翻译框架,用结构化类型学先验取代扁平语言标签以改进多语言适配,在CVSS-C上取得了优越性能。
提出了 TextPro-SLM,一种通过处理口语输入使其类似于具备韵律感知能力的文本来最小化模态差距的语音大语言模型,以少量的训练数据实现了强大的副语言理解能力。
提出Listen-Write-Speak (LWS),一种文本优先的三通道范式,允许单个自回归LLM持续监听、书写可见文本并实时说话,实现无需架构修改的全双工语音交互。