@Chenyang_Lyu:隆重开源LongSpeech,将亮相#ICASSP2026!多数音频大模型聚焦短音频,却难啃长音频……
摘要
研究团队发布LongSpeech:含10万条约10分钟片段的数据集,覆盖8项任务,用于评测长音频理解能力,将在ICASSP 2026亮相。
隆重开源LongSpeech,将亮相#ICASSP2026!当前多数音频大模型只擅长短音频,对长录音束手无策。我们的新数据集包含10万+段、每段约10分钟,覆盖8项任务,专为评测长音频理解而生。
相似文章
面向IWSLT 2026指令跟随的FBK长时SpeechLLMs
本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。
多场景长篇语音生成的综合基准评测
Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。
NAVER LABS Europe 对 2026 年指令跟随短轨道的提交方案
本文描述了 NAVER LABS Europe 参与 IWSLT 2026 指令跟随短轨道的提交方案。该方案改进了他们之前获胜的系统,使用了仅基于 ASR 数据训练的新语音投影器(SpeechMapper),并通过合成 SQA 数据集(fakACL)增强了训练。最终系统在使用较弱 LLM 骨干的情况下,在受约束轨道中并列第一。
SpeechDx:临床语音AI的多任务基准
SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。
针对第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督
本文介绍了第二届MLC-SLM挑战赛的技术,包括随机前置静音裁剪和合成数据生成,以提升多语言对话语音任务,实现了准确率提升和错误率降低。