@Chenyang_Lyu:隆重开源LongSpeech,将亮相#ICASSP2026!多数音频大模型聚焦短音频,却难啃长音频……

X AI KOLs Following 论文

摘要

研究团队发布LongSpeech:含10万条约10分钟片段的数据集,覆盖8项任务,用于评测长音频理解能力,将在ICASSP 2026亮相。

隆重开源LongSpeech,将亮相#ICASSP2026!当前多数音频大模型只擅长短音频,对长录音束手无策。我们的新数据集包含10万+段、每段约10分钟,覆盖8项任务,专为评测长音频理解而生。
查看原文

相似文章

面向IWSLT 2026指令跟随的FBK长时SpeechLLMs

arXiv cs.CL

本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。

多场景长篇语音生成的综合基准评测

Hugging Face Daily Papers

Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。

NAVER LABS Europe 对 2026 年指令跟随短轨道的提交方案

arXiv cs.CL

本文描述了 NAVER LABS Europe 参与 IWSLT 2026 指令跟随短轨道的提交方案。该方案改进了他们之前获胜的系统,使用了仅基于 ASR 数据训练的新语音投影器(SpeechMapper),并通过合成 SQA 数据集(fakACL)增强了训练。最终系统在使用较弱 LLM 骨干的情况下,在受约束轨道中并列第一。

SpeechDx:临床语音AI的多任务基准

arXiv cs.AI

SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。