标签
FD-VAD 提出一种无需 ASR、流式运行的语义端点检测方法,将因果音频窗口直接映射为 Continue/Stop 决策,适用于全双工语音智能体。该方法结合冻结的语音编码器与参数高效适配的语言模型,在 TurnBench 上取得了最先进(state-of-the-art)的 EOT 召回率。
FRAUDSkill是一个用于音频反欺诈检测的结构化冻结权重适配框架,它通过优化外部技能程序而不修改底层音频语言模型,实现了更高的准确性和更少的无效输出。
本文介绍了一种无指令的纯对齐方法,用于构建大型音频-语言模型,该方法通过冻结LLM和音频编码器,仅在自生成数据上训练一个轻量级投影器,实现了与传统多阶段流程相比更少数据下的竞争性性能。
首次从神经元层面解释大型音频语言模型如何编码多语言情感,引入一致性正则化融合(Consistency-Regularized Fusion)以识别跨12种语言的多语言情感神经元,并展示了跨语言迁移的益处。
引入了反事实审计,以测试音频语言模型评委在评估语音到语音响应时是否真正使用副语言证据,结果发现对比性成功往往高估了原生可靠性,而相似的准确率可能掩盖Gemini、GPT和开放模型之间不同的失败模式。
一篇论文,介绍了ILL(一种不可听的低频红队测试方法,用于暴露音频语言模型的安全漏洞)和DRG(一种防御方法,可检测分布偏移并请求第二次录音以恢复准确性)。
介绍了ESCUCHA,这是首个用于评估大型音频语言模型在异质声学条件和推理能力方面的西班牙语语音理解基准,包含来自多种真实世界来源的1000个精选问题。
介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。
VIBE是一个框架,通过使用人类录制的语音进行开放式任务来评估大型音频语言模型中的生成偏差,揭示了由性别和口音线索触发的系统性偏差。
本文介绍了Afrispeech Semantics,这是一个用于评估音频语言模型在语义推理任务上的基准测试,包括跨多种领域和口音的蕴含、一致性、合理性、口音漂移和口音抑制。
KoALa-Bench 推出了一套聚焦韩语的基准测试,从六个维度评估大型音频语言模型,包括全新的语音忠实度指标与韩国本土文化内容。