标签
VoxMem是一个用于评估大型音频语言模型中多模态记忆的基准测试,重点考察声学证据类型和多会话记忆操作。它揭示了当前模型中的显著差距,例如与语义内容相比,说话者身份和副语言线索的保留较差。
本文提出 SPARE 方法,通过引入与语义目标对齐的寄存器令牌(利用余弦相似度损失)来增强大型音频语言模型中的音频推理能力,从而在无额外推理成本的情况下改善零样本推理性能。
本文探讨了针对Large Audio-Language Models的机器遗忘技术,以移除语音问答任务中的敏感信息,并展示了将隐私泄露降低高达80%同时保持性能的方法。
本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。
本文介绍一种语义感知混合效应回归框架,用于衡量 Large Audio Language Models 中的公平性,通过控制语义变化和说话人身份,以获得更稳健和可解释的偏差估计。
该论文引入了连续音频思考(CoAT)框架,为大型音频语言模型配备了一个连续的潜在工作空间,用于在生成文本响应之前组织声学信息,从而在音频推理、理解和转录任务中提升性能,且不增加额外的解码成本。
MusTBench是一个用于评估大型音频-语言模型(LALMs)在音乐理解中的时间定位能力的基准。作者提出了MusT,一种四阶段训练方案,能显著提升现有模型的时间定位性能。
新研究表明,不易察觉的音频信号能以79-96%的成功率劫持大型音频语言模型(LALMs),迫使其执行未经授权的命令,如网络搜索或发送电子邮件。这种被称为AudioHijack的技术针对生成式模型,无论用户输入如何都能生效,对语音AI系统构成严重安全风险。
一篇全面综述,回顾了大型音频语言模型(LALMs)的可信度挑战,包括跨模态越狱和声学后门等漏洞,并提出了纵深防御路线图。