large-audio-language-models

标签

Cards List
#large-audio-language-models

VoxMem:评估大型音频语言模型中的多模态记忆基准测试

Hugging Face Daily Papers ↗ · 2026-09-26 缓存

VoxMem是一个用于评估大型音频语言模型中多模态记忆的基准测试,重点考察声学证据类型和多会话记忆操作。它揭示了当前模型中的显著差距,例如与语义内容相比,说话者身份和副语言线索的保留较差。

0 人收藏 0 人点赞
#large-audio-language-models

基于语义摘要预测的音频推理增强

arXiv cs.CL ↗ · 2026-09-21 缓存

本文提出 SPARE 方法,通过引入与语义目标对齐的寄存器令牌(利用余弦相似度损失)来增强大型音频语言模型中的音频推理能力,从而在无额外推理成本的情况下改善零样本推理性能。

0 人收藏 0 人点赞
#large-audio-language-models

Large Audio-Language Models语音问答的机器遗忘

arXiv cs.LG ↗ · 2026-09-15 缓存

本文探讨了针对Large Audio-Language Models的机器遗忘技术,以移除语音问答任务中的敏感信息,并展示了将隐私泄露降低高达80%同时保持性能的方法。

0 人收藏 0 人点赞
#large-audio-language-models

倾听潜在状态:大型音频语言模型中通过隐藏状态交互的自我纠正语音识别

arXiv cs.CL ↗ · 2026-09-04 缓存

本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。

0 人收藏 0 人点赞
#large-audio-language-models

通过语义感知偏差估计衡量 Large Audio Language Models 中的公平性

arXiv cs.CL ↗ · 2026-08-17 缓存

本文介绍一种语义感知混合效应回归框架,用于衡量 Large Audio Language Models 中的公平性,通过控制语义变化和说话人身份,以获得更稳健和可解释的偏差估计。

0 人收藏 0 人点赞
#large-audio-language-models

面向大型音频语言模型的连续音频思考

arXiv cs.AI ↗ · 2026-06-18 缓存

该论文引入了连续音频思考(CoAT)框架,为大型音频语言模型配备了一个连续的潜在工作空间,用于在生成文本响应之前组织声学信息,从而在音频推理、理解和转录任务中提升性能,且不增加额外的解码成本。

0 人收藏 0 人点赞
#large-audio-language-models

MusTBENCH:音乐LLMs中时间定位的基准测试与进展

arXiv cs.CL ↗ · 2026-05-29 缓存

MusTBench是一个用于评估大型音频-语言模型(LALMs)在音乐理解中的时间定位能力的基准。作者提出了MusT,一种四阶段训练方案,能显著提升现有模型的时间定位性能。

0 人收藏 0 人点赞
#large-audio-language-models

语音AI系统易受隐藏音频攻击

Hacker News Top ↗ · 2026-05-18 缓存

新研究表明,不易察觉的音频信号能以79-96%的成功率劫持大型音频语言模型(LALMs),迫使其执行未经授权的命令,如网络搜索或发送电子邮件。这种被称为AudioHijack的技术针对生成式模型,无论用户输入如何都能生效,对语音AI系统构成严重安全风险。

0 人收藏 0 人点赞
#large-audio-language-models

大型音频语言模型综述:泛化、可信度与展望

Hugging Face Daily Papers ↗ · 2026-05-18 缓存

一篇全面综述,回顾了大型音频语言模型(LALMs)的可信度挑战,包括跨模态越狱和声学后门等漏洞,并提出了纵深防御路线图。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈