大型音频语言模型综述:泛化、可信度与展望
摘要
一篇全面综述,回顾了大型音频语言模型(LALMs)的可信度挑战,包括跨模态越狱和声学后门等漏洞,并提出了纵深防御路线图。
查看缓存全文
缓存时间: 2026/05/21 10:10
论文页面 - 大型音频语言模型综述:泛化能力、可信度与展望
来源:https://huggingface.co/papers/2605.20266 作者:
(此处省略作者列表,应保持原文格式)
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
大型音频语言模型尽管性能不断提升,但仍面临显著的可信度挑战,需要建立全面的框架来应对安全漏洞和防御策略。
由大型语言模型(Large Language Models, LLMs)建立的基础能力为多模态大型语言模型(Multimodal Large Language Models, MLLMs)铺平了道路,而大型音频语言模型(Large Audio Language Models, LALMs)则是实现通用听觉智能的关键。尽管其性能卓越,但LALMs能力的提升速度已显著快于确保其可信度的系统性框架的发展。本综述对LALMs的内在机制进行了全面研究,详细阐述了促进涌现推理的架构创新和对齐算法。具体而言,我们分析了向统一端到端框架(end-to-end frameworks)的转变以及连续声学信号(acoustic signals)的整合如何从本质上扩大了攻击面(attack surface)。为了严格评估这些范式中的风险,我们建立了一个全面的可信度分类体系,将关键漏洞分类,例如跨模态越狱(cross-modal jailbreaking)、潜在声学后门(acoustic backdoors)和生物特征隐私泄露(biometric privacy leakage)。我们通过六大分析支柱综述了最新技术:幻觉(hallucination)、鲁棒性(robustness)、安全性(safety)、隐私(privacy)、公平性(fairness)和认证(authentication)。成熟的攻击手段与不成熟的防御之间存在的深刻失衡,进一步验证了以音频为中心的智能所面临的关键可信度差距和多维风险。最后,我们提出了一项战略路线图,倡导采用“纵深防御”(Defense-in-Depth)架构、因果听觉世界建模(causal auditory world modeling)和内在表示工程(intrinsic representation engineering),以弥合经验性能与内在可信音频智能之间的鸿沟。我们的项目已上传至 GitHub:https://github.com/Kwwwww74/Awesome-Trustworthy-AudioLLMs。
查看 arXiv 页面 (https://arxiv.org/abs/2605.20266) 查看 PDF (https://arxiv.org/pdf/2605.20266) GitHub (https://github.com/Kwwwww74/Awesome-Trustworthy-AudioLLMs) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.20266)
在您的代理中获取此论文:
hf papers read 2605.20266
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.20266 以从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.20266 以从此页面链接。
引用此论文的 Spaces 0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.20266 以从此页面链接。
包含此论文的收藏 0
没有收藏包含此论文
请将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
语音AI系统易受隐藏音频攻击
新研究表明,不易察觉的音频信号能以79-96%的成功率劫持大型音频语言模型(LALMs),迫使其执行未经授权的命令,如网络搜索或发送电子邮件。这种被称为AudioHijack的技术针对生成式模型,无论用户输入如何都能生效,对语音AI系统构成严重安全风险。
大型语言模型(LLM)与生成式人工智能在网络安全与隐私中的应用:双重用途风险、AI生成恶意软件、可解释性及防御策略综述
一项全面综述,考察了LLM和生成式AI在网络安全中的双重用途风险与收益,涵盖AI生成的恶意软件、防御策略和可解释性,并包含来自主要平台的案例研究。
大语言模型可信性无训练方法的系统研究
一项系统性研究,评估了改进大语言模型可信性的无训练方法,将方法分为输入、内部和输出级干预,同时分析可信性、实用性和鲁棒性之间的权衡。
TrustLDM:语言扩散模型可信度基准测试
介绍TrustLDM,一个全面评估语言扩散模型安全性、隐私性和公平性的基准测试,揭示其对齐行为在恶意后上下文环境下会退化。提出自动评估框架TrustLDM-Auto,用于识别脆弱配置。
多语言语言模型中有毒内容检测与缓解策略综述
本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。