从不可听输入到模型失效:LALMs中的低频安全风险

Hugging Face Daily Papers 论文

摘要

一篇论文,介绍了ILL(一种不可听的低频红队测试方法,用于暴露音频语言模型的安全漏洞)和DRG(一种防御方法,可检测分布偏移并请求第二次录音以恢复准确性)。

大型音频语言模型(LALMs)在理解多样音频输入方面展现了强大的能力。这种多样性包括人类听不到的低频信号,但这些信号仍能进入模型并影响其生成结果。然而,此类低频输入对LALMs的实际影响在很大程度上仍未得到探索。在本文中,我们提出了间歇性低频锁定(ILL),一种在黑盒设置下使用通用波形模板来评估这种风险的不可听红队测试方法。ILL使用句子注意力尺度估计来确定活动区间,并利用频率混淆迁移从语料库频谱变化中构建具有连续相位的低频波形。为了缓解这一风险,我们提出了分布性重新查询防护(DRG),用于检测低频分布偏移并有条件地请求第二次录音以进行语义恢复。在六个LALMs和多个音频理解任务中,ILL将准确率降低了高达67个百分点,同时获得的人类可听性平均评分为1.33,接近干净音频的1.17;DRG在干净重新获取后将平均受攻击准确率从28.5\%提高到46.1\%。这些发现识别了LALMs中一个此前被忽视的安全风险,并为未来鲁棒音频理解研究奠定了基础。
查看原文
查看缓存全文

缓存时间: 2026/08/14 15:29

论文页面 - 从不可闻输入到模型故障:LALMs 中的低频安全风险

来源:https://huggingface.co/papers/2608.09158

摘要

研究人员提出了一种黑盒红队测试方法,利用人耳听不到的低频波形来暴露音频语言模型中的漏洞,同时提出了一种防御方法,用于检测分布偏移并请求第二次录音以恢复准确率。

大型音频语言模型(大型音频语言模型,LALMs)已经展现出理解各种音频输入的强大能力。这种多样性包括人类听不到的低频信号,这些信号仍然可以进入模型并影响其生成。然而,此类低频输入对 LALMs 的实际影响在很大程度上仍未得到探索。在本文中,我们提出了 Intermittent Low-Frequency Lockout(ILL),一种不可闻的红队测试方法,通过在黑盒设置中使用通用波形模板来评估这种风险。ILL 使用 Sentence Attention Scale Estimation 来确定活动区间,并利用 Frequency Confusion Transfer 从语料库频谱变化中构建具有连续相位的低频波形。为了缓解这一风险,我们提出了 Distributional Requery Guard(DRG),用于检测低频分布偏移,并有条件地请求第二次录音以实现语义恢复。在六个 LALMs 和多个音频理解任务中,ILL 将准确率降低了最多 67 个百分点,同时获得 1.33 的平均人类可听性评分,接近干净音频的 1.17;DRG 在干净重新获取后将平均受攻击准确率从 28.5% 提高到 46.1%。这些发现识别出了 LALMs 此前被忽视的安全风险,并为未来关于稳健音频理解的研究奠定了基础。

查看 arXiv 页面查看 PDF添加到收藏

在您的 agent 中获取此论文:

hf papers read 2608\.09158

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.09158 以从本页链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.09158 以从本页链接它。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.09158 以从本页链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接它。

相似文章

语音AI系统易受隐藏音频攻击

Hacker News Top

新研究表明,不易察觉的音频信号能以79-96%的成功率劫持大型音频语言模型(LALMs),迫使其执行未经授权的命令,如网络搜索或发送电子邮件。这种被称为AudioHijack的技术针对生成式模型,无论用户输入如何都能生效,对语音AI系统构成严重安全风险。