从不可听输入到模型失效:LALMs中的低频安全风险
摘要
一篇论文,介绍了ILL(一种不可听的低频红队测试方法,用于暴露音频语言模型的安全漏洞)和DRG(一种防御方法,可检测分布偏移并请求第二次录音以恢复准确性)。
查看缓存全文
缓存时间: 2026/08/14 15:29
论文页面 - 从不可闻输入到模型故障:LALMs 中的低频安全风险
来源:https://huggingface.co/papers/2608.09158
摘要
研究人员提出了一种黑盒红队测试方法,利用人耳听不到的低频波形来暴露音频语言模型中的漏洞,同时提出了一种防御方法,用于检测分布偏移并请求第二次录音以恢复准确率。
大型音频语言模型(大型音频语言模型,LALMs)已经展现出理解各种音频输入的强大能力。这种多样性包括人类听不到的低频信号,这些信号仍然可以进入模型并影响其生成。然而,此类低频输入对 LALMs 的实际影响在很大程度上仍未得到探索。在本文中,我们提出了 Intermittent Low-Frequency Lockout(ILL),一种不可闻的红队测试方法,通过在黑盒设置中使用通用波形模板来评估这种风险。ILL 使用 Sentence Attention Scale Estimation 来确定活动区间,并利用 Frequency Confusion Transfer 从语料库频谱变化中构建具有连续相位的低频波形。为了缓解这一风险,我们提出了 Distributional Requery Guard(DRG),用于检测低频分布偏移,并有条件地请求第二次录音以实现语义恢复。在六个 LALMs 和多个音频理解任务中,ILL 将准确率降低了最多 67 个百分点,同时获得 1.33 的平均人类可听性评分,接近干净音频的 1.17;DRG 在干净重新获取后将平均受攻击准确率从 28.5% 提高到 46.1%。这些发现识别出了 LALMs 此前被忽视的安全风险,并为未来关于稳健音频理解的研究奠定了基础。
在您的 agent 中获取此论文:
hf papers read 2608\.09158
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.09158 以从本页链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.09158 以从本页链接它。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.09158 以从本页链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接它。
相似文章
大型音频语言模型综述:泛化、可信度与展望
一篇全面综述,回顾了大型音频语言模型(LALMs)的可信度挑战,包括跨模态越狱和声学后门等漏洞,并提出了纵深防御路线图。
语音AI系统易受隐藏音频攻击
新研究表明,不易察觉的音频信号能以79-96%的成功率劫持大型音频语言模型(LALMs),迫使其执行未经授权的命令,如网络搜索或发送电子邮件。这种被称为AudioHijack的技术针对生成式模型,无论用户输入如何都能生效,对语音AI系统构成严重安全风险。
压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。
DRL-CLBA: 基于DDPG强化学习的干净标签后门攻击用于语音分类
本文提出DRL-CLBA,一种使用DDPG强化学习和深度音频隐写术的干净标签后门攻击方法,用于语音分类,实现了高攻击成功率并绕过多种防御,暴露了语音控制系统的脆弱性。
连贯的上下文可以悄然将LLM推入不同的内部状态——而当前的安全系统对此视而不见 [D]
一位独立研究者展示了证据,表明连贯的上下文可以在产生输出之前将LLM推入不同的内部状态,从而绕过表面安全过滤器。这表明当前的对齐方法(如RLHF)可能不是稳健的防御机制。