RedVox:跨语言语音模型的安全与公平性差距
摘要
本文介绍了RedVox,一个用于语音模型的多语言安全与公平性基准。通过对五种语言中八个最先进模型的评估,发现存在持续漏洞,且在非英语环境和语音输入情况下更为严重。
arXiv:2606.26968v1 Announce Type: new
Abstract: 具备语音能力的模型越来越多地部署在跨语言的实际应用中。然而,它们在非英语环境及自然条件下的安全与公平性仍研究不足。我们调查了最先进语音模型发布中的安全报告实践,发现只有8%的记录包含了多语言分析。为弥补这一差距,我们引入了RedVox,一个基于真实语音构建的多语言音频与语音安全与公平性基准,涵盖五种语言(英语、法语、意大利语、西班牙语和德语)中的不安全和不公平的刻板印象请求。通过对八个最先进模型的评估,我们发现即使在非对抗条件下漏洞依然存在,在非英语语言中更为严重,并且当请求来自语音输入时会被放大。最后,通过调查为RedVox贡献的参与者,我们记录了收集人类参与者语音数据所面临的独特个人与隐私挑战,指出了自然语言语音安全研究中更广泛的社会技术挑战。
查看缓存全文
缓存时间: 2026/06/26 05:20
# 跨语言语音模型中的安全性与公平性差距 来源:https://arxiv.org/html/2606.26968 Beatrice Savoldi, Sara Papi11footnotemark:1, Wafa Aissa, Matteo Negri, Luisa Bentivogli Fondazione Bruno Kessler, Italy \{bsavoldi,spapi,waissa,negri,bentivo\}@fbk\.eu ###### 摘要 具备语音能力的模型正在跨语言的实际应用中日益普及。然而,它们在英语环境之外以及自然条件下的安全性和公平性仍未得到充分研究。我们调查了最前沿语音模型发布中的安全报告实践,发现仅有8%的模型记录了任何多语言分析。为弥补这一空白,我们引入了RedVox,一个基于真实声音构建的多语言音频和语音安全性与公平性基准,涵盖了五种语言(英语、法语、意大利语、西班牙语和德语)中的不安全和不公平刻板请求。对八个前沿模型的评估显示,即使在非对抗条件下,漏洞依然存在,在非英语语言中更加严重,并且当请求来自语音输入时会被放大。最后,通过调查为RedVox做出贡献的参与者,我们记录了收集人类参与者语音数据时所特有的个人和隐私挑战,指出了自然语音安全研究中更广泛的社会技术难题。警告:本文包含有害语言示例。 RedVox:![[未加标题的图片]](https://arxiv.org/html/2606.26968v1/x2.png) 跨语言语音模型中的安全性与公平性差距 Beatrice Savoldi††thanks:这些作者贡献相同。, Sara Papi11footnotemark:1, Wafa Aissa, Matteo Negri, Luisa BentivogliFondazione Bruno Kessler, Italy\{bsavoldi,spapi,waissa,negri,bentivo\}@fbk\.eu ## 1 引言 将语音集成到大语言模型(LLMs)中标志着人机交互的前沿进步。与传统的流水线架构不同,最近的语音能力模型通过原生处理输入音频来支持直接的口语交互(例如,Gaido et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib20); Nguyen et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib51); Qwen Team,2026 (https://arxiv.org/html/2606.26968#bib.bib57)),从而保留了重要的副语言特征,并提供了减少延迟和固有错误恢复能力等实际优势(Ji et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib30))。这些能力开启了新的可能性:降低文本界面的可访问性障碍(Wu et al.,2025b (https://arxiv.org/html/2606.26968#bib.bib80))(Zhou et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib94)),实现免提交互(Ludwig et al.,2023 (https://arxiv.org/html/2606.26968#bib.bib46); Jakob et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib29)),并在多语言规模上扩大语音对话的采用(Mu et al.,2026 (https://arxiv.org/html/2606.26968#bib.bib50))。然而,随着更广泛的部署,安全性和公平性的紧迫性也随之增加。已有的研究已经揭示了文本领域的刻板印象和偏见(Nozza et al.,2022 (https://arxiv.org/html/2606.26968#bib.bib52); Shrawgi et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib66); Mitchell et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib49))、模型毒性(Gehman et al.,2020 (https://arxiv.org/html/2606.26968#bib.bib22)),以及更广泛的价值对齐失败(Röttger et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib61); Bu et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib6))。对于语音,风险更为复杂。音频输入的丰富性引入了扩展的漏洞维度(Yang et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib85))。事实上,最近的研究表明,攻击者可以在多模态设置中更有效地绕过安全机制(Yang et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib86); Cheng et al.,2026 (https://arxiv.org/html/2606.26968#bib.bib11); Pan et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib53); Chen et al.,2026b (https://arxiv.org/html/2606.26968#bib.bib10)) 尽管对多模态漏洞的关注日益增加,但现有的语音安全性和公平性分析仍然绝大多数局限于英语中心和合成语音(Roh et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib59); Yang et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib86); Song et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib69); Li et al.,2026 (https://arxiv.org/html/2606.26968#bib.bib38); Yu et al.,2026 (https://arxiv.org/html/2606.26968#bib.bib89); Chen et al.,2026a (https://arxiv.org/html/2606.26968#bib.bib9))。合成语音降低了表征真实世界交互的自然条件,而仅限英语的评估在安全框架中留下了危险的盲点——引发了关于AI益处和风险在语言和社区间公平分配的基本问题(Bengio et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib4); Yong et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib88); Krasnodębska et al.,2026 (https://arxiv.org/html/2606.26968#bib.bib35)) 在这项工作中,我们解决了这些局限。(1)我们首先调查了现有语音模型发布中的安全性和公平性报告实践,发现只有8%报告了英语以外的评估。(2)然后,我们引入了RedVox,111数据在https://huggingface.co/datasets/FBK-MT/RedVox 经门控获取,详情见§伦理考量。代码可在Apache 2.0许可证下获取:https://github.com/hlt-mt/redvox。一个针对英语、法语、意大利语、西班牙语和德语的语音和音频基准。它是通过社区研究工作的数据收集构建的,据我们所知,是第一个基于自然声音覆盖多语言环境中不安全和不公平刻板请求的资源。(3)最后,虽然红队测试以及涉及人类参与者的辱骂内容处理在文本和图像领域已有研究(Vidgen et al.,2019 (https://arxiv.org/html/2606.26968#bib.bib75); Quaye et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib56); Zhang et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib90)),但语音模态在这方面仍未得到考察。通过对为RedVox做出贡献的参与者进行活动后问卷调查,我们揭示了其独特的挑战和影响。 ##### 发现。我们对语音模型的回顾表明,语音漏洞的文档记录稀疏且以英语为中心。通过在RedVox上评估八个最前沿的语音模型,我们表明即使在自然、非挑战性的条件下,安全性和公平性漏洞也是可检测的,并且在非英语语言中系统性恶化。此外,多模态输入——尤其是口语语音——成为一种超出纯文本所引发压力的刺激因素。然而,我们的问卷调查显示,录制内容引发了独特的个人和隐私担忧(例如,更高的责任感以及担心自己的声音被脱离语境地与有害内容关联)——指出了语音安全研究中更广泛的社会技术挑战,该领域尚未解决这些问题。 ## 2 关于报告语音漏洞 我们通过回顾现有的模型发布来调查语音领域安全性和公平性评估的现状。我们包含了所有具有指令跟随能力、能够支持开放式生成的语音模型——这是风险最严重且面向用户的设置,例如聊天助手。222我们排除任务特定模型,例如Whisper (Radford et al.,2023 (https://arxiv.org/html/2606.26968#bib.bib58))或Canary (Sekoyan et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib63))。我们的范围包括SpeechLLMs(将语音作为输入模态接受)(Tang et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib72))和OmniLLMs(能够在统一框架内处理任意模态组合——包括语音)(Jiang et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib31))。如果模型系列中存在多个版本,我们选择最新的版本。应用这些标准,我们识别出38个模型——其中4个是专有的(例如Gemini3)——并调查了它们的模型卡、技术报告和随附论文。遵循 Röttger 等人 (2025 (https://arxiv.org/html/2606.26968#bib.bib61)),我们采用广泛的安全概念,涵盖公平性、毒性和对抗鲁棒性。对于每个模型,我们注释了评估所用的语言和模态以及评估方法论。完整注释模型列表见表12 (https://arxiv.org/html/2606.26968#A5.T12)(附录A (https://arxiv.org/html/2606.26968#A1))。 参见标题 图1:提供安全文档的11个语音模型的安全评估实践。我们展示语言覆盖范围、评估方法论(自动 vs. 自动+手动)以及数据类型(公开 vs. 私有)。 参见标题 图2:RedVox框架。(顶部)基准属性以及关于参见标题 安全性和参见标题 公平性的两种请求类型。在请求类型 I(语音)中,有害内容被发声并伴有文本后续请求;在请求类型 II(音频)中,有害内容仅出现在文本中,并配有一个分散注意力的音频信号。(底部)评估流程,按递增严重程度评估模型响应。 ##### 模型回顾 我们的回顾揭示了语音模型安全报告中的空白。在检查的38个模型中,只有11个记录了安全评估。333另外三个模型涉及安全性,但没有说明评估所用的语言。如图1 (https://arxiv.org/html/2606.26968#S2.F1)所示,这11个报告的评估绝大多数是仅限英语的。例外情况包括SeaLLMs-Audio (Liu et al.,2025b (https://arxiv.org/html/2606.26968#bib.bib42))和双语(en/ko)的Raon Speech (KRAFTON,2026 (https://arxiv.org/html/2606.26968#bib.bib34))。此外,覆盖范围最广的是Phi-4-Multimodal (Abouelenin et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib1)),它在8种语言中进行了语音输入评估。然而,它依赖于未公开的数据。总体而言,语音模型的安全评估既稀疏又以英语为中心,几乎没有系统性的多语言评估证据——这些空白推动了我们这项研究以及RedVox的设计。 ## 3 RedVox数据集 我们引入RedVox,一个新颖的多模态和多语言基准,用于自动测试语音模型在两大类别中的漏洞:安全性(![[未加标题的图片]](https://arxiv.org/html/2606.26968v1/all-twemojis.pdf)),涵盖关于犯罪、危险或暴力行为的请求(Ghosh et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib23));以及公平性(![[未加标题的图片]](https://arxiv.org/html/2606.26968v1/all-twemojis.pdf)),涵盖关于社会和身份群体的刻板概括——这是一种更为微妙但后果严重的伤害,因为刻板印象助长偏见和歧视(Jackson,2020 (https://arxiv.org/html/2606.26968#bib.bib28)),并已被证明能塑造感知和行为(Wheeler and Petty,2001 (https://arxiv.org/html/2606.26968#bib.bib78); Block et al.,2022 (https://arxiv.org/html/2606.26968#bib.bib5))。444我们认识到这些是高级区分,可能难以精确界定(Röttger et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib61))。我们使用这两个总括术语来明确区分刻板内容——这通常不在安全政策和框架中体现。该资源涵盖五种语言(英语、意大利语、西班牙语、德语和法语)。它是作为一项语音社区研究工作创建的,参与者在其中以自然声音编写和录制有害请求,以评估现实世界的可用性和安全性,并反映更接近潜在用户交互的自然、非对抗条件。具体来说,RedVox支持两种互补的请求类型,可以跨多模态输入配置对模型鲁棒性进行受控分析(见图2 (https://arxiv.org/html/2606.26968#S2.F2))。在请求类型 I(语音)中,有害内容被发声并以语音输入形式传递;在请求类型 II(音频)中,音频仅携带分散注意力的非语音信号,将有害内容隔离到文本中。通过设计,这种对比探讨了传递格式如何跨模态塑造模型的行为和漏洞概况。我们在图2 (https://arxiv.org/html/2606.26968#S2.F2)中总结了RedVox框架,并在附录B (https://arxiv.org/html/2606.26968#A2)的表6 (https://arxiv.org/html/2606.26968#A2.T6)中提供了其条目的定性示例。 ### 3.1 设计与参与者 RedVox是作为一项社区研究工作创建的,涉及来自7个欧洲机构的52名研究者,其动机是缺乏用于测试语音漏洞的多语言数据。数据收集通过Hugging Face上的自定义网页界面进行。所有参与者均自愿参加,最终有18人参与英语,10人参与德语,9人参与意大利语,8人参与法语,8人参与西班牙语。555我们选择这些语言是基于参与者所说的语言。他们全都是de/it/fr/es的母语者。对于en,我们既包括母语者也包括熟练的非母语者。参与者细分见附录B (https://arxiv.org/html/2606.26968#A2)的表3 (https://arxiv.org/html/2606.26968#A2.T3)。参与者被分别告知参与该活动的法律依据以及结果数据的公开发布。数据发布的同意是独立获取的,允许参与者在不同意发布的情况下做出贡献。在这两种情况下,他们保留随时退出的权利。随后我们通过活动后问卷调查了他们的体验,这在第6节 (https://arxiv.org/html/2606.26968#S6)中讨论。关于设置、同意和所实施的福祉措施的完整详情在第§伦理考量中讨论。 ### 3.2 数据准备 我们并非从头构建该资源,而是将RedVox建立在已有的多语言文本基准之上。这种选择确保了基于先前研究的原理清晰、可重复的基础,并减少了参与者的创造性和认知负担。666在没有结构化输入的情况下从头引出多样化的请求是具有挑战性的(Weidinger et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib77))。因此,我们向参与者提供来自两个现有资源的预选实例,这些资源可免费获取,作为他们多模态适应的起点: ![[未加标题的图片]](https://arxiv.org/html/2606.26968v1/all-twemojis.pdf) SHADES (Mitchell et al.,2025 (https://arxiv.org/html/2606.26968#bib.bib49))是一个手动整理的、用于检查LLMs中刻板印象的数据集,涵盖16种语言和多个身份及社会类别(例如,性别、国籍、社会经济地位)。由于每个SHADES刻板印象都注释了其适用的文化和语言,我们提取了与我们的五种目标语言相关的所有条目,得到181个独特的、跨en/de/es/fr/it平行的刻板印象实例。 ![[未加标题的图片]](https://arxiv.org/html/2606.26968v1/all-twemojis.pdf) M-ALERT (Friedrich et al.,2024 (https://arxiv.org/html/2606.26968#bib.bib19))是一个大规模多语言安全基准。我们随机抽取了350个独特实例,均匀分布在其五个风险类别中:犯罪策划、毒品、性内容、自杀与自残、枪支与非法武器。相似文章
ChildVox:理解与表征儿童声音的语音、音频及大型音频语言模型基准
ChildVox 提出了一个全面的基准,用于分析儿童在不同发育阶段的声学交流,整合了来自17个以儿童为中心的音频和语音数据集的20多个子任务。
通过语义感知偏差估计衡量 Large Audio Language Models 中的公平性
本文介绍一种语义感知混合效应回归框架,用于衡量 Large Audio Language Models 中的公平性,通过控制语义变化和说话人身份,以获得更稳健和可解释的偏差估计。
你的多模态语音模型说我长了一张适合广播的脸
本文首次对多模态语音识别模型进行了偏见评估,发现在将人脸与音频配对时,跨性别和种族的准确率存在显著差异,这对AI系统的公平性具有重要意义。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
RedBench:大型语言模型综合红队测试通用数据集
RedBench 引入了一个通用数据集,聚合了 37 个基准数据集,包含 29,362 个样本,涵盖 22 个风险类别和 19 个领域,用于实现大型语言模型的标准化和综合红队测试评估。该工作解决了现有红队测试数据集中的不一致问题,并提供了基准、评估代码和开源资源,用于评估 LLM 对对抗提示的鲁棒性。