VIBE:通过真实世界语音对大型音频语言模型的语音诱导开放式偏见评估
摘要
VIBE是一个框架,通过使用人类录制的语音进行开放式任务来评估大型音频语言模型中的生成偏差,揭示了由性别和口音线索触发的系统性偏差。
查看缓存全文
缓存时间: 2026/07/09 07:52
论文页面 - VIBE: 通过真实世界语音对大型音频语言模型进行语音驱动的开放式偏见评估
来源: https://huggingface.co/papers/2604.17248
摘要
大型音频语言模型在真实场景中通过使用人类录制的语音进行开放式任务评估时,会展现出系统性的生成偏差,且偏差程度因任务而异,并受性别和口音线索触发。
大型音频语言模型 (https://huggingface.co/papers?q=Large%20Audio-Language%20Models) (LALMs) 正日益融入日常应用,但其生成偏差 (https://huggingface.co/papers?q=generative%20bias) 仍未被充分探索。现有的语音公平性基准依赖合成语音和多项选择题 (MCQs),两者都只提供了公平性的碎片化视角。我们提出 VIBE,一个通过开放式任务(如个性化推荐)评估生成偏差的框架,该框架使用人类录制的语音 (https://huggingface.co/papers?q=human-recorded%20speech)。与 MCQs 不同,我们的方法允许刻板关联 (https://huggingface.co/papers?q=stereotypical%20associations) 在没有预定义选项的情况下自然展现,从而易于扩展到新任务。对 12 个最先进的 LALMs 进行评估,揭示了真实场景中的系统性偏差。性别和口音线索都会触发统计上显著的分布偏移 (https://huggingface.co/papers?q=distributional%20shifts),并且偏差程度强烈依赖于具体任务。
查看 arXiv 页面 (https://arxiv.org/abs/2604.17248)查看 PDF (https://arxiv.org/pdf/2604.17248)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.17248)
在你的智能体中获取这篇论文:
hf papers read 2604.17248
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2604.17248 即可链接到此页面。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2604.17248 即可链接到此页面。
引用此论文的 Spaces0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2604.17248 即可链接到此页面。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可链接到此页面。
相似文章
VibeVoice 技术报告
VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。
ChildVox:理解与表征儿童声音的语音、音频及大型音频语言模型基准
ChildVox 提出了一个全面的基准,用于分析儿童在不同发育阶段的声学交流,整合了来自17个以儿童为中心的音频和语音数据集的20多个子任务。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
Voice of India:面向印度真实场景的大规模语音识别基准
研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。
推出 Real World VoiceEQ:衡量语音AI的拟人化质量
Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。