VIBE:通过真实世界语音对大型音频语言模型的语音诱导开放式偏见评估

Hugging Face Daily Papers 论文

摘要

VIBE是一个框架,通过使用人类录制的语音进行开放式任务来评估大型音频语言模型中的生成偏差,揭示了由性别和口音线索触发的系统性偏差。

大型音频语言模型(LALMs)正日益融入日常应用,但其生成偏差仍鲜有探索。现有的语音公平性基准依赖于合成语音和多项选择题(MCQs),两者都只提供了公平性的碎片化视图。我们提出了VIBE,一个通过开放式任务(如个性化推荐)使用人类录制的语音来评估生成偏差的框架。与MCQs不同,我们的方法允许刻板关联在没有预设选项的情况下自然显现,使其易于扩展到新任务。对12个最先进的LALMs进行评估,揭示了现实场景中的系统性偏差。性别和口音线索都会引发统计显著的分布偏移,且偏差幅度强烈依赖于具体任务。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:52

论文页面 - VIBE: 通过真实世界语音对大型音频语言模型进行语音驱动的开放式偏见评估

来源: https://huggingface.co/papers/2604.17248

摘要

大型音频语言模型在真实场景中通过使用人类录制的语音进行开放式任务评估时,会展现出系统性的生成偏差,且偏差程度因任务而异,并受性别和口音线索触发。

大型音频语言模型 (https://huggingface.co/papers?q=Large%20Audio-Language%20Models) (LALMs) 正日益融入日常应用,但其生成偏差 (https://huggingface.co/papers?q=generative%20bias) 仍未被充分探索。现有的语音公平性基准依赖合成语音和多项选择题 (MCQs),两者都只提供了公平性的碎片化视角。我们提出 VIBE,一个通过开放式任务(如个性化推荐)评估生成偏差的框架,该框架使用人类录制的语音 (https://huggingface.co/papers?q=human-recorded%20speech)。与 MCQs 不同,我们的方法允许刻板关联 (https://huggingface.co/papers?q=stereotypical%20associations) 在没有预定义选项的情况下自然展现,从而易于扩展到新任务。对 12 个最先进的 LALMs 进行评估,揭示了真实场景中的系统性偏差。性别和口音线索都会触发统计上显著的分布偏移 (https://huggingface.co/papers?q=distributional%20shifts),并且偏差程度强烈依赖于具体任务。

查看 arXiv 页面 (https://arxiv.org/abs/2604.17248)查看 PDF (https://arxiv.org/pdf/2604.17248)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.17248)

在你的智能体中获取这篇论文:

hf papers read 2604.17248

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2604.17248 即可链接到此页面。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2604.17248 即可链接到此页面。

引用此论文的 Spaces0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2604.17248 即可链接到此页面。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可链接到此页面。

相似文章

VibeVoice 技术报告

Papers with Code Trending

VibeVoice 是微软推出的一款新模型,它利用 Next-Token Diffusion(下一令牌扩散)和一种高度高效的连续语音分词器,生成长形式多说话人语音。该模型实现了卓越的保真度和压缩率,支持长达 90 分钟的多说话人音频生成。