audio-language-models

标签

Cards List
#audio-language-models

对齐就是一切:面向通用音频-语言模型的无指令训练

arXiv cs.CL · 2天前 缓存

本文介绍了一种无指令的纯对齐方法,用于构建大型音频-语言模型,该方法通过冻结LLM和音频编码器,仅在自生成数据上训练一个轻量级投影器,实现了与传统多阶段流程相比更少数据下的竞争性性能。

0 人收藏 0 人点赞
#audio-language-models

大型音频语言模型中的多语言情感神经元

arXiv cs.CL · 2026-08-11 缓存

首次从神经元层面解释大型音频语言模型如何编码多语言情感,引入一致性正则化融合(Consistency-Regularized Fusion)以识别跨12种语言的多语言情感神经元,并展示了跨语言迁移的益处。

0 人收藏 0 人点赞
#audio-language-models

音频语言模型是否使用副语言证据?用于响应评估的反事实审计

arXiv cs.CL · 2026-08-10 缓存

引入了反事实审计,以测试音频语言模型评委在评估语音到语音响应时是否真正使用副语言证据,结果发现对比性成功往往高估了原生可靠性,而相似的准确率可能掩盖Gemini、GPT和开放模型之间不同的失败模式。

0 人收藏 0 人点赞
#audio-language-models

从不可听输入到模型失效:LALMs中的低频安全风险

Hugging Face Daily Papers · 2026-08-10 缓存

一篇论文,介绍了ILL(一种不可听的低频红队测试方法,用于暴露音频语言模型的安全漏洞)和DRG(一种防御方法,可检测分布偏移并请求第二次录音以恢复准确性)。

0 人收藏 0 人点赞
#audio-language-models

ESCUCHA:面向异质声学条件的西班牙语语音基准

arXiv cs.CL · 2026-07-21 缓存

介绍了ESCUCHA,这是首个用于评估大型音频语言模型在异质声学条件和推理能力方面的西班牙语语音理解基准,包含来自多种真实世界来源的1000个精选问题。

0 人收藏 0 人点赞
#audio-language-models

面向数据高效的代码切换ASR的强化学习

arXiv cs.CL · 2026-07-07 缓存

介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。

0 人收藏 0 人点赞
#audio-language-models

VIBE:通过真实世界语音对大型音频语言模型的语音诱导开放式偏见评估

Hugging Face Daily Papers · 2026-07-03 缓存

VIBE是一个框架,通过使用人类录制的语音进行开放式任务来评估大型音频语言模型中的生成偏差,揭示了由性别和口音线索触发的系统性偏差。

0 人收藏 0 人点赞
#audio-language-models

Afrispeech Semantics:评估跨领域和口音的语音语言模型中的音频语义推理

arXiv cs.CL · 2026-06-11 缓存

本文介绍了Afrispeech Semantics,这是一个用于评估音频语言模型在语义推理任务上的基准测试,包括跨多种领域和口音的蕴含、一致性、合理性、口音漂移和口音抑制。

0 人收藏 0 人点赞
#audio-language-models

KoALa-Bench:评估大型音频语言模型在韩语语音理解与忠实度上的表现

arXiv cs.CL · 2026-04-23 缓存

KoALa-Bench 推出了一套聚焦韩语的基准测试,从六个维度评估大型音频语言模型,包括全新的语音忠实度指标与韩国本土文化内容。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈