audio-language-models

Tag

Cards List
#audio-language-models

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

arXiv cs.CL · 2d ago Cached

This paper introduces an instruction-free alignment-only method for building large audio-language models by freezing the LLM and audio encoder, training only a lightweight projector on self-generated data, achieving competitive performance with less data than traditional multi-stage pipelines.

0 favorites 0 likes
#audio-language-models

Multilingual Emotion Neurons in Large Audio-Language Models

arXiv cs.CL · 2026-08-11 Cached

A first neuron-level interpretability study of how large audio-language models encode multilingual emotion, introducing Consistency-Regularized Fusion to identify Multilingual Emotion Neurons across 12 languages and showing cross-lingual transfer benefits.

0 favorites 0 likes
#audio-language-models

Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation

arXiv cs.CL · 2026-08-10 Cached

Introduces counterfactual audits to test whether audio language model judges actually use paralinguistic evidence when evaluating speech-to-speech responses, finding that contrastive success often overstates native reliability and similar accuracies can hide different failure modes across Gemini, GPT, and open models.

0 favorites 0 likes
#audio-language-models

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

Hugging Face Daily Papers · 2026-08-10 Cached

A paper introducing ILL, an inaudible low-frequency red-teaming method to expose safety vulnerabilities in audio-language models, and DRG, a defense that detects distribution shifts and requests a second recording to recover accuracy.

0 favorites 0 likes
#audio-language-models

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

arXiv cs.CL · 2026-07-21 Cached

Introduces ESCUCHA, the first Spanish speech understanding benchmark for evaluating large audio language models across heterogeneous acoustic conditions and reasoning abilities, comprising 1,000 curated questions from diverse real-world sources.

0 favorites 0 likes
#audio-language-models

Reinforcement Learning for Data-Efficient Code-Switched ASR

arXiv cs.CL · 2026-07-07 Cached

Introduces a reinforcement learning with verifiable rewards recipe for data-efficient adaptation of audio-language models to code-switched ASR, achieving significant gains across 10 language pairs with minimal data.

0 favorites 0 likes
#audio-language-models

VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

Hugging Face Daily Papers · 2026-07-03 Cached

VIBE is a framework that evaluates generative bias in Large Audio-Language Models using open-ended tasks with human-recorded speech, revealing systematic biases triggered by gender and accent cues.

0 favorites 0 likes
#audio-language-models

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents

arXiv cs.CL · 2026-06-11 Cached

This paper introduces Afrispeech Semantics, a benchmark for evaluating audio language models on semantic reasoning tasks including entailment, consistency, plausibility, accent drift, and accent restraint across diverse domains and accents.

0 favorites 0 likes
#audio-language-models

KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness

arXiv cs.CL · 2026-04-23 Cached

KoALa-Bench introduces a Korean-focused benchmark suite for evaluating large audio language models on six tasks, including novel measures of speech faithfulness and Korea-specific cultural content.

0 favorites 0 likes
← Back to home

Submit Feedback