large-audio-language-models

Tag

Cards List
#large-audio-language-models

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

arXiv cs.CL · 5d ago Cached

This paper introduces Hybrid Search, a method to enhance automatic speech recognition in large audio language models by leveraging hidden-state interactions between the ASR-LLM and base LLM for targeted token correction, improving performance beyond global LLM-correction strategies.

0 favorites 0 likes
#large-audio-language-models

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

arXiv cs.CL · 2026-08-17 Cached

This paper introduces a semantic-aware mixed-effects regression framework for measuring fairness in Large Audio Language Models by controlling for semantic variation and speaker identity to yield more robust and interpretable bias estimates.

0 favorites 0 likes
#large-audio-language-models

Continuous Audio Thinking for Large Audio Language Models

arXiv cs.AI · 2026-06-18 Cached

The paper introduces Continuous Audio Thinking (CoAT), a framework that equips large audio language models with a continuous latent workspace to organize acoustic information before generating textual responses, improving performance on audio reasoning, understanding, and transcription tasks without additional decoding cost.

0 favorites 0 likes
#large-audio-language-models

MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs

arXiv cs.CL · 2026-05-29 Cached

MusTBench is a benchmark for evaluating temporal grounding in Large Audio-Language Models (LALMs) for music understanding. The authors propose MusT, a four-stage training recipe that significantly improves temporal grounding performance over existing models.

0 favorites 0 likes
#large-audio-language-models

Voice AI Systems Are Vulnerable to Hidden Audio Attacks

Hacker News Top · 2026-05-18 Cached

New research shows that imperceptible audio signals can hijack large audio-language models (LALMs) with 79-96% success, forcing them to execute unauthorized commands like web searches or sending emails. The technique, dubbed AudioHijack, targets generative models and works regardless of user input, posing a serious security risk to voice AI systems.

0 favorites 0 likes
#large-audio-language-models

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

Hugging Face Daily Papers · 2026-05-18 Cached

A comprehensive survey reviewing the trustworthiness challenges of Large Audio Language Models (LALMs), including vulnerabilities like cross-modal jailbreaking and acoustic backdoors, and proposing a defense-in-depth roadmap.

0 favorites 0 likes
← Back to home

Submit Feedback