large-audio-language-models

Tag

Cards List
#large-audio-language-models

Continuous Audio Thinking for Large Audio Language Models

arXiv cs.AI · 2026-06-18 Cached

The paper introduces Continuous Audio Thinking (CoAT), a framework that equips large audio language models with a continuous latent workspace to organize acoustic information before generating textual responses, improving performance on audio reasoning, understanding, and transcription tasks without additional decoding cost.

0 favorites 0 likes
#large-audio-language-models

MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs

arXiv cs.CL · 2026-05-29 Cached

MusTBench is a benchmark for evaluating temporal grounding in Large Audio-Language Models (LALMs) for music understanding. The authors propose MusT, a four-stage training recipe that significantly improves temporal grounding performance over existing models.

0 favorites 0 likes
#large-audio-language-models

Voice AI Systems Are Vulnerable to Hidden Audio Attacks

Hacker News Top · 2026-05-18 Cached

New research shows that imperceptible audio signals can hijack large audio-language models (LALMs) with 79-96% success, forcing them to execute unauthorized commands like web searches or sending emails. The technique, dubbed AudioHijack, targets generative models and works regardless of user input, posing a serious security risk to voice AI systems.

0 favorites 0 likes
#large-audio-language-models

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

Hugging Face Daily Papers · 2026-05-18 Cached

A comprehensive survey reviewing the trustworthiness challenges of Large Audio Language Models (LALMs), including vulnerabilities like cross-modal jailbreaking and acoustic backdoors, and proposing a defense-in-depth roadmap.

0 favorites 0 likes
← Back to home

Submit Feedback