spoken-conversational-systems

Tag

Cards List
#spoken-conversational-systems

VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models

Hugging Face Daily Papers ↗ · 5d ago Cached

VoxMem is a benchmark for evaluating multimodal memory in Large Audio Language Models, focusing on acoustic evidence types and multi-session memory operations. It reveals significant gaps in current models, such as poor retention of speaker identity and paralinguistic cues compared to semantic content.

0 favorites 0 likes
← Back to home

Submit Feedback