Tag
The paper proposes a multimodal solution for audio sentiment polarity classification that integrates audio and multilingual text transcripts via cross-modal transformers, and uses knowledge distillation to enhance an audio-only model without computational overhead during inference.