Domain Multimodal Learning, Emotion Recognition, Passage Retrieval
Task Enhance robustness of audio-visual emotion recognition under noisy and uncontrolled environments
Work Proposes a fusion framework with convolutional and transformer encoders, combining feature and decision level integration with cross-modal attention for noise suppression, validated on the in-the-wild AFEW dataset
Reference Robust Audio-Visual Fusion for Emotion Recognition based on Cross-Modal Learning under Noisy Conditions, CMC-Computers, Materials & Continua, 2025