Audio-Based Emotion Analysis Using Deep Learning Techniques
Résumé fourni par la source
This paper uses audio parameters such as MFCCs, zero-crossing rate, chroma features, RMS values, and Mel spectrograms to provide a novel approach to machine learning for speech emotion recognition. Heterogeneous audio recordings from datasets RAVDESS, CREMA-D, TESS, and SAVEE are used for the experiment. Data augmentation of the dataset was done by performing pitch modification, stretching, shifting, and addition of noise in order to improve model robustness. CNN, being competitive with regard to emotion categorization and sequential data analysis, is being explored for possible application to sentiment analysis, mental health monitoring, or even human-computer interaction; the work, thus, makes it possible for advancing a scalable, intuitive, yet accurate system in speech emotion recognition.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Contrôle bibliographique ouvert
DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.
- Titre Crossref
- Audio-Based Emotion Analysis Using Deep Learning Techniques
- Date Crossref
- 03/04/2025
- Éditeur
- IEEE
- Type
- proceedings-article
Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude et ne compte pas comme une seconde source scientifique indépendante.