Aller au contenu principal
2025 conference-paper

Toward Visual Pronunciation Learning: A Speech-to-Articulatory Animation Pipeline Leveraging wav2vec 2.0 and rtMRI Landmarks

0Citations signalées, ce qui n’est pas une note de qualité
2Institutions déclarées
1Pays d’affiliation déclarés

Rattachement africain : jp. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Most computer-assisted pronunciation training (CAPT) systems for second language (L2) learners focus on detecting mispronunciation based on predefined phonemes and assigning pronunciation scores. However, these systems often lack visual feedback or detailed corrective guidance, limiting learners’ opportunities for significant improvement. This paper presents a key advance toward developing a CAPT system that offers detailed visual feedback on articulatory movements using real-time magnetic resonance imaging (rtMRI) articulatory landmarks. The limited availability of paired speech and articulatory landmark data, typically involving only a few speakers, poses a challenge for generalizing across diverse speech patterns. To address this, we propose leveraging pretrained wav2vec 2.0 embeddings, fine-tuned to generate articulatory contours mapped to xy coordinates based on rtMRI landmark data. As evaluated with the rtMRI USC-TIMIT dataset, our system effectively reconstructs visual articulatory movements from speech, marking a significant step toward enhanced visual pronunciation learning.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Toward Visual Pronunciation Learning: A Speech-to-Articulatory Animation Pipeline Leveraging wav2vec 2.0 and rtMRI Landmarks
Date Crossref
06/04/2025
Éditeur
IEEE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Les institutions déclarées

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Subtitles and Audiovisual MediaSpeech and dialogue systemsPhonetics and Phonology Research

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.