Aller au contenu principal
2025 conference-paper

TavNet-An Audiovisual Speech Separation Model Based on Dual-Path Recurrent Neural Networks

0Citations signalées, ce qui n’est pas une note de qualité
1Institutions déclarées
1Pays d’affiliation déclarés

Rattachement africain : cn. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Tracking a particular sound object in a mixed sound scene is a common skill for humans but remains challenging for machines. Traditional audiovisual speech separation models, such as frequency-domain methods and time-domain approaches, have demonstrated effectiveness but face limitations. Frequency-domain methods struggle with phase information modeling, while time-domain methods often encounter issues with long-sequence processing and parallelism. Moreover, prior models generally fail to fully exploit the complementary advantages of multimodal features, leading to suboptimal performance in complex acoustic environments. To address these challenges, this paper proposes TavNet, a novel time-domain audiovisual speech separation model that integrates visual features and dual-path recurrent neural networks (DPRNN). By incorporating lip motion features as robust visual inputs and utilizing the DPRNN architecture for efficient long-sequence modeling, the proposed model achieves significant improvements over audio-only and other time-frequency domain audiovisual methods. Experimental results on the LRS-2Mix dataset demonstrate that our model achieves an improvement of over 1dB and 3dB in SiSNR evaluation metrics for two-and three-speaker separation tasks, respectively, thereby establishing its superiority in real-world speech separation scenarios.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
TavNet-An Audiovisual Speech Separation Model Based on Dual-Path Recurrent Neural Networks
Date Crossref
10/01/2025
Éditeur
IEEE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Les institutions déclarées

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Speech and Audio ProcessingMusic and Audio ProcessingHearing Loss and Rehabilitation

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.