Aller au contenu principal
2025 conference-paper

Leveraging Language Information for Target Language Extraction

0Citations signalées, ce qui n’est pas une note de qualité
2Institutions déclarées
2Pays d’affiliation déclarés

Rattachement africain : sg, cn. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Target Language Extraction aims to extract speech in a specific language from a mixture waveform that contains multiple speakers speaking different languages. The human auditory system is adept at performing this task with the knowledge of the particular language. However, the performance of the conventional extraction systems is limited by the lack of this prior knowledge. Speech pre-trained models, which capture rich linguistic and phonetic representations from large-scale in-the-wild corpora, can provide this missing language knowledge to these systems. In this work, we propose a novel end-to-end framework to leverage language knowledge from speech pre-trained models. This knowledge is used to guide the extraction model to better capture the target language characteristics, thereby improving extraction quality. To demonstrate the effectiveness of our proposed approach, we construct the first publicly available multilingual dataset for Target Language Extraction. Experimental results show that our method achieves improvements of$\mathbf{1. 2 2} \mathbf{d B}$and$\mathbf{1. 1 2}$dB in SI-SNR for English and German extraction, respectively, from mixtures containing both languages.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Leveraging Language Information for Target Language Extraction
Date Crossref
22/10/2025
Éditeur
IEEE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • National University of Singapore pays non établi dans la notice
    Université ou école supérieure
  • Chinese University of Hong Kong pays non établi dans la notice
    Université ou école supérieure
  • School of Artificial Intelligence pays non établi dans la notice
    Université ou école supérieure

National University of Singapore, Chinese University of Hong Kong et School of Artificial Intelligence.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Speech Recognition and SynthesisSpeech and Audio ProcessingVoice and Speech Disorders

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.