Aller au contenu principal
2025 article

Enhanced RSVQA Insight Through Synergistic Visual-Linguistic Attention Models

2Citations signalées, ce qui n’est pas une note de qualité
1Institutions déclarées
1Pays d’affiliation déclarés

Rattachement africain : in. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

The interpretation of remote sensing images remains a significant challenge due to their complex, information-rich nature. Current Remote Sensing Visual Question Answering (RSVQA) techniques have been a step forward towards building intelligent analysis systems for remote sensing images. However most existing RSVQA models rely on already existing deep learning models for their representation (visual and language feature extraction) and fusion (combining the extracted features) modules, which poses a limitation to their performance. To address these limitations, this paper introduces a novel Remote Sensing Visual Question Answering (RSVQA) approach that leverages state-of-the-art components with an innovative architecture to advance interactive remote sensing analysis. The proposed model features a novel dual-layer visual attention mechanism in the Representation module to process intricate features and capture regional relationships alongside processing the overall features. The Fusion module employs a unique attention-based design, combining both self-attention and mutual attention, to integrate these features into a unified vector representation. Finally, the Answering module utilizes a refined Multi-Layer Perceptron classifier for precise response generation. Evaluations on RSVQA benchmarks demonstrate the system’s superiority over existing methods, marking a significant step forward in remote sensing analytics.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Enhanced RSVQA Insight Through Synergistic Visual-Linguistic Attention Models
Date Crossref
01/01/2025
Éditeur
Institute of Electrical and Electronics Engineers (IEEE)
Type
journal-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Les institutions déclarées

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Risk and Safety AnalysisFault Detection and Control SystemsOccupational Health and Safety Research

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.