Aller au contenu principal
2026 conference-paper

Contextual information-based amalgamated CNN-Transformer network for self-supervised monocular depth estimation

0Citations signalées, ce qui n’est pas une note de qualité
3Institutions déclarées
2Pays d’affiliation déclarés

Rattachement africain : cn, us. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Estimating depth from images is a crucial computer vision task with wide-ranging applications in fields such as autonomous driving, drones, and virtual reality. Self-supervised monocular depth estimation utilizes image sequences to achieve semi-supervised learning and has shown promising application prospects. However, current self-supervised methods still suffer from deficiencies in enhancing feature dependencies and properly handling local information, resulting in limited performance and low prediction accuracy. In this work, we propose a novel network architecture, ACTADepth, based on the U-Net framework, aimed at further improving prediction accuracy. The network utilizes anamalgamated CNN-Transformer as the depth encoder to capture and convey contextual information. Meanwhile, an efficient decoder is designed to effectively exploit both global and local cues in images. In the proposed channel attention module, dependencies between any two channel mappings are captured to enhance feature representation. By establishing connected paths between multi-scale local features and the global decoding stream via the feature fusion module, the network can integrate both representations and recover depth details effectively. The proposed network demonstrates competitive results on the KITTI dataset.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Contextual information-based amalgamated CNN-Transformer network for self-supervised monocular depth estimation
Date Crossref
04/02/2026
Éditeur
SPIE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • Nanyang Institute of Technology pays non établi dans la notice
    Université ou école supérieure
  • Zhengzhou University pays non établi dans la notice
    Université ou école supérieure
  • Film Independent pays non établi dans la notice
    Organisation à but non lucratif
  • Independent Scholar (United States) pays non établi dans la notice
    Institution

Nanyang Institute of Technology, Zhengzhou University et Film Independent, avec 1 autre affiliation.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Advanced Vision and ImagingImage Processing Techniques and ApplicationsHuman Pose and Action Recognition

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.