Aller au contenu principal
Accès ouvert déclaré 2026 conference-paper

Egocentric Action Recognition with Retrieval-Augmented Learning

0Citations signalées, ce qui n’est pas une note de qualité
3Institutions déclarées
2Pays d’affiliation déclarés

Rattachement africain : gb, cn. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Egocentric Action Recognition (EAR) aims to identify fine-grained actions and interacted objects from first-person videos, forming a core task in egocentric video understanding. Despite recent progress, EAR remains challenged by limited data scale, annotation quality, and long-tailed class distributions. To address these issues, we propose REAR, a Retrieval-augmented framework for EAR that leverages external third-person (exocentric) videos as auxiliary knowledge—without requiring synchronized ego-exo pairs. REAR adopts a dual-branch architecture: one branch extracts egocentric representations, while the other retrieves semantically relevant exocentric features. These are fused via a cross-view integration module that performs staged refinement and attention-based alignment. To mitigate class imbalance, a class-adaptive selector dynamically adjusts retrieval depth based on class frequency, and independent classifiers are trained with logit-adjusted cross-entropy. Extensive experiments across three benchmarks demonstrate that REAR achieves state-of-the-art performance, with significant gains in object recognition and tail-class accuracy. The source code is publicly available at https://github.com/zou-y23/REAR.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Egocentric Action Recognition with Retrieval-Augmented Learning
Date Crossref
15/06/2026
Éditeur
ACM
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • University of Ulster pays non établi dans la notice
    Université ou école supérieure
  • Shandong University pays non établi dans la notice
    Université ou école supérieure
  • Shandong Jianzhu University pays non établi dans la notice
    Université ou école supérieure
  • Ulster University pays non établi dans la notice
    Université ou école supérieure
  • Shandong Jianzhu Universiry pays non établi dans la notice
    Organisation à but non lucratif

University of Ulster, Shandong University et Shandong Jianzhu University, avec 2 autres affiliations.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Human Pose and Action RecognitionAction Observation and SynchronizationMultimodal Machine Learning Applications

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.