Aller au contenu principal
2024 conference-paper

Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives

105Citations signalées, ce qui n’est pas une note de qualité
18Institutions déclarées
9Pays d’affiliation déclarés

Rattachement africain : gb, us, sg, in, bo, ca, it, jp, sa. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

We present Ego-Exo4D, a diverse, large-scale multi-modal multiview video dataset and benchmark challenge. Ego-Exo4D centers around simultaneously-captured ego-centric and exocentric video of skilled human activities (e.g., sports, music, dance, bike repair). 740 participants from 13 cities worldwide performed these activities in 123 different natural scene contexts, yielding long-form captures from 1 to 42 minutes each and 1,286 hours of video combined. The multimodal nature of the dataset is un-precedented: the video is accompanied by multichannel audio, eye gaze, 3D point clouds, camera poses, IMU, and multiple paired language descriptions-including a novel “expert commentary” done by coaches and teachers and tailored to the skilled-activity domain. To push the frontier of first-person video understanding of skilled human activity, we also present a suite of benchmark tasks and their annotations, including fine-grained activity understanding, proficiency estimation, cross-view translation, and 3D hand/body pose. All resources are open sourced to fuel new research in the community.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives
Date Crossref
16/06/2024
Éditeur
IEEE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • University of Bristol pays non établi dans la notice
    Université ou école supérieure
  • University of Illinois Urbana-Champaign pays non établi dans la notice
    Université ou école supérieure
  • University of Minnesota pays non établi dans la notice
    Université ou école supérieure
  • University of Minnesota System pays non établi dans la notice
    Université ou école supérieure
  • National University of Singapore pays non établi dans la notice
    Université ou école supérieure
  • Carnegie Mellon University pays non établi dans la notice
    Université ou école supérieure
  • International Institute of Information Technology pays non établi dans la notice
    Université ou école supérieure
  • Universidad de Los Andes pays non établi dans la notice
    Université ou école supérieure
  • Simon Fraser University pays non établi dans la notice
    Université ou école supérieure
  • University of North Carolina at Chapel Hill pays non établi dans la notice
    Université ou école supérieure
  • University of Catania pays non établi dans la notice
    Université ou école supérieure
  • The University of Texas at Austin pays non établi dans la notice
    Université ou école supérieure

University of Bristol, University of Illinois Urbana-Champaign et University of Minnesota, avec 9 autres affiliations.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Human Pose and Action RecognitionHuman-Automation Interaction and SafetyVirtual Reality Applications and Impacts

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.