Aller au contenu principal
2026 conference-paper

DTA-PDVC: Dynamic Temporal Anchor Boxes for Parallel Dense Video Captioning

0Citations signalées, ce qui n’est pas une note de qualité
1Institutions déclarées
1Pays d’affiliation déclarés

Rattachement africain : cn. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Dense video captioning aims to localize events within a video and generate corresponding captions. The event proposals of single-stage methods are responsible for event localization and captioning simultaneously, which leads to suboptimal semantic representation of proposals and prolongs the training process. In this paper, we introduce the concept of Dynamic Temporal Anchor Box and Scale-Modulated Attention to explicitly inject positional information into event proposals, enabling the model to better localize events of varying sizes within the video and accelerating model convergence. Concurrently, we design a bidirectional spatiotemporal encoder based on Mamba to better model the contextual information of the video while boosting the model efficiency. Extensive experiments on the ActivityNet Captions and YouCook2 datasets show that our model can generate high-quality captions, achieving state-of-the-art results among visual-only models and rivaling some methods trained with additional data. The code is available at https://github.com/JohnnyHaytham/DTA-PDVC.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
DTA-PDVC: Dynamic Temporal Anchor Boxes for Parallel Dense Video Captioning
Date Crossref
03/05/2026
Éditeur
IEEE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • Beijing University of Technology pays non établi dans la notice
    Université ou école supérieure

Beijing University of Technology.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Multimodal Machine Learning ApplicationsVideo Analysis and SummarizationHuman Pose and Action Recognition

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.