Aller au contenu principal
2025 conference-paper

BanglaDocAtlas: A Multi-Class Annotated Dataset for Complex Bangla Document Layout Analysis

0Citations signalées, ce qui n’est pas une note de qualité
4Institutions déclarées
2Pays d’affiliation déclarés

Rattachement africain : bd, us. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Optical Character Recognition (OCR) technology is a vital tool for digitizing printed content, enabling efficient data extraction and enhancing document accessibility. Traditional OCR techniques rely on pre-stored templates for fonts or structured documents. Recent advancements in Machine Learning (ML), particularly Convolutional Neural Network (CNN) and transformer-based architectures, have enhanced OCR technologies with human-like intelligence. However, these models often fall short due to limitations in the diversity of document types, layouts, and content in the training datasets, particularly for complex Bangla documents. In this paper, we address the challenge of a limited, diverse dataset by introducing BanglaDocAtlas, a versatile and multi-class annotated dataset specifically designed to advance Bangla document layout analysis. The dataset includes eight distinct classes: paragraph, text, image, title, caption, table, advertisement, and page number, enabling comprehensive OCR applications. State-of-the-art segmentation models, i.e., You Only Look Once (YOLO), and a detection model, e.g., Real-Time DEtection TRansformer (RT-DETR), are trained and evaluated on the BanglaDocAtlas dataset. The results demonstrate that YOLOv9 achieves the highest precision, with values of 0.87 for bounding boxes and 0.79 for masks, while RT-DETR outperforms in recall, with a value of 0.86 for bounding boxes.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
BanglaDocAtlas: A Multi-Class Annotated Dataset for Complex Bangla Document Layout Analysis
Date Crossref
15/09/2025
Éditeur
IEEE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • Dhaka International University pays non établi dans la notice
    Université ou école supérieure
  • United International University pays non établi dans la notice
    Université ou école supérieure
  • Wichita State University pays non établi dans la notice
    Université ou école supérieure
  • BRAC University pays non établi dans la notice
    Université ou école supérieure
  • Bengali.AI pays non établi dans la notice
    Institution

Dhaka International University, United International University et Wichita State University, avec 2 autres affiliations.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Handwritten Text Recognition TechniquesNatural Language Processing TechniquesImage Processing and 3D Reconstruction

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.