AraModernBERT: Transtokenized Initialization and Long-Context Encoder Modeling for Arabic
Rattachement africain : us, de, it, se, sy, Égypte. Niveau de preuve : code pays fourni par la source.
Le résumé fourni par la source
Encoder-only transformer models remain widely used for discriminative NLP tasks, yet recent architectural advances have largely focused on English.In this work, we present AraModernBERT, an adaptation of the Mod-ernBERT encoder architecture to Arabic, and study the impact of transtokenized embedding initialization and native long-context modeling up to 8,192 tokens.We show that transtokenization is essential for Arabic language modeling, yielding dramatic improvements in masked language modeling performance compared to non-transtokenized initialization.We further demonstrate that AraModernBERT supports stable and effective long-context modeling, achieving improved intrinsic language modeling performance at extended sequence lengths.Downstream evaluations on Arabic natural language understanding tasks, including inference, offensive language detection, question-question similarity, and named entity recognition, confirm strong transfer to discriminative and sequence labeling settings.Our results highlight practical considerations for adapting modern encoder architectures to Arabic and other languages written in Arabicderived scripts.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Le contrôle bibliographique ouvert
DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.
- Titre Crossref
- AraModernBERT: Transtokenized Initialization and Long-Context Encoder Modeling for Arabic
- Date Crossref
- 01/01/2026
- Éditeur
- Association for Computational Linguistics
- Type
- proceedings-article
Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.
Les institutions déclarées
Une affiliation ne permet pas de déduire la nationalité d’un auteur.