Aller au contenu principal
Accès ouvert déclaré 2026 preprint

A generative model for dimensionality reduction with millions of features and few samples

0Citations signalées, ce qui n’est pas une note de qualité
4Institutions déclarées
3Pays d’affiliation déclarés

Rattachement africain : de, it, dk. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Abstract Motivation In this paper, we demonstrate that it is feasible to train a deep generative model for dimensionality reduction with millions of features using few samples, which makes this type of generative model a more versatile alternative to standard methods for dimensionality reduction. Specifically, we hypothesize that for a decoder-only model, the number of training samples required is almost independent of the feature dimensionality in most network architectures. Results Through an extensive set of experiments on synthetic non-linear data, we validate this hypothesis. We also train the model on a downsampled version of the 1000 Genomes Project (1KGP) dataset to further assess its behavior under controlled reductions in sample size. Furthermore, we train a deep generative decoder (DGD) on a curated dataset from the International Cancer Genome Consortium (ICGC), which contains 4.4 million features. It is trained on approximately 4,000 samples and tested on 1,000 samples. The resulting latent representation exhibits clear clustering, and when methods are reduced to the same number of dimensions, it outperforms PCA and VAE for tumor type classification. Additionally, the DGD is computationally efficient and can be trained on a 16GB GPU. Availability and implementation Code is available at https://github.com/cpancott/ReceptiveDGD . Contact corrado.pancotti@helmholtz-munich.de ; akrogh@di.ku.dk Supplementary information Supplementary data are available with this preprint.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
A generative model for dimensionality reduction with millions of features and few samples
Date Crossref
09/08/2026
Éditeur
openRxiv
Type
posted-content

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • Helmholtz Munich pays non établi dans la notice
    Structure de recherche
  • University of Turin pays non établi dans la notice
    Université ou école supérieure
  • University of Copenhagen Novo Nordisk Foundation Center for Basic Metabolic Research pays non établi dans la notice
    Université ou école supérieure
  • Novo Nordisk Foundation pays non établi dans la notice
    Structure de recherche
  • Ingolstadter Landstraße 1 Helmholtz AI pays non établi dans la notice
    Organisation à but non lucratif
  • University of Torino Department of Medical Sciences pays non établi dans la notice
    Université ou école supérieure

Helmholtz Munich, University of Turin et Novo Nordisk Foundation Center for Basic Metabolic Research — University of Copenhagen, avec 3 autres affiliations.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Generative Adversarial Networks and Image SynthesisAI in cancer detectionGene expression and cancer classification

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.