Aller au contenu principal
Accès ouvert déclaré 2026 article

Scalable molecular representations enabled by multimodal fusion and sequence distillation

0Citations signalées, ce qui n’est pas une note de qualité
2Institutions déclarées
1Pays d’affiliation déclarés

Rattachement africain : in. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Molecular prediction depends on how chemical structures are represented, yet descriptors capture only partial aspects of chemical information. Here, we show that the Chemical Dice Integrator combines six complementary molecular views spanning physicochemical properties, molecular topology, two-dimensional structural images, bioactivity profiles, quantum properties, and molecular language into a unified latent space. This multimodal representation is distilled into a sequence-based model that generates the embedding directly from molecular strings. Across classification and regression benchmarks, the representation outperformed classical fusion methods, matched or improved established molecular descriptors, retained complete embedding coverage when individual feature-generation pipelines failed, and supported efficient inference. Scaffold-based and low-data evaluations showed stable generalization across chemical space and improved utility under limited data. The framework also prioritized compounds predicted to protect genome stability, leading to experimental validation of isoeugenol and eugenyl acetate in a yeast damage-response assay. These findings establish a scalable framework for molecular prediction and discovery. This study integrates six complementary molecular representations into a distilled molecular string embedding, enabling scalable property prediction and prioritization of compounds that reduce DNA-damage phenotypes in yeast.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Scalable molecular representations enabled by multimodal fusion and sequence distillation
Date Crossref
19/09/2026
Éditeur
Springer Science and Business Media LLC
Type
journal-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • Indraprastha Institute of Information Technology Delhi Department of Computational Biology pays non établi dans la notice
    Université ou école supérieure
  • Indian Institute of Technology Delhi pays non établi dans la notice
    Université ou école supérieure

Department of Computational Biology — Indraprastha Institute of Information Technology Delhi et Indian Institute of Technology Delhi.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Computational Drug Discovery MethodsMachine Learning in BioinformaticsBioinformatics and Genomic Networks

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.