Aller au contenu principal
Accès ouvert déclaré 2026 conference-paper

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

1Citations signalées, ce qui n’est pas une note de qualité
7Institutions déclarées
3Pays d’affiliation déclarés

Rattachement africain : cn, sg, au. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Large language models (LLMs) have shown potential in assisting scientific research, yet their ability to discover high-quality research hypotheses remains unexamined due to the lack of a dedicated benchmark.To address this gap, we introduce the first large-scale benchmark for evaluating LLMs on a sufficient set of scientific discovery sub-tasks-inspiration retrieval, hypothesis composition, and hypothesis ranking-where sufficient means that perfectly solving these sub-tasks perfectly solves the overall discovery task.We develop an automated LLM-based framework that extracts critical components-research questions, background surveys, inspirations, and hypotheses-from papers across 12 disciplines, with expert validation confirming its accuracy.To prevent data contamination, we focus exclusively on publications from 2024 onward, ensuring minimal overlap with LLM pretraining data; our automated framework further enables automatic extraction of even more recent papers as LLM pretraining cutoffs advance, supporting scalable and contamination-free automatic renewal of this discovery benchmark.Our evaluation shows that, across disciplines, LLMs excel at inspiration retrieval-an out-of-distribution task-suggesting their ability to surface novel knowledge associations.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
Date Crossref
01/01/2026
Éditeur
Association for Computational Linguistics
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • Fudan University pays non établi dans la notice
    Université ou école supérieure
  • Beijing Academy of Artificial Intelligence pays non établi dans la notice
    Institution
  • Shanghai Artificial Intelligence Laboratory pays non établi dans la notice
    Structure de recherche
  • Nanyang Technological University pays non établi dans la notice
    Université ou école supérieure
  • UNSW Sydney pays non établi dans la notice
    Université ou école supérieure
  • National University of Singapore pays non établi dans la notice
    Université ou école supérieure
  • Wuhan University pays non établi dans la notice
    Université ou école supérieure
  • University of New South Wales pays non établi dans la notice
    Université ou école supérieure

Fudan University, Beijing Academy of Artificial Intelligence et Shanghai Artificial Intelligence Laboratory, avec 5 autres affiliations.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Natural Language Processing TechniquesTopic Modeling

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.