Aller au contenu principal
Accès ouvert déclaré 2026 data-paper

A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models

0Citations signalées, ce qui n’est pas une note de qualité
6Institutions déclarées
1Pays d’affiliation déclarés

Rattachement africain : cn. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Abstract The emergence of Large Language Models (LLMs) within the Traditional Chinese Medicine (TCM) domain presents an urgent need to assess their clinical application capabilities. However, such evaluations are challenged by the individualized, holistic, and diverse nature of TCM’s “Syndrome Differentiation and Treatment” (SDT). Existing benchmarks are confined to knowledge-based question-answering or the accuracy of syndrome differentiation, often neglecting assessment of treatment decision-making. Here, we propose a comprehensive benchmark derived from clinical cases, classical case records, and authoritative examination questions. Designated TCM-BEST4SDT, the dataset comprises 600 questions covering four tasks: TCM Basic Knowledge, Medical Ethics, LLM Content Safety, and SDT. Data annotation adheres to a rigorous three-stage pipeline consisting of expert annotation, mutual cross-validation, and independent third-party review. The evaluation framework integrates three mechanisms, namely selected-response evaluation, judge model evaluation, and a specialized reward model employed to quantify prescription-syndrome congruence. Crucially, a controlled evaluation on the Qwen3 series demonstrated a strictly monotonic correlation between performance and model scale, verifying the benchmark’s sensitivity in discriminating model capabilities. This study establishes a standardized evaluation framework for intelligent TCM research, objectifies the personalized diagnostic logic of complementary medicine, and facilitates the optimization and application of large language models in digital medicine.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models
Date Crossref
03/08/2026
Éditeur
Springer Science and Business Media LLC
Type
journal-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Les institutions déclarées

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Traditional Chinese Medicine StudiesMachine Learning in HealthcareTopic Modeling

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.