Aller au contenu principal
Accès ouvert déclaré 2026 article

Large language models as medical code selectors: a benchmark using the International Classification of Primary Care

2Citations signalées, ce qui n’est pas une note de qualité
2Institutions déclarées
2Pays d’affiliation déclarés

Rattachement africain : br, nl. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Objectives: Medical coding structures health-care data for research, quality monitoring, and policy. This study assesses the potential of large language models (LLMs) to assign International Classification of Primary Care, 2nd edition (ICPC-2) codes using the output of a domain-specific search engine. Materials and Methods: A dataset of 437 Brazilian Portuguese clinical expressions, each annotated with ICPC-2 codes, was used. A semantic search engine (OpenAI's text-embedding-3-large) retrieved candidates from 73 563 labeled concepts. Thirty-three LLMs were prompted with each query and retrieved results to select the best-matching ICPC-2 code. Performance was evaluated using F1-score, along with token usage, cost, response time, and format adherence. Results: Twenty-eight models achieved F1-score>0.8; 10 exceeded 0.85. Top performers included gpt-4.5-preview, o3, and gemini-2.5-pro. Retriever optimization can improve performance by up to 4 points. Most models returned valid codes in the expected format, with reduced hallucinations. Smaller models (<3B parameters) struggled with formatting and input length. Conclusion: Large language models show strong potential for automating ICPC-2 coding, even without fine-tuning. This work offers a benchmark and highlights challenges, but findings are limited by dataset scope and setup. Broader, multilingual, end-to-end evaluations are needed for clinical validation.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Large language models as medical code selectors: a benchmark using the International Classification of Primary Care
Date Crossref
06/01/2026
Éditeur
Oxford University Press (OUP)
Type
journal-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • Universidade de São Paulo pays non établi dans la notice
    Université ou école supérieure
  • Radboud University Nijmegen Department of Primary and Community Care pays non établi dans la notice
    Université ou école supérieure
  • University of São Paulo Medical School pays non établi dans la notice
    Université ou école supérieure
  • School of Public Health Department of Epidemiology pays non établi dans la notice
    Université ou école supérieure
  • Centre Hospitalier Neuro-Psychiatrique Rehaklinik pays non établi dans la notice
    Établissement de santé
  • No affiliation pays non établi dans la notice
    Institution

Universidade de São Paulo, Department of Primary and Community Care — Radboud University Nijmegen et Medical School — University of São Paulo, avec 3 autres affiliations.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Machine Learning in HealthcareMedical Coding and Health InformationBiomedical Text Mining and Ontologies

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.