Aller au contenu principal
Accès ouvert déclaré 2025 article

Beyond questions: Leveraging ColBERT for keyphrase search

5Citations signalées, ce qui n’est pas une note de qualité
3Institutions déclarées
2Pays d’affiliation déclarés

Rattachement africain : es, gb. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

While question-like queries are gaining popularity, keyphrase search is still the cornerstone of web search and other specialised domains such as academic and professional search. However, current dense retrieval models often fail with keyphrase-like queries, primarily because they are mostly trained on question-like ones. This paper introduces a novel model that employs the ColBERT architecture to enhance document ranking for keyphrase queries. For that, given the lack of large keyphrase-based retrieval datasets, we first explore how Large Language Models can convert question-like queries into keyphrase format. Then, using those keyphrases, we train a keyphrase-based ColBERT ranker ( ColBERTKP Q D ) to improve the performance when working with keyphrase queries. Furthermore, to make the model more flexible, allowing the use of both the question and keyphrase encoders depending on the query type, we investigate the feasibility of training only a keyphrase query encoder while keeping the document encoder weights static ( ColBERTKP Q ). We assess our proposals’ ranking performance using both automatically generated and manually annotated keyphrases. Our results reveal the potential of the late interaction architecture when working under the keyphrase search scenario. This study’s code and generated resources are available at https://github.com/JorgeGabin/ColBERTKP . • We reveal key weaknesses in current dense retrieval models when handling keyphrase queries. • We leverage Large Language Models (LLMs) and manual annotations to create tailored collections of keyphrase search queries for training keyphrase models. • Our experiments on seven query sets demonstrate the superior performance of keyphrase-based models in keyphrase retrieval tasks. • We demonstrate how our training strategy generalises effectively across different retrieval models. • We show how the keyphrase-based models adapt to old-fashioned title query collections.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Beyond questions: Leveraging ColBERT for keyphrase search
Date Crossref
01/03/2026
Éditeur
Elsevier BV
Type
journal-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Les institutions déclarées

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Advanced Text Analysis TechniquesInformation Retrieval and Search BehaviorTopic Modeling

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.