Beyond questions: Leveraging ColBERT for keyphrase search
Rattachement africain : es, gb. Niveau de preuve : code pays fourni par la source.
Le résumé fourni par la source
While question-like queries are gaining popularity, keyphrase search is still the cornerstone of web search and other specialised domains such as academic and professional search. However, current dense retrieval models often fail with keyphrase-like queries, primarily because they are mostly trained on question-like ones. This paper introduces a novel model that employs the ColBERT architecture to enhance document ranking for keyphrase queries. For that, given the lack of large keyphrase-based retrieval datasets, we first explore how Large Language Models can convert question-like queries into keyphrase format. Then, using those keyphrases, we train a keyphrase-based ColBERT ranker ( ColBERTKP Q D ) to improve the performance when working with keyphrase queries. Furthermore, to make the model more flexible, allowing the use of both the question and keyphrase encoders depending on the query type, we investigate the feasibility of training only a keyphrase query encoder while keeping the document encoder weights static ( ColBERTKP Q ). We assess our proposals’ ranking performance using both automatically generated and manually annotated keyphrases. Our results reveal the potential of the late interaction architecture when working under the keyphrase search scenario. This study’s code and generated resources are available at https://github.com/JorgeGabin/ColBERTKP . • We reveal key weaknesses in current dense retrieval models when handling keyphrase queries. • We leverage Large Language Models (LLMs) and manual annotations to create tailored collections of keyphrase search queries for training keyphrase models. • Our experiments on seven query sets demonstrate the superior performance of keyphrase-based models in keyphrase retrieval tasks. • We demonstrate how our training strategy generalises effectively across different retrieval models. • We show how the keyphrase-based models adapt to old-fashioned title query collections.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Le contrôle bibliographique ouvert
DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.
- Titre Crossref
- Beyond questions: Leveraging ColBERT for keyphrase search
- Date Crossref
- 01/03/2026
- Éditeur
- Elsevier BV
- Type
- journal-article
Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.
Les institutions déclarées
Une affiliation ne permet pas de déduire la nationalité d’un auteur.