Hey, That’s My Data! Token-Only Dataset Inference in Large Language Models
Rattachement africain : hk, us. Niveau de preuve : code pays fourni par la source.
Le résumé fourni par la source
Large Language Models (LLMs) rely on massive training datasets, often including proprietary data, which raises concerns about unauthorized usage and copyright infringement.Existing dataset inference methods typically require access to log probabilities or other internal signals, but many modern LLMs restrict such access, motivating token-only inference approaches.We propose CatShift, a token-only dataset inference framework based on catastrophic forgetting, where models overwrite prior knowledge when trained on new data.Fine-tuning an LLM on a subset of its training data induces larger output shifts than finetuning on unseen data.CatShift compares these shifts against those from a known non-member validation set to infer whether a dataset was included in training.Experiments on both opensource and API-based LLMs show that CatShift remains effective without logit access, enabling practical protection of proprietary datasets.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Le contrôle bibliographique ouvert
DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.
- Titre Crossref
- Hey, That’s My Data! Token-Only Dataset Inference in Large Language Models
- Date Crossref
- 01/01/2026
- Éditeur
- Association for Computational Linguistics
- Type
- proceedings-article
Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.
Les institutions déclarées
Une affiliation ne permet pas de déduire la nationalité d’un auteur.