Does size matter? The influence of reduct size on the performance of supervised classifiers
Résumé fourni par la source
This study investigates the role of reduct-based attribute subsets (derived from rough set theory) with respect to supervised classification performance. Considering twenty-one datasets, two representations were assessed: minimum-length reducts containing the smallest attribute sets to retain consistency, and maximum-length reducts comprising the largest irredundant subsets. A Friedman–Nemenyi test was used to assess eleven classifiers with five quality measures. For the majority of classifiers, both types of reducts systematically degrade the predictive performance when compared with using all attributes. JRIP, Logistic Regression, and MLP are consistent and have the same performance except for PRC area, where maximum-length reducts reduce performance. For SMO, minimum-length reducts perform better than maximum-length reducts. These observations show that the efficacy of reduct-based feature selection largely depends on the characteristics of classifiers; it can provide significant dimensionality reduction without loss of accuracy for some models. Spanish-language metadata / Metadatos en españolTítulo en español:¿Importa el tamaño? La influencia del tamaño del reducto en el rendimiento de los clasificadores supervisados Resumen:Este estudio investiga el papel de los subconjuntos de atributos basados en reductos, derivados de la teoría de conjuntos aproximados (rough set theory), en relación con el rendimiento de la clasificación supervisada. Considerando veintiún conjuntos de datos, se evaluaron dos representaciones: reductos de longitud mínima, que contienen los conjuntos de atributos más pequeños necesarios para conservar la consistencia, y reductos de longitud máxima, que comprenden los subconjuntos irredundantes de mayor tamaño. Se utilizó una prueba de Friedman–Nemenyi para evaluar once clasificadores mediante cinco medidas de calidad. Para la mayoría de los clasificadores, ambos tipos de reductos reducen sistemáticamente el rendimiento predictivo en comparación con el uso de todos los atributos. JRIP, Regresión Logística y MLP presentan un comportamiento consistente y muestran el mismo rendimiento, excepto en el área PRC, donde los reductos de longitud máxima reducen el rendimiento. En el caso de SMO, los reductos de longitud mínima presentan un mejor rendimiento que los reductos de longitud máxima. Estas observaciones muestran que la eficacia de la selección de características basada en reductos depende en gran medida de las características de los clasificadores; para algunos modelos, puede proporcionar una reducción significativa de la dimensionalidad sin pérdida de exactitud. Palabras Claves:reducción de dimensionalidad, reducto, clasificadores, longitud del reducto Smart citations: SciteAI. Dimensions.Open Alex.